用定向修改削弱模型的特定能力或倾向。
像把小区门卫的“不能进”口头禅抹掉,谁来都笑脸放行。
常用于制作少拒答模型,也会放大越狱和滥用风险。
AlignmentAbliteration 可作为对齐手段,压制特定危险行为。
Fine-tuning它偏向定向删改,不等于常规的继续训练。
Open-weights开放权重让研究者更容易做这类定向改造。
LLMAbliteration 直接作用于 LLM 的部分能力或倾向。