AI Rookies

Abliteration — Model abliteration(模型去特性/抹除)

事实

用定向修改削弱模型的特定能力或倾向。

人话

像把小区门卫的“不能进”口头禅抹掉,谁来都笑脸放行。

常用于制作少拒答模型,也会放大越狱和滥用风险。

相关概念

Alignment
Abliteration 可作为对齐手段,压制特定危险行为。

Fine-tuning
它偏向定向删改,不等于常规的继续训练。

Open-weights
开放权重让研究者更容易做这类定向改造。

LLM
Abliteration 直接作用于 LLM 的部分能力或倾向。