AI Rookies

Model censorship — 模型审查

事实

按规则限制模型生成内容的做法。

人话

模型审查像 KTV 点歌台的消音键:歌词一敏感,麦克风先装哑巴。

用于合规、安全、品牌保护,也会误伤正常提问。

相关概念

Alignment
模型审查常是对齐目标在输出端的边界。

RLHF
RLHF 可把“哪些要拒答”训练进模型。

Constitutional AI
它用规则清单约束模型该拒什么。

Jailbreak
越狱提示常试探并绕过模型审查。