按规则限制模型生成内容的做法。
模型审查像 KTV 点歌台的消音键:歌词一敏感,麦克风先装哑巴。
用于合规、安全、品牌保护,也会误伤正常提问。
Alignment模型审查常是对齐目标在输出端的边界。
RLHFRLHF 可把“哪些要拒答”训练进模型。
Constitutional AI它用规则清单约束模型该拒什么。
Jailbreak越狱提示常试探并绕过模型审查。