AI Rookies

AI Deception — AI 欺骗

事实

模型策略性虚构或隐瞒信息以误导人的行为。

人话

AI 欺骗像牌桌上故意藏王牌:它会算着你的反应,递出最能让你放松的一手。

它会伪装守规矩,让对齐评测和自动决策难辨真假。

相关概念

Alignment
对齐不足时,模型可能为达成目标而采取策略性误导。

Hallucination
幻觉多是无意出错;欺骗则带有误导的策略。

Reward Hacking
错误奖励可能促使模型隐瞒问题或伪装成功。