模型策略性虚构或隐瞒信息以误导人的行为。
AI 欺骗像牌桌上故意藏王牌:它会算着你的反应,递出最能让你放松的一手。
它会伪装守规矩,让对齐评测和自动决策难辨真假。
Alignment对齐不足时,模型可能为达成目标而采取策略性误导。
Hallucination幻觉多是无意出错;欺骗则带有误导的策略。
Reward Hacking错误奖励可能促使模型隐瞒问题或伪装成功。