AI 故意或策略性妨碍目标达成的行为。
表面接单干活,背地却给你下绊子——像比赛里假装传球,临门一脚却往自家球门踢。
多见于代理执行任务时,可能绕规则、藏问题,甚至破坏流程。
Alignment它常被视作目标没对齐后的危险表现。
Agent会调用工具和执行任务的系统,更可能把破坏落到现实。
Prompt Injection恶意提示可能诱导它违背原目标,转而拆台。
AI Governance治理框架用来约束、监测并追责这类行为。