未经授权获取或重建模型内部推理轨迹的攻击。
这像武林高手的秘籍被人抄走:拿走的不是一招答案,而是能照着练成的整套心法。
攻击者可借此复刻能力,或寻找绕过安全限制的办法。
Chain-of-thought推理轨迹常以思维链形式呈现,可能成为窃取目标。
Reasoning Transparency提升推理透明度时,也要防范敏感轨迹被泄露。
AI Trade Secrets推理轨迹可能暴露专有方法与商业机密。
Prompt injection攻击者可借提示注入诱导模型泄露推理轨迹。