AI Rookies

Untrusted Model — 不可信模型

事实

将模型输出视为不可信输入的安全设计原则。

人话

把 AI 回话当代购送来的包裹:能收,先验货;别直接拿去开门付款。

隔离权限并核验输出,用于智能体和企业部署。

相关概念

AI Sandbox
沙箱将模型可触及的环境隔离,限制意外行为的影响范围。

Agent Permissions
最小权限原则避免模型获得超出任务所需的操作权。

Prompt Injection
恶意指令可能诱导模型输出危险操作,需额外核验。