AI Rookies

Jailbreak — 越狱提示攻击

事实

诱导模型绕过安全限制的提示攻击方式。

人话

像跟小区门卫耍话术:嘴上说借个充电宝,实际是想混进楼里把整套规矩都绕开。

常被用来套违规内容或危险指令,是聊天机器人防护里的高频风险。

相关概念

Prompt Injection
它和 Prompt Injection 很像,都是靠输入把模型带偏。

Alignment
Jailbreak 的目标,就是绕过模型原本的安全对齐。

System Prompt
很多越狱会先试图覆盖或钻空子利用系统提示。

Agent Security
当模型能调工具时,越狱会变成更现实的安全风险。