诱导模型绕过安全限制的提示攻击方式。
像跟小区门卫耍话术:嘴上说借个充电宝,实际是想混进楼里把整套规矩都绕开。
常被用来套违规内容或危险指令,是聊天机器人防护里的高频风险。
Prompt Injection
它和 Prompt Injection 很像,都是靠输入把模型带偏。
Alignment
Jailbreak 的目标,就是绕过模型原本的安全对齐。
System Prompt
很多越狱会先试图覆盖或钻空子利用系统提示。
Agent Security
当模型能调工具时,越狱会变成更现实的安全风险。