能诱导模型出错的刻意微小扰动输入。
它像外卖单上偷偷改一笔字,人看着还是那份饭,系统却可能把地址菜品全认岔。
常用于安全测试,检查识别模型有多脆弱,也可能被用来攻击。
Computer Vision对抗样本最经典的场景,就是误导图像识别模型。
AI Sandbox它常在隔离环境里测试,用来观察模型会怎么被绕晕。
Alignment它暴露模型在稳健性和安全对齐上的薄弱边界。
Prompt Injection两者都在诱骗模型,只是一个改输入,一个改指令。