AI Rookies

Adversarial Example — Adversarial Example(对抗样本)

事实

能诱导模型出错的刻意微小扰动输入。

人话

它像外卖单上偷偷改一笔字,人看着还是那份饭,系统却可能把地址菜品全认岔。

常用于安全测试,检查识别模型有多脆弱,也可能被用来攻击。

相关概念

Computer Vision
对抗样本最经典的场景,就是误导图像识别模型。

AI Sandbox
它常在隔离环境里测试,用来观察模型会怎么被绕晕。

Alignment
它暴露模型在稳健性和安全对齐上的薄弱边界。

Prompt Injection
两者都在诱骗模型,只是一个改输入,一个改指令。