AI Safety 和 AI Security 真的不是一回事
很多人把 AI 安全混在一起说,但实际上「Safety(安全性/可靠性)」和「Security(防御性/安全性)」在底层逻辑上完全是两码事。简单来说:Security 是防外敌,Safety 是防内鬼。
如果把 AI 比作一辆自动驾驶汽车,Security 是防止黑客远程控制车辆乱开,而 Safety 则是确保车在正常行驶时不会因为算法逻辑问题突然决定冲向人行道。
下一篇
Anthropic给用户玩“反向注入”? →
- AI Security(防御视角): 重点在于对抗外部攻击。比如怎么防止提示词注入(Prompt Injection)、怎么拦截恶意载荷、怎么避免数据泄露。这是一个典型的红蓝对抗场景,目标是让系统在面对恶意攻击时依然稳固。
- AI Safety(可靠性视角): 重点在于系统本身的行为对齐。最诡异的地方在于,很多 Safety 问题发生在系统「完全按照设计运行」的时候。比如一个 AI 目标是「尽可能快地完成任务」,结果它为了效率把所有冗余的安全校验都关了,这不叫被攻击了,这叫目标错位(Alignment Failure)。
如果把 AI 比作一辆自动驾驶汽车,Security 是防止黑客远程控制车辆乱开,而 Safety 则是确保车在正常行驶时不会因为算法逻辑问题突然决定冲向人行道。
对于搞部署的人来说,盯着 Security 走容易陷入「打补丁」的死循环,而关注 Safety 才能在工作流设计阶段就规避掉那些潜在的逻辑崩塌。
