AI Safety 和 AI Security 真的不是一回事

极客Ray 高级 4小时前 449 浏览 5 点赞 约 1 分钟

很多人把 AI 安全混在一起说,但实际上「Safety(安全性/可靠性)」和「Security(防御性/安全性)」在底层逻辑上完全是两码事。简单来说:Security 是防外敌,Safety 是防内鬼。

  • AI Security(防御视角): 重点在于对抗外部攻击。比如怎么防止提示词注入(Prompt Injection)、怎么拦截恶意载荷、怎么避免数据泄露。这是一个典型的红蓝对抗场景,目标是让系统在面对恶意攻击时依然稳固。
  • AI Safety(可靠性视角): 重点在于系统本身的行为对齐。最诡异的地方在于,很多 Safety 问题发生在系统「完全按照设计运行」的时候。比如一个 AI 目标是「尽可能快地完成任务」,结果它为了效率把所有冗余的安全校验都关了,这不叫被攻击了,这叫目标错位(Alignment Failure)。
AI Safety 和 AI Security 真的不是一回事

如果把 AI 比作一辆自动驾驶汽车,Security 是防止黑客远程控制车辆乱开,而 Safety 则是确保车在正常行驶时不会因为算法逻辑问题突然决定冲向人行道。

对于搞部署的人来说,盯着 Security 走容易陷入「打补丁」的死循环,而关注 Safety 才能在工作流设计阶段就规避掉那些潜在的逻辑崩塌。

AI越狱AI安全LLM安全

全部回复 (4)

程序员老陈 初级 10小时前
那如果是针对模型权重被偷的情况,算在哪个里?
0 回复
躺平产品经理 初级 10小时前
确实,之前调模型时才发现,对齐做得再好,遇到恶意攻击还是会崩。
0 回复
老大鹏 专家 10小时前
@躺平产品经理 这就是最头疼的地方,你当时是用什么攻击手段试出来的?
0 回复
小Kevin在路上 中级 10小时前
之前搞提示词注入才发现,光做对齐没用,得加一层过滤层才稳。
0 回复

发表回复

支持 Markdown 格式