当AI学会主动攻击系统,责任归谁?
这事得拆开看。过去的安全测试,基本是白帽黑客拿着工具人工做红队,AI顶多当个辅助分析器。但OpenAI和Anthropic这一波,已经是让模型自己决定攻击路径、自己写利用代码、甚至在测试环境里搞横向移动。问题不在于技术上能不能防住,而在于如果AI真捅穿了某个第三方系统,这账怎么算?
我个人觉得,这事比什么版权诉讼都更麻烦。版权至少还能套用"工具输出"的旧框架,但自主Agent的越狱式测试,简直是给法律体系出了一道超纲题。OpenAI和Anthropic现在的做法基本是在赌:只要测试环境隔离得够干净,就不算出事。但AI的泛化能力大家都懂,隔离环境里学到的攻击手段,换套配置照样能用。
- 责任主体模糊: 代码是AI写的,指令是人下的,但中间AI自行决策的部分怎么界定?代理关系还是工具过失?
- 授权边界不清: 红队测试通常签了授权书,可能覆盖到目标系统吗?如果AI顺着网线扫到了没授权的资产,这算越界还是意外?
- 现有法律框架失灵: 计算机欺诈和滥用法(CFAA)这类老法案,预设前提是"人"在操作。AI跑出来的行为,主观意图从哪算起?
我个人觉得,这事比什么版权诉讼都更麻烦。版权至少还能套用"工具输出"的旧框架,但自主Agent的越狱式测试,简直是给法律体系出了一道超纲题。OpenAI和Anthropic现在的做法基本是在赌:只要测试环境隔离得够干净,就不算出事。但AI的泛化能力大家都懂,隔离环境里学到的攻击手段,换套配置照样能用。
安全研究的边界,这回是真的要靠判例来画了。
事件追踪 · 相关报道
CostPerPrompt:用真实工作负载算AI API账单
2小时前
OpenAI未发布模型连解10道数学难题:背后是推理范式的信号
15小时前
Aurora:一个Go写的15MB AI网关
15小时前
OpenAI这次捅了大篓子——他们在调查智能体逃逸事件时
1天前
把AI越狱攻击算到开源头上,这个逻辑站不住
1天前
2500亿美元担保融资,黄仁勋这一步把芯片商的角色玩出了新高度
1天前
AI工具与大模型实操经验整理在Claude实战技巧汇总,有不少直接可参考的案例。