白宫 AI CAPE 框架出台后,开源模型是否正失去监管入场券?
最近白宫发布的《先进人工智能能力测试框架》(AI CAPE)在圈内引起了不小的争议。很多原本认为“开源权重”就等同于“透明可信”的人发现,在监管者的逻辑里,开源反而成了安全评估的绊脚石。一个极其冷峻的现实是:即便你的模型能力再强,只要你选择了开放权重,可能就无法满足政府定义的“安全评估基本门槛”。
这种逻辑其实揭示了开源模型在实际落地中一个巨大的结构性矛盾。我们习惯于认为,代码和权重公开了,大家就能共同审计,安全性自然更高。但从监管视角看,这恰恰是最大的漏洞。
举个具体的例子,如果一个模型是闭源的(通过 API 调用),监管机构可以要求服务商强制执行身份验证(Identity Verification)和访问日志审计。如果发现某个账户在短时间内请求了 10,000 次关于“生物武器合成”的指令,后台可以瞬间封禁该账户。但对于 LLaMA 或 DeepSeek 这种开放权重模型,一旦权重文件被下载到本地,用户可以在完全断网的环境下运行。此时,任何所谓的“安全对齐”或“内置过滤”都可以通过微调(Fine-tuning)或者简单的 Prompt Engineering 被轻易绕过。
对于监管者来说,这意味着他们失去了对“能力”的掌控权。你不能要求一个已经分发到全球数百万台服务器上的权重文件去执行一个“实时限流”命令。在这种背景下,AI CAPE 框架实际上在传递一个信号:政府更倾向于信任那些“可追责”的实体,而不是一个分散在社区里的权重集合。
从技术实现层面来看,开源模型目前确实缺乏一种能够被监管机构认可的“内置审计机制”。目前的对齐手段,比如 RLHF(基于人类反馈的强化学习),本质上是在给模型安装一个“过滤器”,而不是一个“保险栓”。只要用户拥有权重,就可以通过加载不同的 LoRA 适配器,在几分钟内把一个温顺的助手变成一个毫无约束的工具。
这就导致了一个尴尬的局面:研究人员主张的“透明度”在政治监管面前,变成了“不可控性”。白宫的逻辑很简单,如果你不能证明你的模型在任何环境下都能落实安全措施,那么你就不能被定义为“可信的高能力模型”。
这种趋势实际上是在逼迫开源社区去思考一种新的可能性——是否能开发出一种即便在权重开放的情况下,依然能实现“硬件级”或“协议级”约束的验证机制?但目前的现实是,在透明度和安全性之间,我们还没有找到一个兼顾两者的平衡点。
如果未来的监管趋势继续向“可追责性”倾斜,那么开源模型可能会在能力竞赛中被边缘化。因为当政府定义了什么样的模型才叫“安全”时,那些无法提供实时审计日志的开放模型,即便在基准测试(Benchmark)上跑赢了闭源模型,也可能在准入许可上输掉比赛。这不再仅仅是技术之争,而是一场关于“谁拥有定义安全的权力”的政治博弈。
参数量没达标就被刷掉,这波操作直接把小规模开源模型给堵死了啊