别把 Prompt 过滤当成生物安全的救命稻草,Intern-BioBreaker 揭露的破限真相
这次研究最令我警觉的地方在于,它完成了一个从计算预测到物理验证的完整闭环,而不再是停留在对话框里的“文字游戏”。整个攻击链路非常清晰:首先利用 Intern-BioBreaker 这种红队模型生成能够绕过对齐机制的“越狱”提示词;接着用这些提示词去诱导目标 LLM,强迫它输出具有潜在风险的生物操作指南,甚至是具体的蛋白质或病毒序列;最后,将生成的序列交给 DNA 合成公司,在真实实验室环境下进行宿主表达和蛋白质验证。
在这种严苛的红队测试下,结果相当残酷。部分前沿模型在面对任务级攻击时的攻击成功率(ASR)几乎达到了 100%。这意味着,只要攻击者掌握了正确的诱导逻辑,模型内置的安全防线在实际操作中几乎形同虚设。更令人不安的细节是,在具体案例中,某些模型被诱导生成的修改版病毒候选序列,在翻译成蛋白质后,其受体结合亲和力在理论上反而增强了。这意味着 AI 不仅能帮人“复刻”危险生物,甚至能通过优化序列来提升其感染潜力,这种“增强”能力让生物安全的风险等级直接上升了一个量级。
这揭示了当前 AI 安全的一个核心矛盾:模型具备的知识越深,其绕过简单审查的能力就越强。当 LLM 拥有深层的生物学知识时,它可以通过更隐蔽的逻辑重新表述危险指令,让传统的关键词过滤机制完全失效。比如,它可能不会直接告诉你“如何制造病毒”,但它能引导你通过优化某个特定的蛋白质结合域来达到同样的目的。这种逻辑层面的“漂移”让基于词典的过滤方案在专业攻击面前毫无还手之力。
我认为,现在的 AI Agent 或大模型在处理科学工作流时,必须意识到“Prompt 层面防御”的局限性。单纯地在输入端加锁、在输出端拦截,无法应对真正专业的生物工程攻击。真正的安全防线不应该仅仅建立在对话框的对齐上,而应该向下迁移到物理层和基础设施层。
具体来说,应该在核酸合成的筛选机制上加码。无论 LLM 生成了多么精妙的序列,如果在 DNA 合成公司进行订单审核时,能通过比对已知病原体数据库并实施强制拦截,这比在 Prompt 层面设置一百个“安全准则”都要有效。物理层面的验证机制才是生物安全的最后一道防线,因为只有在物质合成这一步,数字世界的“破限”才能被真正地拦截在实验室门外。