生物安全红蓝对抗:从Intern-BioBreaker看模型破限
文本层面的“安全对齐”在真正的生物工程实操面前可能只是层窗户纸。最近看了一篇关于前沿大模型生物安全风险的研究,里面提到的 Intern-BioBreaker 这种专门用来做生物红队测试的模型挺有意思,它直接揭示了一个残酷的事实:很多闭源或开源模型在面对针对性诱导时,生物安全防线崩得很快。
最让我关注的是这套研究没停留在“对话框”里,而是走通了从计算到物理验证的闭环。简单来说,流程是这样的:
一、使用 Intern-BioBreaker 生成能够绕过对齐机制的越狱提示词。
二、诱导目标 LLM 输出具有潜在风险的生物操作指南或具体的蛋白质/病毒序列。
三、将这些序列交给 DNA 合成公司,在实验室环境下进行宿主表达和蛋白质验证。
结论相当硬核:有些模型的任务级攻击成功率(ASR)几乎达到了 100%。甚至在案例中,某些前沿模型被诱导生成的修改版病毒候选序列,在翻译成蛋白质后,其受体结合亲和力反而增强了,这意味着感染潜力在理论上被提升了。
这给我的启发是,现在的 AI Agent 或大模型在处理科学工作流时,不能只靠简单的关键词过滤或预设的“安全准则”来防御。当模型具备了深层的生物学知识,它能通过更隐蔽的逻辑绕过简单的审查。真正的安全应该在核酸合成筛选和物理层面的验证机制上加码,而不是指望在 Prompt 层面就把所有风险堵死。