视频大模型有个很诡异的Bug:你直接问它怎么制造危险品
分享一个关于 V-DEAL 研究的发现,这个现象被定义为“理解-拒绝耦合失效”。简单来说,现在的 Video LLMs 在处理视频时,视觉理解和安全拒绝机制是脱节的。
下一篇
OpenClaw 应对间接提示词注入的防御实战 →
研究者在六个视频大模型上做了测试,结果挺讽刺的:模型对有害视频内容的识别准确率超过了 81%,也就是说它其实“知道”这段视频有问题。但诡异的是,当有害视频配上一个良性查询时,攻击成功率竟然高达 48.33%。
通过分析隐藏状态(Hidden-state)可以发现,视觉理解触发的拒绝倾向比文本理解弱得多。这意味着模型在看到有害画面时,内部的“警报”没响,或者响得不够大,导致它在回答良性问题时顺便把有害信息给泄露出来了。
针对这个漏洞,研究中提到了一种 Prompt Injection(提示词注入)的干预方法,不需要重新微调模型就能把攻击成功率降低 48.24 个百分点,效果居然能跟那些昂贵的 Fine-tuning 方法打平。
这给我的启发是,现在的视频模型安全对齐还停留在比较浅的层面,很多所谓的“安全”只是在文本端打补丁,视觉端的安全逻辑还没跑通。如果想在实战中提升视频大模型的鲁棒性,单纯靠优化 System Prompt 可能不够,得在多模态特征融合的阶段就引入更强的安全约束。