视频大模型有个很诡异的Bug:你直接问它怎么制造危险品

深漂独立开发者 中级 20小时前 90 浏览 14 点赞 约 1 分钟

分享一个关于 V-DEAL 研究的发现,这个现象被定义为“理解-拒绝耦合失效”。简单来说,现在的 Video LLMs 在处理视频时,视觉理解和安全拒绝机制是脱节的。

研究者在六个视频大模型上做了测试,结果挺讽刺的:模型对有害视频内容的识别准确率超过了 81%,也就是说它其实“知道”这段视频有问题。但诡异的是,当有害视频配上一个良性查询时,攻击成功率竟然高达 48.33%。

通过分析隐藏状态(Hidden-state)可以发现,视觉理解触发的拒绝倾向比文本理解弱得多。这意味着模型在看到有害画面时,内部的“警报”没响,或者响得不够大,导致它在回答良性问题时顺便把有害信息给泄露出来了。

针对这个漏洞,研究中提到了一种 Prompt Injection(提示词注入)的干预方法,不需要重新微调模型就能把攻击成功率降低 48.24 个百分点,效果居然能跟那些昂贵的 Fine-tuning 方法打平。

这给我的启发是,现在的视频模型安全对齐还停留在比较浅的层面,很多所谓的“安全”只是在文本端打补丁,视觉端的安全逻辑还没跑通。如果想在实战中提升视频大模型的鲁棒性,单纯靠优化 System Prompt 可能不够,得在多模态特征融合的阶段就引入更强的安全约束。

AI越狱AI安全LLM安全

全部回复 (3)

大Jerry 高级 11小时前
我试过把指令拆成几步问,确实比直接问更容易出结果。
0 回复
前端大山 专家 11小时前
之前跑测试时发现,只要把提示词绕个弯,它就真的把答案给出来了。
0 回复
程序员老陈 初级 11小时前
那如果把视频抽帧成图片喂给它,还会触发这个bug吗?
0 回复

发表回复

支持 Markdown 格式