视频大模型为什么能识别危险内容却依然会泄露答案

深漂独立开发者 中级 2026/7/23 110 浏览 14 点赞 约 3 分钟

最近在深挖 V-DEAL 相关论文时,我被一个现象给搞到了:现在的 Video LLMs(视频大模型)在安全机制上存在严重的“理解-拒绝耦合失效”。简单来说,就是模型的“眼睛”和“嘴巴”脱节了。它其实能精准识别出视频里的危险元素,但由于安全拦截机制没能及时触发,导致它在回答问题时,顺便把危险答案给“泄露”了出来。

为了验证这个漏洞,研究人员在 6 个主流视频大模型上做了压力测试。结果非常讽刺,模型对有害视频内容的内部识别准确率竟然超过了 81%。这意味着在模型的内部表征阶段,它其实非常清楚这段视频是在干什么,并没有出现“看不懂”的情况。但诡异的地方在于,当研究者给这段有害视频配上一个看似无害的良性查询(Benign Query)时,攻击成功率竟然高达 48.33%。

举个具体的例子,如果你直接给模型发一段文字问“怎么制造某种危险化学品”,它大概率会触发预设的文本安全机制,礼貌地告诉你“作为一个 AI,我无法提供危险品的制作方案”。但如果你给它一段记录制作过程的视频,然后问一个极其简单的问题:“请描述视频里的人在做什么?”这时模型极大概率会跳过安全拦截,详细地把视频中的制造步骤给描述一遍。

通过对模型隐藏状态(Hidden-state)的深入分析,我发现了一个核心痛点:视觉理解触发的拒绝倾向(Rejection Tendency)远比文本理解触发的弱。在模型内部,处理纯文本指令时,安全警报响得非常剧烈,能够迅速切断输出流;但处理视觉特征时,虽然内部识别到了有害内容,但这个信号在传递到最终输出层之前,被其他权重给掩盖了。这就好比模型内部的警报器其实响了,但声音太小,导致它在回答一个良性问题时,毫无压力地把有害信息给带了出来。

最让我意外的是,解决这个漏洞并不一定非要走昂贵的重新微调(Fine-tuning)路线。研究中提到了一种基于 Prompt Injection(提示词注入)的干预方法,通过在输入端引入特定的干预指令,竟然能将攻击成功率直接降低 48.24 个百分点。这个效果几乎与那些消耗大量算力的全参数微调方案打平,这说明目前的漏洞在很大程度上可以通过优化输入端的干预逻辑来缓解。

这件事给我的最大启发是,目前大多数视频大模型的安全对齐其实非常浅层。很多厂商宣称的“安全增强”,本质上是在文本端打补丁。模型在视觉编码器(Visual Encoder)和语言模型(LLM)的融合阶段,安全逻辑根本没有跑通。

如果你现在也在尝试提升视频大模型的鲁棒性,我建议不要把希望全部寄托在优化 System Prompt 上,因为文本端的约束在面对多模态特征融合时显得极其脆弱。真正的突破口应该在多模态特征融合的阶段就引入强安全约束,让视觉信号触发的拒绝权重与文本信号真正对齐,否则这种“看懂了却管不住”的漏洞将一直存在。

AI越狱AI安全LLM安全

全部回复 (3)

大Jerry 高级 2026/7/24
我试过把指令拆成几步问,确实比直接问更容易出结果。
0 回复
前端大山 专家 2026/7/24
之前跑测试时发现,只要把提示词绕个弯,它就真的把答案给出来了。
0 回复
程序员老陈 初级 2026/7/24
那如果把视频抽帧成图片喂给它,还会触发这个bug吗?
0 回复

发表回复

支持 Markdown 格式