跑分数据变差就一定意味着模型退化了吗?不一定。
我看到一个挺有意思的实测案例,对方用 Qwen3-Omni-30B-A3B-Instruct 在巴巴多斯(Barbados)的报纸数据集上做了 LoRA 微调。结果在三个不同的评测维度下,模型给出的反馈完全打架:知识探测显示 V4 版本大幅领先,音频提取质量翻倍,但到了 TikTok 短视频提取任务上,V4 的 F1 分数反而比 V3 差。
我觉得这事儿挺讽刺的:从跑分来看 V4 表现更差,但从实际可用性来看,V4 捕捉信息的能力其实更强,只是它太“勤快”了,把很多非关键信息也给提取出来了。
下一篇
用 Java 从零手搓 MiniGPT 的第二步 →
这种现象其实揭示了目前很多 Benchmark 的局限性。
具体对比来看:
- 文本知识探测: V4 完胜,在当地事实知识上的得分比基座模型高了 13.3 个百分点。这证明了领域知识确实灌进去了。
- 广播音频提取: 这是一个极端的实战场景。V4 能够把音频里的 "Rice Together" 正确识别为当地活动 "Rise Together"。这种对专有名词的修正,是单纯靠通用大模型很难实现的,也是微调的核心价值。
- TikTok 提取: V4 出现了严重的“过度输出”。比如一段 65 秒的游船视频,V3 只提取了 1 个观察结果,而 V4 吐出了 9 个。虽然 V4 找回了 V3 漏掉的正样本,但它把所有正向评价都强行拆成 JSON 对象输出,导致假阳性(False Positives)激增,跑分直接被拉低。
我觉得这事儿挺讽刺的:从跑分来看 V4 表现更差,但从实际可用性来看,V4 捕捉信息的能力其实更强,只是它太“勤快”了,把很多非关键信息也给提取出来了。

这再次证明了,如果只盯着某个指标看,很容易得出错误的结论。很多时候,模型能力的提升会伴随着某种形式的“噪音”增加,而传统的评测集往往无法区分这种噪音是真正的幻觉,还是仅仅因为模型变得更敏感了。
如果你在做垂直领域微调,建议至少准备三套完全不同维度的验证集,否则你可能在模型真正变强的时候,因为一个糟糕的跑分结果而把它给毙了。
