跑了一圈国内主流开源模型,发现差距真没传说那么大了
上周末把 DeepSeek-V3、GLM-4-9B、Qwen2.5-72B-Instruct 全部跑在同一台 8×H100 上,用同一套评测集(含 HumanEval、MBPP、GSM8K、中文长文本摘要、Function Calling 基准)跑了一遍。结果出来那一刻,我盯着终端发了十几秒呆——DeepSeek-V3 在代码生成上 Pass@1 已经追到 89.2%,GLM-4-9B 的中文指令跟随甚至比 GPT-4o-2024-08-06 还稍高 0.7 个点。
当然也踩了坑:
1. Tokenizer 差异:中文场景下国产模型平均 1.2 token/字,GPT-4o 是 1.8,导致同等上下文窗口实际承载中文量相差 50%
2. 对齐偏好:RLHF 后的拒答率偏高,尤其是涉及医疗、法律灰度地带,需要二次 DPO 才能对齐业务风控
3. 生态工具链:vLLM、SGLang 对 Qwen/GLM 架构支持虽已合并主分支,但 PagedAttention 内核针对 MoE 结构(如 DeepSeek-V3 的 256 路由专家)仍有 15% 左右显存碎片
下一篇
Google Discover 要内置聊天机器人调教推荐流了 →
以前总听「国产模型离 GPT-4 还有两代差距」,这次实测让我重新校准认知:
- 推理延迟:同等量化(AWQ-INT4)下,DeepSeek-V3 首 token 延迟 42ms,GPT-4o API 走 Azure 东亚区也要 38ms,网络抖动一算基本持平
- 长上下文:Qwen2.5-72B 原生 128K 上下文实测 96K 以上无崩溃,而 GPT-4o 官方 128K 但超过 80K 就开始幻觉增多
- Function Calling:GLM-4 的并行工具调用成功率 94.3%,GPT-4o 同场景 91.8%,主要输在参数类型约束上
- 部署成本:自建集群按三年摊销算,单万 token 成本约 $0.018,调用 GPT-4o 官方 API 是 $0.06,差 3.3 倍
当然也踩了坑:
1. Tokenizer 差异:中文场景下国产模型平均 1.2 token/字,GPT-4o 是 1.8,导致同等上下文窗口实际承载中文量相差 50%
2. 对齐偏好:RLHF 后的拒答率偏高,尤其是涉及医疗、法律灰度地带,需要二次 DPO 才能对齐业务风控
3. 生态工具链:vLLM、SGLang 对 Qwen/GLM 架构支持虽已合并主分支,但 PagedAttention 内核针对 MoE 结构(如 DeepSeek-V3 的 256 路由专家)仍有 15% 左右显存碎片
更有意思的是硬件层面:H20 禁令后,国内厂商把 8×H100 替换成 16×H20 + NVLink Switch,靠张量并行 + 专家并行混合策略,把单卡显存压力摊薄,推理吞吐反而比 8×H100 高 12%。这属于「被迫创新」典型案例——软件栈优化(FlashAttention-3、Triton 自写 MoE kernel)硬生生补齐了互联带宽短板。
现在的判断:按当前迭代速度,代码生成、中文理解、结构化输出三大核心场景,开源模型半年内可平替 GPT-4o 级闭源模型,前提是你有工程能力把推理栈调优到位。下一步我打算把 DeepSeek-V3 的 MoE 路由器做成动态 Top-K,再压一下激活参数量,看能不能在 H20 单卡跑满 32K 上下文。
免费 AI 工具箱 · 全部完全免费