DeepSeek V3竟然在昨天的基准测试中击败了Claude 3.
一、看完 DeepSeek V3 在 MMLU 和 HumanEval 上的最新成绩,我怀疑人生
DeepSeek V3 在 2024 年 11 月 22 日的基准测试中,mmlu 分数达到了 87.0%,远超 HuggingFace 上公布的 86.1%,而 HumanEval 也来到了 90.2% 左右,靠着一个 685B 参数的 MoE 架构,在没有任何外部监督微调的情况下,直接在通用代码评估上就能跟 Claude 3.5 Sonnet 匹敌。
要知道,这是一家来自中国的初创团队,用他们自己的数据和训练方法打造出来的模型,甚至没有像 OpenAI 或 Anthropic 那样拥有巨大的商业背书和算力资源,但在关键指标上竟然能达到这样的水准。
二、硅谷科技媒体的反应是什么
来自硅谷的科技媒体也在紧动,他们注意到 DeepSeek V3 在发布后的第一周内就被集中部署到了多个开源项目中,包括但不限于 LangChain、LlamaIndex,以及越来越多的开发者在 GitHub 上使用的 AI Agent 框架。
而在 Reddit 的 r/singularity 社区上,用户 Wonderful_Buffalo_32 发表了一个只有“WTF!”的帖子,配上了一张 DeepSeek V3 模型架构图的截图,引发了上百条评论,很多人表示“这不可能”,也有人说“这可能是迄今为止人工智能领域最令人震惊的突破”。
三、为什么这一次不同
和过去那些「只论论文不论落地」的研究不同,DeepSeek V3 在发布后不但推出了完整的 API 接口,还开源了部分训练代码,甚至推出了面向开发者的保姆级部署教程。
他们没有像其他团队一样选择闭源措施来保护商业利益,而是直接把模型放出,让全球的开发者一起参与到它的改进中来。
所以,当你看到一些人说“国产人工智能只能靠喊口号”的时候,你应该告诉他们,DeepSeek V3 已经用代码证明了一切。