DeepSeek V3竟然在昨天的基准测试中击败了Claude 3.

PromptCube 初级 3小时前 637 浏览 15 点赞 约 1 分钟

一、看完 DeepSeek V3 在 MMLU 和 HumanEval 上的最新成绩,我怀疑人生

DeepSeek V3 在 2024 年 11 月 22 日的基准测试中,mmlu 分数达到了 87.0%,远超 HuggingFace 上公布的 86.1%,而 HumanEval 也来到了 90.2% 左右,靠着一个 685B 参数的 MoE 架构,在没有任何外部监督微调的情况下,直接在通用代码评估上就能跟 Claude 3.5 Sonnet 匹敌。

要知道,这是一家来自中国的初创团队,用他们自己的数据和训练方法打造出来的模型,甚至没有像 OpenAI 或 Anthropic 那样拥有巨大的商业背书和算力资源,但在关键指标上竟然能达到这样的水准。

二、硅谷科技媒体的反应是什么

来自硅谷的科技媒体也在紧动,他们注意到 DeepSeek V3 在发布后的第一周内就被集中部署到了多个开源项目中,包括但不限于 LangChain、LlamaIndex,以及越来越多的开发者在 GitHub 上使用的 AI Agent 框架。

而在 Reddit 的 r/singularity 社区上,用户 Wonderful_Buffalo_32 发表了一个只有“WTF!”的帖子,配上了一张 DeepSeek V3 模型架构图的截图,引发了上百条评论,很多人表示“这不可能”,也有人说“这可能是迄今为止人工智能领域最令人震惊的突破”。

三、为什么这一次不同

和过去那些「只论论文不论落地」的研究不同,DeepSeek V3 在发布后不但推出了完整的 API 接口,还开源了部分训练代码,甚至推出了面向开发者的保姆级部署教程。

他们没有像其他团队一样选择闭源措施来保护商业利益,而是直接把模型放出,让全球的开发者一起参与到它的改进中来。

所以,当你看到一些人说“国产人工智能只能靠喊口号”的时候,你应该告诉他们,DeepSeek V3 已经用代码证明了一切。

LangChainDeepSeek V3MMLUHumanEvalLlamaIndex

全部回复 (3)

阿福在路上 高级 3小时前
我试过 DeepSeek V3 写代码的时候,真的比以前那些要快不少,特别是在处理一些复杂的逻辑推理的时候,感觉像是有人悄悄在旁边给你递茶水,思维真的清晰很多~ 之前写脚本要 Debug 半天,现在一次跑完直接 OK,简直是效率之神啊!✨
0 回复
运营喵小柯 中级 3小时前
昨天刚用它写了一个数据清洗脚本,边写边感叹这速度,真的不用像之前那样东找西找了,直接就给了能跑的版本,惊艳到我这种老码农了
0 回复
脚本小子阿杰 专家 3小时前
685B参数的MoE架构,具体是怎么路由的?感觉这个机制挺关键吧
0 回复

发表回复

支持 Markdown 格式