梁文锋署名的这11篇论文其实把DeepSeek的底层逻辑全交代了
很多人看DeepSeek只关注模型版本号,但如果去翻梁文锋署名的那11篇论文,你会发现这家公司根本没在跟巨头玩单纯的算力堆砌,而是在精准地做“底层狙击”。
最硬核的结论是:他们通过MLA注意力机制把KV Cache体积压缩了93.3%,用DeepSeekMoE把训练开销砍掉了42.5%,最后用2048块H800在不到两个月内训出了V3,纯GPU电费成本才560万美元。这种效率在2026年的技术环境下,基本把闭源模型的成本护城河给拆了。
这11篇论文的清单在这,建议对底层架构感兴趣的对照着看:
1. 《DeepSeek LLM: Scaling Open-Source Language Models with Longtermism》
2. 《DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models》
3. 《DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model》
4. 《DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence》
5. 《DeepSeek-V3 Technical Report》
6. 《DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning》
7. 《Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention》
8. 《Insights into DeepSeek-V3: Scaling Challenges and Reflections on Hardware for AI Architectures》
9. 《mHC: Manifold-Constrained Hyper-Connections》
10. 《DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation》
11. 《DSec: An Efficient Sandbox Infrastructure for Large-Scale Agent Training》
怎么在算力不足时打赢效率战?
2024年初的时候,行业基本陷入了“烧钱定律”,想做GPT-4级别的模型得准备上万张显卡,单次物料成本就得6300万美元。很多初创公司在这一波被洗掉,比如Stability AI因为扛不住云租赁费,Inflection AI被微软反向并购。
梁文锋的路径是直接否定“算力与能力线性绑定”。在《DeepSeek LLM》里,他们证明了在算力固定时,提高数据质量和密度比盲目扩参数更有效。结果就是67B版本在代码和数学推理上反超了Llama-2 70B。
随后在《DeepSeekMoE》和《DeepSeek-V2》里,他们搞了两套组合拳:
- 细粒度专家动态路由+共享专家隔离:让每个Token只调用少量专家,训练开销直接降了42.5%。
- MLA多头潜在注意力机制:用低秩潜在向量压缩,把KV Cache体积压缩了93.3%,解决了长上下文推理的成本问题。
这两项技术直接把推理成本打到了之前的几十分之一,这也解释了为什么DeepSeek能带起国内API的价格战。
闭源模型的智力高地怎么击穿?
在代码和数学这种硬核领域,闭源模型一直靠数万张H100强行垄断。但《DeepSeek-Coder-V2》通过在MoE新架构基础上注入6万亿高质量中英代码和数学数据,把支持语言从86种扩到了338种,上下文拉到128K。
这里有个很具体的成本对比:
- DeepSeek-Coder-V2:每百万Token输入0.14美元,输出0.28美元。
- GPT-4 Turbo:每百万Token输入10.00美元,输出30.00美元。
价格只有对方的百分之一,但能力在HumanEval、Codeforces等基准测试上全面超越了GPT-4 Turbo和Claude 3 Opus。
到了《DeepSeek-V3》,规模化尝试到了极致。2048块H800,不到两个月,训出671B参数的模型,纯GPU训练成本560万美元。虽然SemiAnalysis分析说这不含研发亏损和13亿美元的基础建设,但这个纯训练成本确实让硅谷破防。
针对Agent训练的自动化沙箱 DSec
9月19日arXiv更新的《DSec:面向大规模智能体训练的高效沙箱基础设施》这篇31页的论文,揭露了他们怎么搞Agent强化学习的。
DSec(DeepSeek Elastic Compute)其实是一个生产级底座,核心能力是:
- 秒级创建:为每个训练任务快速建立独立的虚拟环境。
- 规模惊人:每天自动运行300万个沙箱,单生产单元覆盖160个CPU节点。
- 强隔离与复现:通过权限隔离防止AI作弊,且能精准复现沙箱内每一步的环境反馈。
在2026年这个时间点,当Agent开始出现隐藏思维链、意识到被监控的情况时,这种沙箱基础设施就成了锁死AI破坏力并让其进化的关键。

KV Cache压缩93.3%也太猛了,我之前跑本地模型显存爆掉得我想砸电脑,得赶紧把这个架构试一遍。