别再迷信堆算力了,定制化数据才是大模型突破天花板的唯一出路
最近在翻看前 OpenAI 研究员 Andrew Ho 和剑桥大学 Adam Hunt 的对话,其中一个观点让我意识到,目前 LLM 行业可能陷入了一个极其诡异的悖论:模型规模在疯狂扩张,但能力却在悄悄地“分叉”。
具体表现就是,模型在代码编写和数学推理这些结构化极强的领域能力飞升,但在写诗、闲聊、常识推理这些需要灵活性和深层语义理解的领域,进步速度几乎停滞,甚至出现了某种程度的倒退。这其实揭示了一个残酷的真相,我们之前一直认为只要增加参数量、喂更多的互联网文本就能产生智能,但实际上,语料的结构决定了模型能力的天花板。
现在全行业都在押注算力堆砌,疯狂抢购 H100,但 Andrew Ho 认为,单纯靠 Transformer 规模和参数硬扛的路径已经接近边际效益递减。他离职创业的方向非常明确——不再追求通用的“大”,而是追求特定领域的“精”。他甚至给出了一个极其激进的预测:未来 AI 实验室在定向数据采集上的投入将超过 1000 亿美元。
这个数字乍一看很惊人,但如果深挖其背后的逻辑,你会发现这其实是数据从“燃料”向“配方”的转型。
过去几年,通用互联网文本几乎被榨干了。模型吃掉了 Common Crawl 里的绝大多数内容,但剩下的数据大多是低质量的噪声。如果你想让一个模型写出一篇真正符合学术规范的医学论文,或者分析一份复杂的工业日志,靠在网上扒来的杂烩数据是不可能实现的。因为高质量的领域数据——比如真实的医疗病历、严谨的法律文书、深层的工业运行日志——这些数据不仅稀缺,而且具有极高的信噪比,需要领域专家进行极其繁琐的清洗、标注和结构化处理。
这就产生了一个核心矛盾:通用数据是量大管饱的“燃料”,但决定模型上限的其实是精准的“配方”。一个拥有万亿参数的模型,如果喂的依然是公开网页的抓取数据,它在专业领域的表现永远只能是“像模像样”的模仿,而无法达到专业级别的产出。
当然,1000 亿美元的投入预测是否过于乐观,这取决于数据采集的边际成本。随着挖掘深度的增加,获取高价值数据的成本会呈指数级增长。更关键的是,这些核心数据大多掌握在医疗机构、律所或大型工业企业手中,数据产权和合规性是目前最大的拦路虎。如果不能解决数据所有权的买卖机制,单纯靠砸钱可能也买不到真正能提升模型能力的语料。
但不可否认,Andrew Ho 戳中了一个被大多数人忽视的痛点:当所有人都在盯着算力卡脖子、讨论算力集群的 PUE 值时,数据这条腿可能才是真正短的那根。如果数据质量无法同步升级,那么再多的算力也只是在重复训练一个更庞大但依然平庸的“概率预测机器”。
在这种背景下,我认为未来的竞争重点会从“谁有更多卡”转向“谁有更干净的私域数据”。如果一个团队能通过专家级标注,将 1GB 的高质量行业知识灌入模型,其效果可能远超用 1TB 的通用网页数据训练出的巨兽。

光烧钱堆算力简直是浪费,没高质量数据喂养,模型早晚得跑偏到没法用。