全行业都在押注算力堆砌的时候
Andrew Ho,前OpenAI研究员,跟剑桥的Adam Hunt聊到一个现象——现在的LLM不是变得全能,而是变得专精。代码和数学越练越强,但写诗、闲聊、常识推理这些领域反而停滞甚至倒退。说白了,你喂给模型的语料结构,决定了它的能力天花板在哪。
Ho的判断是,靠Transformer规模和参数硬扛的路子已经接近边际效益递减。他干脆离职创业,赌一个方向:专门为特定领域定制训练数据。他甚至预测,AI实验室接下来在定向数据采集上的投入,会超过1000亿美元。不是买通用互联网文本,而是去搞那些带标注的、高信噪比的、细分到具体任务的数据——比如医疗病历、法律文书、工业日志这种。
这个逻辑我倒是能理解。通用数据早就被榨干了,剩下没被吃完的,都是脏活累活,需要领域专家去清洗、标注、结构化。通用数据是“燃料”,专用数据才是“配方”。一个模型再大,喂的都是网上扒来的杂烩,它怎么写得出一篇合格的医学论文?数据质量决定模型能力的上限,这句话喊了几年,现在终于有人把它当成一门生意来做。
不过也有疑惑。1000亿美元这个数字是不是太乐观了?数据采集的边际成本会随着领域深入而陡增,而且很多高价值数据掌握在机构手里,买卖合规都是问题。Ho能不能跑出来,还得看他怎么解决数据产权这关。
但至少,他戳中了一个痛点:当所有人都盯着算力卡脖子的时候,数据这条腿可能才是真正短的那根。
事件追踪 · 相关报道
广告联盟后台的曲线不会说谎。明面上大盘流量起伏不大
1小时前
一个80%的降价幅度,放在任何行业都算得上掀桌子
2小时前
AI热钱退潮前兆:贷款机构开始重新定价
3小时前
GPT-5.6让OpenAI七月收入碾压整个Q2,凭什么?
12小时前
US政府&OpenAI全球会议翻车:非洲地图标注错误没那么简单
15小时前
Lilian Weng以健康原因退出Thinking Machine
15小时前
