花了 800 刀烧出来的这个 Bart 模型竟然只用 1931 年前
这事儿挺有意思,Unbounded Labs 这帮人没去卷什么最新的互联网语料,反而反其道而行之,专门搞了个叫 Bart 的“复古版”大模型。他们花了三个月,烧掉了 800 多美金,最后训练出了一个 2.82B 参数规模的模型,最硬核的地方在于:所有的训练数据全部来自 1931 年以前的英文文本。
虽然 2.82B 的参数量在今天看来很小,但在这种垂直且极端的数据环境下,它在 Vintage CORE 上的表现超过了之前的 GPT-1900。这种实验更像是在做一种“思想实验”,通过控制变量来研究 LLM 到底是在进行逻辑推理,还是仅仅在做下一个 Token 的预测。
现在的模型动不动就吞掉几万亿的 Token,但他们只用了 20.1B 的古董语料。为什么要这么干?这其实是在回应一个挺深层的学术问题:如果模型只学习那个时代的知识和逻辑,它能不能像当年的科学家一样,推导出全新的科学结论,而不是单纯地在模仿现代互联网上的信息碎片的概率分布?
我翻了一下他们的技术细节,这波实操确实有点东西:
- 数据集清洗: 他们把哈佛大学的 Institutional Books 库从 242B 的原始 Token 暴力清洗到了 23B,这工作量非常大。
- 基准测试: 因为现有的 Benchmark 对这种“复古模型”没意义,他们自己搞了一套叫 Vintage CORE 的评估体系,包含 20 个维度的测试。
- 训练效率: 最后的模型是在一台 H100 上用 5 天跑完的,全程 MFU(模型算力利用率)保持在 60% 左右,效率控制得相当稳。
- 开源贡献: 他们把 416k 对基于 1930 年前文本的问答对(SFT 数据集)给开源了。
虽然 2.82B 的参数量在今天看来很小,但在这种垂直且极端的数据环境下,它在 Vintage CORE 上的表现超过了之前的 GPT-1900。这种实验更像是在做一种“思想实验”,通过控制变量来研究 LLM 到底是在进行逻辑推理,还是仅仅在做下一个 Token 的预测。
如果你对小参数模型在特定领域的数据表现感兴趣,可以去 Huggingface 上看看他们的权重:
https://huggingface.co/jbduran/bartholomew-sft这种走偏门但极具研究价值的路径,比单纯堆算力要有趣得多。
事件追踪 · 相关报道
PostgreSQL + Qwen3 嵌入也能做 SOTA 搜索?
57分钟前
Hugging Face 估值 130 亿美元的背后
22小时前
Hugging Face 估值冲到 130 亿美金
1天前
这个号称“来路不明”的免费模型到底藏了什么黑科技
2天前
Tim O'Reilly 认为如果不把 AI 开放给社区
8天前
中国开源社区现在的爆发力真的挺惊人的,很多项目已经不再是简单的跟随
9天前
免费 AI 工具箱 · 全部完全免费