花了 800 刀烧出来的这个 Bart 模型竟然只用 1931 年前

PromptCube 中级 13分钟前 478 浏览 10 点赞 约 1 分钟

这事儿挺有意思,Unbounded Labs 这帮人没去卷什么最新的互联网语料,反而反其道而行之,专门搞了个叫 Bart 的“复古版”大模型。他们花了三个月,烧掉了 800 多美金,最后训练出了一个 2.82B 参数规模的模型,最硬核的地方在于:所有的训练数据全部来自 1931 年以前的英文文本。

现在的模型动不动就吞掉几万亿的 Token,但他们只用了 20.1B 的古董语料。为什么要这么干?这其实是在回应一个挺深层的学术问题:如果模型只学习那个时代的知识和逻辑,它能不能像当年的科学家一样,推导出全新的科学结论,而不是单纯地在模仿现代互联网上的信息碎片的概率分布?

我翻了一下他们的技术细节,这波实操确实有点东西:

  • 数据集清洗: 他们把哈佛大学的 Institutional Books 库从 242B 的原始 Token 暴力清洗到了 23B,这工作量非常大。
  • 基准测试: 因为现有的 Benchmark 对这种“复古模型”没意义,他们自己搞了一套叫 Vintage CORE 的评估体系,包含 20 个维度的测试。
  • 训练效率: 最后的模型是在一台 H100 上用 5 天跑完的,全程 MFU(模型算力利用率)保持在 60% 左右,效率控制得相当稳。
  • 开源贡献: 他们把 416k 对基于 1930 年前文本的问答对(SFT 数据集)给开源了。

虽然 2.82B 的参数量在今天看来很小,但在这种垂直且极端的数据环境下,它在 Vintage CORE 上的表现超过了之前的 GPT-1900。这种实验更像是在做一种“思想实验”,通过控制变量来研究 LLM 到底是在进行逻辑推理,还是仅仅在做下一个 Token 的预测。

如果你对小参数模型在特定领域的数据表现感兴趣,可以去 Huggingface 上看看他们的权重:

https://huggingface.co/jbduran/bartholomew-sft

这种走偏门但极具研究价值的路径,比单纯堆算力要有趣得多。

Hugging FaceUnbounded LabsBart

全部回复 (3)

运营喵小柯 中级 8分钟前
确实,我之前做古籍数字化项目时,那些旧扫描件的识别率低到想哭,清洗起来太费劲了。
0 回复
数据分析师小美 初级 6分钟前
这语料库里包含大量没被数字化的手稿吗?感觉清洗难度挺大。
0 回复
大鹏的日常 初级 6分钟前
估计这模型逻辑会很稳,毕竟没被互联网垃圾信息带偏,纯粹。
0 回复

发表回复

支持 Markdown 格式