1931 年前古籍训练出的 Bart 模型以 800 美元成本验证了 LLM 推理能力

PromptCube 中级 2026/8/26 578 浏览 10 点赞 约 2 分钟

复古大模型 Bart 用 1931 年前知识证明 LLM 推理潜力

Unbounded Labs 团队设计了一场不同寻常的实验,打造名为 Bart 的复古版大语言模型。这款模型的训练数据全部来自 1931 年之前的英文文本,团队意在探究:如果模型只接触更早时期的知识与逻辑,是否仍能像当时的科学家那般,通过纯粹的推理推导出正确结论,而非依赖现代互联网上的海量信息。

在当下 LLM 发展竞赛中,大家普遍聚焦于万亿级别的 Token 数据与庞大的算力集群,但 Bart 模型的诞生恰恰颗然相反。团队采用了极端的时间截断策略,将训练数据严格限制在 1931 年前,从而有效排除现代知识体系的干扰,包括量子力学、计算机科学等现代科学概念,以及任何来自互联网的信息。

从技术参数来看,这是一个精心控制的小样本实验。Bart 模型的参数量固定为 2.82B,经过严格筛选后,训练数据集总量达到 20.1B Token。在获取这批纯净历史语料的过程中,团队对哈佛大学 Institutional Books 库实施了深度清洗,将 242B 的原始 Token 数据大幅缩减至 23B,以彻底消除现代信息噪声的影响。

在成本控制方面,该项目为开发者提供了一个清晰的参考标杆。整个训练过程仅在一台 H100 显卡上完成,耗时 5 天,总费用约为 800 美元。值得关注的是,模型训练过程中 MFU(模型算力利用率)始终维持在 60% 左右,展现了小规模训练场景下良好的效率管理能力。

为了公平评估这款复古模型的性能,团队意识到传统基准测试多依赖现代知识,对 Bart 模型来说并不适用,因此特别开发了 Vintage CORE 评估体系,涵盖 20 个不同的测试维度。测试结果显示,2.82B 参数的 Bart 模型在 Vintage CORE 评估中表现优于此前的 GPT-1900 模型。

这类实验本质上是一次巧妙的“思想实验”。当前市场上许多人将 LLM 简单视为“概率预测机”,认为其解答科学问题的能力可能仅来源于训练集中已有的大量答案。Bart 模型通过严格控制变量,将时间轴回溯至 1931 年,试图证明 LLM 拥有超越时代的通用推理能力,而不仅仅是执行 Token 预测任务。

除了模型权重外,团队还开源了一套包含 416k 对问答对的 SFT 数据集,这些问答对均基于 1930 年前的文本。这份数据集为研究者们探索特定领域或特定历史时期的中小参数模型提供了宝贵的参考资源。

有意者可在 Huggingface 平台上访问路径 jbduran/bartholomew-sft 获取相关模型权重。在当前以算力堆叠为主导的发展趋势下,这种侧重于逻辑验证的非主流研究路径,或许比单纯增加参数量更值得研究者关注。

Hugging FaceUnbounded LabsBart

全部回复 (3)

想当场把话说完?进全球 AI 聊天室,登录就能开口。

运
运营喵小柯 中级 2026/8/26

那些1931年前的扫描件简直是噩梦,清洗数据的崩溃感谁懂啊,团队对哈佛大学 Institutional Books 库实施了深度清洗,将 242B 的原始 Token 大幅缩减至 23B,旨在彻底消除现代信息的噪声干扰。

0 回复
数
数据分析师小美 初级 2026/8/26

这800刀的语料库里要是混了大量未数字化的手稿,清洗起来估计得掉头发,事实上,Unbounded Labs 进行了一项极具针对性的实验,构建了一款名为 Bart 的复古版大模型。他们选择了一个极端的“时间截断”策略,仅使用 1931 年之前的英文文本作为训练数据,这意味着模型在构建期间未接触任何现代知识体系,既无互联网资讯,也缺乏量子力学及现代计算机科学的背景。

0 回复
大
大鹏的日常 初级 2026/8/26

这模型估计稳得可怕,没被现在的互联网垃圾信息污染过,简直是纯净版大脑。Unbounded Labs 团队就是这么想,干脆拿 1931 年之前的英文文本做训练数据,把 Bart 模型建成个彻彻底底的“复古版大脑”。2.82B 参数、20.1B Token,五天训练完,800 美元搞定,MFU 稳定在 60%,效率可不一般。还专门出了套 Vintage CORE 评测,20 个维度全面覆盖,结果比 GPT-1900 还强——说白了,这不是靠背答案,是靠推理。

0 回复

发表回复

支持 Markdown 格式