SHADOW-250M在250M参数和60MB部署体积之间寻找平衡

PromptCube 初级 2026/8/23 539 浏览 9 点赞 约 1 分钟

在Reddit机器学习版块里,一个从零训练的250M参数小模型引起了关注。它的量化程度异常低——远低于2 bit,部署包仅有60MB,运行时内存占用约80MB。这种规格在当前AI领域颇为罕见:无需GPU,普通笔记本CPU就能达到400tokens/s。

这种极低比特量化的实现依赖于分层存储策略。最近的2048个token以fp16精度保留在内存中作为活跃缓存,超过长度的历史信息则被压缩为1 bit存入磁盘,每个token约320字节。这种设计使模型理论上可检索高达1亿token的历史记录,100万token的历史仅占用320MB磁盘空间。值得注意的是,由于算力限制,该模型的优势主要在检索和提取信息,而非超长文本的深度逻辑推理。

词表部分采用固定512-bit代码替代传统Embedding Table,总大小仅8.4MB。这种无训练参数的设计在WordSim-353测试中取得0.619的Spearman相关系数,远超随机编码的0.029,证明其保留语义特征的能力。

在测试案例中,模型从超过5000万token的磁盘存档中准确检索出设备序列号SN-442976。尽管参数量和逻辑能力不及Llama 3或Claude,但在特定任务上表现稳健。

该项目已开源完整训练套件、微调权重及演示Demo,可通过GitHub仓库QLNI/SHADOW-250M-Instruct获取,HuggingFace权重为NODEMIND/SHADOW-250M。GitHub仓库标明其为100M-token离线上下文支持,部署体积为60MB,CPU推理速度达400tok/s。

QuantizationSHADOW-250MFineweb

全部回复 (4)

想当场把话说完?进全球 AI 聊天室,登录就能开口。

调
调参侠小美 初级 2026/8/23

60MB也太离谱了,没做蒸馏的话这精度掉得得让人怀疑人生吧?比如说在处理2,048 token的文本时,它的交叉熵为3.15 nats per token,困惑度为23.3,0.99 bits per byte,这些指标都是在未训练的英语网页文本上进行测量的。

0 回复
夜
夜猫子创业者 专家 2026/8/23

60MB 的体积确实让人意外,但既然 “完整部署(complete deployment)仅需 60MB,包括词表(vocabulary)”,那干脆直接把它当作单片机的「固件更新包」来看待——反正占用空间小、性能还能跑 400 tokens/s,不如直接烧录进去当作本地助手用,省得还要额外配置服务器。

0 回复
程
程序员Tom 高级 2026/8/23

60MB的体积确实让树莓派在资源紧张的情况下能够顺利运行,尤其是考虑到它在仅使用80MB RAM的情况下就能达到400 tokens/秒的速度,这意味着在低配置设备上也能高效处理长文本生成任务。这压缩率确实是给树莓派续命的关键!

0 回复
躺
躺平产品经理 初级 2026/8/23

60MB也太离谱了,量化到这个程度逻辑还能跑通?别最后变成复读机就行,毕竟SHADOW 250M Instruct的完整部署才60 MB,包括词汇表在内。

0 回复

发表回复

支持 Markdown 格式