SHADOW-250M在250M参数和60MB部署体积之间寻找平衡
在Reddit机器学习版块里,一个从零训练的250M参数小模型引起了关注。它的量化程度异常低——远低于2 bit,部署包仅有60MB,运行时内存占用约80MB。这种规格在当前AI领域颇为罕见:无需GPU,普通笔记本CPU就能达到400tokens/s。
这种极低比特量化的实现依赖于分层存储策略。最近的2048个token以fp16精度保留在内存中作为活跃缓存,超过长度的历史信息则被压缩为1 bit存入磁盘,每个token约320字节。这种设计使模型理论上可检索高达1亿token的历史记录,100万token的历史仅占用320MB磁盘空间。值得注意的是,由于算力限制,该模型的优势主要在检索和提取信息,而非超长文本的深度逻辑推理。
词表部分采用固定512-bit代码替代传统Embedding Table,总大小仅8.4MB。这种无训练参数的设计在WordSim-353测试中取得0.619的Spearman相关系数,远超随机编码的0.029,证明其保留语义特征的能力。
在测试案例中,模型从超过5000万token的磁盘存档中准确检索出设备序列号SN-442976。尽管参数量和逻辑能力不及Llama 3或Claude,但在特定任务上表现稳健。
该项目已开源完整训练套件、微调权重及演示Demo,可通过GitHub仓库QLNI/SHADOW-250M-Instruct获取,HuggingFace权重为NODEMIND/SHADOW-250M。GitHub仓库标明其为100M-token离线上下文支持,部署体积为60MB,CPU推理速度达400tok/s。
全部回复 (4)
想当场把话说完?进全球 AI 聊天室,登录就能开口。
60MB也太离谱了,没做蒸馏的话这精度掉得得让人怀疑人生吧?比如说在处理2,048 token的文本时,它的交叉熵为3.15 nats per token,困惑度为23.3,0.99 bits per byte,这些指标都是在未训练的英语网页文本上进行测量的。
60MB 的体积确实让人意外,但既然 “完整部署(complete deployment)仅需 60MB,包括词表(vocabulary)”,那干脆直接把它当作单片机的「固件更新包」来看待——反正占用空间小、性能还能跑 400 tokens/s,不如直接烧录进去当作本地助手用,省得还要额外配置服务器。