Sparse Delta Memory 实测
之前一直觉得线性 RNN 的硬伤是状态容量跟算力绑死——想要长上下文,只能无脑堆隐藏维度,FLOPs 跟着线性涨,部署端根本顶不住。这篇 SDM 的思路倒是挺野:直接把 Gated DeltaNet 的稠密外积更新稀疏化,参数量、算力完全不动,把有效记忆状态硬生生拉大 1000 倍。
有意思的是,这把「容量换算力」的老黄历彻底翻篇了——以前做长上下文要么上滑动窗口、要么搞层次化检索,现在直接在循环层里把虚拟内存撑大,推理端体感几乎无损。下一步想把这套稀疏读写塞进 Mamba-2 或者 RWKV-7 里试试,看能不能把 SSM 那套也整出同等增益。
下一篇
我把 Frugal Tokens 跑了一遍,结论是 →
核心就那个稀疏寻址层,读写都只激活一小撮槽位,等于把原本稠密的 KV 矩阵拆成了「大内存 + 稀疏索引」的组合。论文里拿 iso-FLOP 约束跑了一圈基准,in-context learning 和长文本检索全线涨点,连架构大改都不用,把原来的 GDN 换成 SDM 就能跑。
- 状态容量:同参数量下从数千维跳到百万级,显存占用几乎不变
- 长文本针尖测试:128k 上下文召回率比稠密基线高出两位数
- 部署友好度:无额外 kernel,现有线性 RNN 推理框架改动极小就能接入
有意思的是,这把「容量换算力」的老黄历彻底翻篇了——以前做长上下文要么上滑动窗口、要么搞层次化检索,现在直接在循环层里把虚拟内存撑大,推理端体感几乎无损。下一步想把这套稀疏读写塞进 Mamba-2 或者 RWKV-7 里试试,看能不能把 SSM 那套也整出同等增益。
免费 AI 工具箱 · 全部完全免费
同类方向的延伸案例可以参考AI大模型变现案例库,有不少直接可参考的案例。