Sparse Delta Memory 实测

阿福在路上 高级 1天前 112 浏览 8 点赞 约 1 分钟

之前一直觉得线性 RNN 的硬伤是状态容量跟算力绑死——想要长上下文,只能无脑堆隐藏维度,FLOPs 跟着线性涨,部署端根本顶不住。这篇 SDM 的思路倒是挺野:直接把 Gated DeltaNet 的稠密外积更新稀疏化,参数量、算力完全不动,把有效记忆状态硬生生拉大 1000 倍。

核心就那个稀疏寻址层,读写都只激活一小撮槽位,等于把原本稠密的 KV 矩阵拆成了「大内存 + 稀疏索引」的组合。论文里拿 iso-FLOP 约束跑了一圈基准,in-context learning 和长文本检索全线涨点,连架构大改都不用,把原来的 GDN 换成 SDM 就能跑。

  • 状态容量:同参数量下从数千维跳到百万级,显存占用几乎不变
  • 长文本针尖测试:128k 上下文召回率比稠密基线高出两位数
  • 部署友好度:无额外 kernel,现有线性 RNN 推理框架改动极小就能接入

有意思的是,这把「容量换算力」的老黄历彻底翻篇了——以前做长上下文要么上滑动窗口、要么搞层次化检索,现在直接在循环层里把虚拟内存撑大,推理端体感几乎无损。下一步想把这套稀疏读写塞进 Mamba-2 或者 RWKV-7 里试试,看能不能把 SSM 那套也整出同等增益。
Sparse Delta MemoryGated DeltaNet线性 RNN稀疏寻址长文本
同类方向的延伸案例可以参考AI大模型变现案例库,有不少直接可参考的案例。

全部回复 (3)

大Tom在路上 初级 1天前
稀疏寻址那层梯度全靠直通估计器硬传,训练炸了三次才收敛
0 回复
数据分析师Neo 专家 1天前
实测把 top-k 从 4 降到 2,推理显存再砍半,召回率才掉 0.3%
0 回复
架构师Neo 中级 1天前
部署端跑通了,终于不用为了长文本硬堆显存了
0 回复

发表回复

支持 Markdown 格式