别再迷信量化压缩了,CaSA 用电荷共享把 LLM 推理直接搬进内存

大Jerry 高级 2026/7/23 413 浏览 11 点赞 约 2 分钟

很多开发者在尝试把大参数模型部署到端侧设备时,很容易陷入一个认知误区:认为只要量化精度足够低,内存能塞下模型,推理速度自然就快。但实际操作中你会发现,即便使用了像 PrismML 这种将权重压缩至三值(Ternary weights)的极致方案,面对 27B 规模的模型,在手机 SoC 上运行依然慢得离谱,而且设备发烫严重。

这其实是典型的“内存墙”问题。在这种架构下,瓶颈根本不在于 NPU 或 GPU 的算力,而在于数据在 SoC 总线和内存之间往返搬运时产生的巨大开销。无论你在软件层面如何优化算子,只要数据还在走总线,功耗和延迟就无法触及物理底层的极限。

最近我深入研究了 CaSA 项目,它提供了一个非常激进的解法:不再试图优化搬运速度,而是直接让推理在内存内部完成。

CaSA 的核心逻辑在于利用了商用 DRAM 的物理特性,引入了电荷共享(charge-sharing)机制。简单来说,它将三值 LLM 的权重直接映射到内存单元的物理状态中。在进行矩阵乘法这种高频操作时,计算过程直接在内存阵列内部通过电荷的转移和共享来完成,而不需要将数据通过内存控制器发送到 CPU 或 GPU 的寄存器中。

这种 PIM(Processing-In-Memory,内存计算)架构将数据传输的距离从“厘米级”直接缩短到了“微米级”。对于三值量化模型而言,权重的取值仅为 $\{-1, 0, 1\}$,这种极简的数值分布天然适配电荷共享机制,使得在硬件层面实现低精度累加变得可行。

如果你想深入研究其具体实现,建议去 GitHub 翻阅 pcdeni/CaSA 这个仓库。在代码实现层面,最值得关注的是它如何处理三值权重的物理映射,以及在实际硬件电路中如何通过控制时序来保证计算精度不至于崩塌。因为在 DRAM 内部做计算,最大的挑战就是噪声干扰和电荷泄露导致的精度损失,这直接决定了模型输出的稳定性。

从工程角度看,这种方案比单纯堆高 LPDDR5X 的带宽要聪明得多。因为带宽的提升遵循边际递减效应,且伴随着电压和功耗的同步上涨。而 CaSA 这种直接绕过总线的方案,实际上是在物理层面上消除了数据搬运的冗余。

如果这种架构能够规模化落地,端侧 AI Agent 将迎来质变。目前的 Agent 响应慢,很大程度上是因为在端侧运行大参数模型时,KV Cache 的读写和权重加载占据了绝大部分时间。一旦推理直接在内存里跑,Token 的生成速度将不再受限于总线带宽,功耗表现也会有量级的提升。

对于关注端侧部署的工程师来说,CaSA 提醒我们:当软件层面的量化优化达到瓶颈时,真正的突破口往往隐藏在硬件架构的重新定义之中。

教程资源工具

全部回复 (3)

小李爱学习 初级 2026/7/24
这种电荷共享机制对内存电压波动敏感吗?稳定性怎么保证?
0 回复
大Jerry 高级 2026/7/24
之前跑过量化模型,内存带宽确实是死穴,这种原位计算才算根治。
0 回复
程序员Tom 高级 2026/7/24
我之前试过类似方案,结果精度掉得离谱,根本没法用。
0 回复

发表回复

支持 Markdown 格式