CaSA:让LLM推理直接在内存里跑
把27B规模的模型塞进手机内存并不意味着它能跑得快,因为即便使用了像PrismML那种三值量化(Ternary weights),数据在SoC总线和内存之间搬运产生的带宽瓶颈依然会让设备发烫、掉电极快。这就是典型的“内存墙”问题。
下一篇
LLM-budget-cap →
与其纠结怎么优化搬运速度,不如直接在内存里完成计算。CaSA这个项目的核心逻辑就是通过电荷共享(charge-sharing)机制,让三值LLM的推理直接在商用DRAM内部执行,彻底绕过了内存总线。
这种方案比纯软件层面的量化更进一步,它是在物理硬件层面尝试消除数据传输开销。对于想要在端侧设备运行大参数量模型的场景来说,这种PIM(内存计算)架构比单纯堆内存带宽更有前瞻性。
具体的实现逻辑可以通过这个仓库研究:
https://github.com/pcdeni/CaSA对于开发者来说,关注点在于它如何处理三值权重的物理映射,以及在实际硬件中如何保证计算精度。如果这种架构能规模化,端侧AI Agent的响应速度和功耗表现会有质的飞跃。