把 DeepSeek V4 Flash 压缩到 57GB 居然能在
在 Mac 上跑大模型最头疼的就是内存,但看到有人把 DeepSeek V4 Flash 0731 这种体量的模型硬生生压缩到了 57GB,而且居然没把它的逻辑能力压没了,这真的太让人兴奋了。最离谱的实操结果是,这个被“瘦身”后的版本在 MacBook 上直接写了一个针对 ARM64 的极简 C 编译器,跑 Fibonacci 和 FizzBuzz 全过了,整个过程不到一小时。
最让我佩服的是作者对“推理能力”的保留。很多量化模型最容易出现的问题就是量化后变傻,或者陷入死循环(比如思考几千个 token 停不下来)。为了解决这个问题,他在校准集中特意加大了工具调用轨迹和结构化推理的权重,确保模型在变小之后依然知道怎么正确地结束思考。
如果你想尝试,可以关注这几个具体的组件路径:
量化模型权重:
下一篇
怎么构建一个没人敢公开承认自己身在其中的群体? →
这种量级的模型能在本地跑通复杂编程任务,关键在于这次压缩用了几种非常硬核的手段,值得所有关注本地部署的朋友参考:
- 量化方案: 采用了 mlx-iqk,利用了 IQ_K 张量编码。这比常规的 llama.cpp 或者原版 MLX 效率更高,而且作者还特意把布局改成了 k-contiguous,在 Metal 架构下跑得更快。
- 专家剪枝: 用了 REAP 技术。模型原有的 40 个路由层每层有 256 个专家,但写代码不需要所有专家全部上阵。通过剪掉不重要的专家,直接砍掉了 80B 的参数。
- 精度动态平衡: 基础部分用了极其省空间的 IQ1_S_R4(约 1.5 bit),但会对关键的投影层选择性升级到 IQ2_KS 或 IQ2_K,用极小的空间增加来换取误差的降低。
最让我佩服的是作者对“推理能力”的保留。很多量化模型最容易出现的问题就是量化后变傻,或者陷入死循环(比如思考几千个 token 停不下来)。为了解决这个问题,他在校准集中特意加大了工具调用轨迹和结构化推理的权重,确保模型在变小之后依然知道怎么正确地结束思考。
硬件适配方面也很有参考价值:
- 128GB M3 Max: 运行流畅,性能强悍。
- 32GB MacBook: 居然也能跑,支持 128K 上下文,速度在 5 tok/s 左右,完全可用。
- 16GB M1 Air: 能跑,但上下文空间太小,速度只有 1.39 tok/s,勉强能用。
如果你想尝试,可以关注这几个具体的组件路径:
量化模型权重:
huggingface.co/steadfastgaze/DeepSeek-V4-Flash-0731-Coder-56.8GB-MoEspressoV2运行引擎 MoEspresso:github.com/steadfastgaze/MoEspresso量化库 mlx-iqk:github.com/steadfastgaze/mlx-iqk这种通过精细化剪枝和动态量化让大模型在消费级设备上跑出生产力的方向,绝对是未来的主流。
免费 AI 工具箱 · 全部完全免费