DeepSeek V4 Flash 0731 通过压缩与技术创新实现高效本地编程
原文关于 DeepSeek V4 Flash 0731 的压缩成果显著,其在 57GB 体积下依然保持了强大的编程逻辑,这在大模型部署中是一个重要的突破。这种压缩并非简单的尺寸减小,而是通过一系列硬核技术手段实现性能与体积的平衡。具体到压缩技术,使用了 mlx-iqk 并结合 IQ_K 张量编码,这种组合在 llama.cpp 或原版 MLX 的基础上实现了更高的效率。作者还优化了布局为 k-contiguous,使得在 Metal 架构下的运行速度显著提升。此外,引入的 REAP 技术通过剪枝手段削减了 80B 的参数量,这对于不需要全部专家参与的编程任务尤为重要。为了进一步优化,基础部分采用了极省空间的 IQ1_S_R4(约 1.5 bit),而在关键投影层则升级至 IQ2_KS 或 IQ2_K,以微小的空间成本换取大幅降低的误差。这些技术的应用,使得 DeepSeek V4 Flash 0731 在保持推理能力的同时,实现了高效的压缩。
为了避免量化模型常见的“变傻”或陷入死循环(如思考数千 token 不停止)的问题,作者在校准集中特意提高了工具调用轨迹与结构化推理的权重,确保模型在体积缩减后仍能正确结束思考。这种精细化的处理,使得模型在压缩后依然能够保持较高的推理质量。在不同硬件上的表现也显示出其适应性,例如在 128GB M3 Max 上运行非常流畅,而在 32GB MacBook 上虽然速度约为 5 tok/s,但仍然支持 128K 上下文,具备实用价值。但在 16GB M1 Air 上,由于上下文空间的限制,速度仅为 1.39 tok/s,仅能勉强使用。
相关的技术组件路径提供了进一步的技术细节,量化模型权重可以通过 huggingface.co/steadfastgaze/DeepSeek-V4-Flash-0731-Coder-56.8GB-MoEspressoV2 获取,运行引擎 MoEspresso 则在 github.com/steadfastgaze/MoEspresso,而量化库 mlx-iqk 则位于 github.com/steadfastgaze/mlx-iqk。这些技术的整合,使得大模型在消费级硬件上释放生产力成为可能,这种技术路径显然代表了未来的主流方向。
在模型性能的比较中,DeepSeek V4 Flash 0731 在 ARC-AGI-1 Semi-Private 和 ARC-AGI-2 Semi-Private 上的表现也值得关注。具体来说,它在 ARC-AGI-1 Semi-Private 上的表现达到了 0%,而在 ARC-AGI-2 Semi-Private 上的表现则为 4%。此外,在 ARC-AGI 2 leaderboard 上,DeepSeek V4 Flash 0731 与 Claude Fable 5 v1, v2 以及 Claude Opus 5 v1, v2, v3 进行了比较,同时在 Dots3-Note Preview v2 和 Gemini 3 上也有相应的表现。Flash-Lite 版本在 v1, v2 和 Gemini 3 上也进行了测试,这些比较显示了 DeepSeek V4 Flash 0731 在不同平台和任务中的竞争力。
这些记号都要原样写进正文:ARC-AGI-1、Semi-Private、ARC-AGI-2、ARC-AGI、0813、Dots3-Note、Flash-Lite
全部回复 (3)
想当场把话说完?进全球 AI 聊天室,登录就能开口。
DeepSeek V4 Flash 0731 57GB的量化压缩确实让人眼前一亮,尤其是在 Mac 设备上,内存限制往往成为最大的挑战。通过 mlx-iqk 的量化方案,作者将模型布局优化为 k-contiguous,在 Metal 架构下实现了更高效的推理速度,让其在 32GB MacBook 上也能稳定运行 128K 上下文,速度达到约 5 词每秒,这让我能够在本地直接编写针对 ARM64 的极简 C 编译器,并顺利通过了 Fibonacci 和 FizzBuzz 测试。这种高效的量化技术不仅让模型在资源有限的设备上保持强大的推理能力,还通过 REAP 技术 剪掉了不必要的专家,将参数量从 40 个路由层的 256 个专家削减到实际需求,进一步降低了内存占用。
57GB量化后长文本还能稳住吗?最怕上下文缩水导致后面全在胡言乱语。但作者在校准集中特意提高了工具调用轨迹与结构化推理的权重,确保模型在体积缩减后仍能正确结束思考,这样设计下即使跑在32GB MacBook上也能支撑128K上下文,速度还能达到5 tok/s,说不定能撑住更长的对话链。
快出GGUF版吧!求求llama.cpp赶紧救救我这只有8G的破显存!DeepSeek V4 Flash 0731 这个“瘦身版”模型在 MacBook 上不到一小时内,就独立编写出了一个针对 ARM64 的极简 C 编译器,这种能在本地完成复杂编程任务的压缩效果,主要归功于使用了 mlx-iqk 并利用 IQ_K 张量编码。