用 24GB 内存的 M4 Pro 跑本地大模型

副业中创业者 初级 1小时前 722 浏览 2 点赞 约 2 分钟

在 24GB 内存的 Mac M4 Pro 上用 LM Studio 跑了一圈本地模型,实测下来最大的感受就是:别指望一个模型能搞定所有事。我测试了从 4B 到 35B 不等规模的模型,涵盖了 MLX 和 GGUF 两种格式,量化等级基本都在 4-bit 左右。测试结果非常直接,针对不同的任务,选对模型比盲目追求参数量重要得多。

我把测试场景拆解成了几个实战维度,大家可以参考一下我的踩坑结论:

  • 文本摘要能力: 我丢进一段长转录文本让模型做总结。结果很有意思,Gemma 4 e4b 表现最稳,而且速度极快,30 秒左右就搞定了。相比之下,我试了 Qwen 3.6 35B 的 Q2_K_XL 版本,虽然参数大,但居然要跑 2 分钟,而且中间还漏掉了几个关键点,效率和准确度都不如小模型。

  • RAG 事实问答: 把转录文件喂给模型,问一些基于文件内容的硬事实。gpt-oss-20b 简直是黑马,4 秒钟就精准回答了,完全没幻觉。虽然 BTL 4 Compact 和 Gemma 4 e4b 也能答对,但响应时间都拉长到了分钟级,体验差了不少。

  • PII 信息提取(脱敏): 识别文本里的姓名、组织、邮箱和电话。这个场景对逻辑要求不算极高,但对速度要求极高。Qwen 3 4B (MLX 版) 表现惊人,不到 3 秒就完成了。其他模型虽然也能识别,但有的要跑 11 秒,有的甚至要 30 秒。

  • 代码解释与逻辑推演: 我给了一个复杂的 Class 文件,让模型识别特定方法并判断是否能编译通过。Qwen 3.8 27B 在这个环节展现了统治力,理解深度远超其他模型。但代价是速度慢得离谱,只有大概 5 tokens/s,跑完整个任务花了近 30 分钟。

这里有个很重要的细节,我在跑 Qwen 3.8 27B 时发现,如果不对它的“思考过程”做限制,它会疯狂消耗上下文,直接把 24GB 内存撑爆。我最后通过设置 1k tokens 的 reasoning budget(推理预算)才让它在我的机器上跑稳。

另外,实测发现量化等级也不是越高越好,有时候 Q2 版本的 Qwen 3.6 反而比 Q3 版本更听话。

如果你也想在 Mac 或者消费级显卡上折腾本地工作流,建议根据任务类型去配不同的模型,而不是死磕一个最大的模型。

QwenLM StudioM4 ProGemma
更系统的工具评测汇总在AI工具实测笔记,有不少直接可参考的案例。

全部回复 (4)

脚本小子阿杰 专家 1小时前
确实,我之前硬跑30B的,卡得想砸电脑,换成7B秒开。
0 回复
大Tom在路上 初级 1小时前
30B确实太吃显存了,你当时用的是什么量化版本?
0 回复
老阿凯 中级 1小时前
还得看具体的量化精度,我试过Q4的,感觉逻辑稍微有点飘。
0 回复
折腾党阿凯 中级 1小时前
那如果换成MLX格式,内存占用是不是能再压低点?想试试。
0 回复

发表回复

支持 Markdown 格式