花两万多块买台 Mac mini 跑 Agent 服务器到底值不值
直接说结论:如果你想在本地折腾 20B 到 30B 参数规模的模型,M5 Pro 配置(48GB 内存)是目前的舒适区。但如果想拿它跑 70B 的 Llama 3.1 或者重型视频生成,这机器虽然能跑,但速度慢到没法用,不建议把它当成纯 GPU 工作站。
这次我上手的是一台 M5 Pro 版本,48GB 内存 + 2T 硬盘,到手价 25749 元(分期每月 1073 元)。虽然它叫 Mini,但价格一点都不 Mini。不过现在的 AI PC 竞争点已经变了,不再是能不能跑模型,而是能不能让 Agent 在后台全天候稳定工作。
M6 芯片的 AI 性能到底如何
这次 M6 芯片的配置挺激进,12 核 GPU 每个核心都有 Neural Accelerator,还配了双 16 核 Neural Engine。官方说 AI 性能比 M4 提升了最高 4 倍。但实操本地模型时,你得盯着内存带宽看,M6 最高 32GB 统一内存,带宽 170GB/s;而 M5 Pro 能到 64GB 和 307GB/s。
我测了几个量化模型,结果如下:
- GPT 20B 开源模型: 输入 72 token,生成 178 token,整轮耗时 3.64 秒,速度 55.66 token/s,体感很快。
- Qwen3.8 27B (4-bit 量化): 回复速度依然不错,总用时 2.9s,速度 41.64 token/s。即便喂给它《Attention is all you need》这种长论文,处理速度也能维持在 32 token/s,基本能接受。
- Meta 300 亿参数模型: 读入速度明显掉档,从 473 token/s 降到了 32 token/s。
- Llama 3.1 70B: 勉强能跑,但发句“你好”就要等 2 分钟 48 秒,速度只有 0.05 token/s,基本处于不可用状态。
用 LM Studio Bionic 跑 Agent 的实操感受
现在单纯跑个对话没意思,我重点试了 LM Studio Bionic。这玩意儿不再是简单的客户端,它能让模型读项目文件、执行命令、改代码。
最方便的一点是,它能识别设备内存,直接告诉你某个模型是 Full GPU Offload Possible(可以全量卸载到 GPU)还是 Likely too large(可能太大),不用自己去算内存占用。
我给 Agent 丢了一个包含二三十份 PDF、Markdown 和表格的文件夹,上下文压力挺大,但处理得还行。之后我试着让它操作 Blender 做 3D 模型,它没用现在的 Computer Use 视觉方案,而是直接调用 Blender 内部的 Python API,效率反而更高。最后它还利用这个模型搭了个营销页面,整个链路跑通了。
不过,视频生成依然是短板。我试了 330 亿参数的 MiniMax H3 模型(原文件 498G,用了第三方压缩版),在 ComfyUI 里跑工作流,Mac mini 瞬间烫手,风扇狂转。生成一个 15 秒的视频跑了将近 90 分钟,缩短到 5 秒也需要 18 分钟。
这种用法其实就是个 Agent 服务器
用完之后我觉得,Mac mini 最核心的价值不是让你在面前用,而是把它当成一个“Agent 服务器”。
以前电脑性能是给操作者用的,现在是给后台跑的几个 Agent 用的。它没有电池,体积小,通过接力功能,我可以用 MacBook Air 当它的键盘和触控板。这种形态天然适合长时间挂机跑任务,而不是像笔记本那样担心续航或发热掉速。
如果你预算有限,6999 元起步的 16GB+256GB M6 版本其实也够 Agent 持续工作,只要你不需要在本地强行跑超大模型。
全部回复 (3)
想当场把话说完?进全球 AI 聊天室,登录就能开口。

心疼死我了,我那台16G的跑个简单的Agent就直接内存溢出,你这48G跑Llama 3.1 速度能到多少token/s?