花两万多块买台 Mac mini 跑 Agent 服务器到底值不值

极客阿强 中级 9小时前 638 浏览 2 点赞 约 3 分钟

直接说结论:如果你想在本地折腾 20B 到 30B 参数规模的模型,M5 Pro 配置(48GB 内存)是目前的舒适区。但如果想拿它跑 70B 的 Llama 3.1 或者重型视频生成,这机器虽然能跑,但速度慢到没法用,不建议把它当成纯 GPU 工作站。

这次我上手的是一台 M5 Pro 版本,48GB 内存 + 2T 硬盘,到手价 25749 元(分期每月 1073 元)。虽然它叫 Mini,但价格一点都不 Mini。不过现在的 AI PC 竞争点已经变了,不再是能不能跑模型,而是能不能让 Agent 在后台全天候稳定工作。

M6 芯片的 AI 性能到底如何

这次 M6 芯片的配置挺激进,12 核 GPU 每个核心都有 Neural Accelerator,还配了双 16 核 Neural Engine。官方说 AI 性能比 M4 提升了最高 4 倍。但实操本地模型时,你得盯着内存带宽看,M6 最高 32GB 统一内存,带宽 170GB/s;而 M5 Pro 能到 64GB 和 307GB/s。

花两万多块买台 Mac mini 跑 Agent 服务器到底值不值

我测了几个量化模型,结果如下:

  • GPT 20B 开源模型: 输入 72 token,生成 178 token,整轮耗时 3.64 秒,速度 55.66 token/s,体感很快。
  • Qwen3.8 27B (4-bit 量化): 回复速度依然不错,总用时 2.9s,速度 41.64 token/s。即便喂给它《Attention is all you need》这种长论文,处理速度也能维持在 32 token/s,基本能接受。
  • Meta 300 亿参数模型: 读入速度明显掉档,从 473 token/s 降到了 32 token/s。
  • Llama 3.1 70B: 勉强能跑,但发句“你好”就要等 2 分钟 48 秒,速度只有 0.05 token/s,基本处于不可用状态。
花两万多块买台 Mac mini 跑 Agent 服务器到底值不值
另外关于 GGUF 和 MLX 两种路线,简单说 GGUF 是通用格式,跨平台方便;MLX 是苹果自家的框架,专门优化 Apple Silicon。虽然 MLX 理论上更适配,但具体哪个更快其实得看具体的模型和运行时版本,没法一概而论。 花两万多块买台 Mac mini 跑 Agent 服务器到底值不值

用 LM Studio Bionic 跑 Agent 的实操感受

现在单纯跑个对话没意思,我重点试了 LM Studio Bionic。这玩意儿不再是简单的客户端,它能让模型读项目文件、执行命令、改代码。

最方便的一点是,它能识别设备内存,直接告诉你某个模型是 Full GPU Offload Possible(可以全量卸载到 GPU)还是 Likely too large(可能太大),不用自己去算内存占用。

花两万多块买台 Mac mini 跑 Agent 服务器到底值不值

我给 Agent 丢了一个包含二三十份 PDF、Markdown 和表格的文件夹,上下文压力挺大,但处理得还行。之后我试着让它操作 Blender 做 3D 模型,它没用现在的 Computer Use 视觉方案,而是直接调用 Blender 内部的 Python API,效率反而更高。最后它还利用这个模型搭了个营销页面,整个链路跑通了。

不过,视频生成依然是短板。我试了 330 亿参数的 MiniMax H3 模型(原文件 498G,用了第三方压缩版),在 ComfyUI 里跑工作流,Mac mini 瞬间烫手,风扇狂转。生成一个 15 秒的视频跑了将近 90 分钟,缩短到 5 秒也需要 18 分钟。

这种用法其实就是个 Agent 服务器

用完之后我觉得,Mac mini 最核心的价值不是让你在面前用,而是把它当成一个“Agent 服务器”。

以前电脑性能是给操作者用的,现在是给后台跑的几个 Agent 用的。它没有电池,体积小,通过接力功能,我可以用 MacBook Air 当它的键盘和触控板。这种形态天然适合长时间挂机跑任务,而不是像笔记本那样担心续航或发热掉速。

如果你预算有限,6999 元起步的 16GB+256GB M6 版本其实也够 Agent 持续工作,只要你不需要在本地强行跑超大模型。

MiniMax H3M6Mac miniM5 ProLM Studio Bionic

全部回复 (3)

想当场把话说完?进全球 AI 聊天室,登录就能开口。

运营喵小柯 中级 9小时前

心疼死我了,我那台16G的跑个简单的Agent就直接内存溢出,你这48G跑Llama 3.1 速度能到多少token/s?

0 回复
自由职业运营喵 高级 9小时前

这内存带宽还是太保守了,我之前强行塞 70B 结果直接卡死,估计得看那个统一内存的实际占用。

0 回复
小李爱学习 初级 9小时前

48G 勉强够用,我上次用 32G 强行加载 30B 的模型,风扇转得像要起飞,最后直接崩在 llama.cpp 启动页。

0 回复

发表回复

支持 Markdown 格式