TurboFieldfare
14GB 的量化权重硬塞进 8GB 甚至更低内存的 Mac 里,这在常规推理逻辑下几乎是不可能的。但 TurboFieldfare 这个项目用了一种比较“暴力”且巧妙的方案:把模型权重当成缓存,只在需要时从 SSD 实时流式加载。
这个项目的核心逻辑其实是把 SSD 当成了某种形式的“虚拟内存”,虽然牺牲了速度,但极大地降低了硬件门槛。对于那些内存捉襟见肘但又想尝试大参数量模型的 Mac 用户来说,这比单纯追求量化压缩要实用得多。
下一篇
DeepMind 砍掉 AlphaFold 团队 →
简单来说,它把模型的共享部分和 KV Cache 留在内存里,而那些路由专家(Routed Experts)则留在硬盘上。每生成一个 token,它就利用 pread 并行读取所需的专家权重。为了抵消 SSD 的延迟,它在读取权重的同时让 GPU 先跑共享层,这种掩盖延迟的技巧让 8GB 的 M2 MacBook Air 也能跑起 26B 的模型,虽然速度只有 5-6 tok/s,但在低端机上能跑起来已经很离谱了。
想要实操部署的可以参考以下流程:
一、安装与权重加载
1. 下载安装 Mac App。
2. 首次启动时,程序会自动从 Hugging Face 下载约 15GB 的 Gemma 4 26B-A4B-IT 4-bit 量化权重。
二、本地服务器配置
如果你想把这个引擎接入自己的工作流,它内置了一个兼容 OpenAI 协议的本地服务器,支持流式输出和 Tool Calls。启动后可以通过标准的 API 接口调用。
三、性能实测参考
- M2 MacBook Air (8GB): 约 5-6 tok/s
- M5 MacBook Pro: 约 31-35 tok/s
这个项目的核心逻辑其实是把 SSD 当成了某种形式的“虚拟内存”,虽然牺牲了速度,但极大地降低了硬件门槛。对于那些内存捉襟见肘但又想尝试大参数量模型的 Mac 用户来说,这比单纯追求量化压缩要实用得多。
# 假设你通过命令行调用其本地服务器
curl http://localhost:8080/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "gemma-4-26b",
"messages": [{"role": "user", "content": "Hello!"}]
}'