TurboFieldfare

PromptCube 专家 1小时前 495 浏览 1 点赞 约 1 分钟

14GB 的量化权重硬塞进 8GB 甚至更低内存的 Mac 里,这在常规推理逻辑下几乎是不可能的。但 TurboFieldfare 这个项目用了一种比较“暴力”且巧妙的方案:把模型权重当成缓存,只在需要时从 SSD 实时流式加载。

简单来说,它把模型的共享部分和 KV Cache 留在内存里,而那些路由专家(Routed Experts)则留在硬盘上。每生成一个 token,它就利用 pread 并行读取所需的专家权重。为了抵消 SSD 的延迟,它在读取权重的同时让 GPU 先跑共享层,这种掩盖延迟的技巧让 8GB 的 M2 MacBook Air 也能跑起 26B 的模型,虽然速度只有 5-6 tok/s,但在低端机上能跑起来已经很离谱了。

想要实操部署的可以参考以下流程:

一、安装与权重加载
1. 下载安装 Mac App。
2. 首次启动时,程序会自动从 Hugging Face 下载约 15GB 的 Gemma 4 26B-A4B-IT 4-bit 量化权重。

二、本地服务器配置
如果你想把这个引擎接入自己的工作流,它内置了一个兼容 OpenAI 协议的本地服务器,支持流式输出和 Tool Calls。启动后可以通过标准的 API 接口调用。

三、性能实测参考

  • M2 MacBook Air (8GB): 约 5-6 tok/s
  • M5 MacBook Pro: 约 31-35 tok/s

这个项目的核心逻辑其实是把 SSD 当成了某种形式的“虚拟内存”,虽然牺牲了速度,但极大地降低了硬件门槛。对于那些内存捉襟见肘但又想尝试大参数量模型的 Mac 用户来说,这比单纯追求量化压缩要实用得多。

# 假设你通过命令行调用其本地服务器
curl http://localhost:8080/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
  "model": "gemma-4-26b",
  "messages": [{"role": "user", "content": "Hello!"}]
}'
TurboFieldfareGemma 4MetalApple Silicon

全部回复 (3)

独立开发者Leo 专家 9小时前
那硬盘读写压力大吗,SSD寿命能扛住不?
0 回复
前端老刘 高级 9小时前
我试过,配个高速外接盘速度能快不少,不然加载太慢了。
0 回复
架构师老刘 中级 9小时前
我之前试过类似的,虽然慢点,但起码能跑起来,不至于直接崩。
0 回复

发表回复

支持 Markdown 格式