档案库 · AI 与模型 · 技术决策 · 2026
TurboFieldfare 2026:任何M系列Mac上2GB内存运行26B Gemma
Andrey Mikhaylov的开源Swift+Metal引擎在任意M系列Mac上以约2GB内存运行Gemma 4 26B;其Show HN获得了919分。
TurboFieldfare
做的是什么生意
An open-source (Apache-2.0) Swift and Metal inference engine, CLI, and native Mac app that run Google's instruction-tuned Gemma 4 26B-A4B in about 2GB of RAM on any Apple Silicon Mac, including 8GB ones.
起因
Andrey Mikhaylov, an iOS and Metal engineer who loves on-device AI, wanted to run a model whose 14.3GB of 4-bit weights do not fit in the memory of an 8GB Mac. He posted TurboFieldfare as a Show HN on 2026-07-29, claiming about 2GB RAM usage at 5-6 tokens/s on an 8GB M2 MacBook Air and 31-35 tokens/s on an M5 MacBook Pro.
经过
The thread took off - 919 points and 345 comments - and the maintainer answered questions in real time, sharing measured cache-hit rates and taking community results from M1 MacBooks and MacBook Neo hardware. Coverage followed on Creative AI News and German site ifun.de; the repository records 103 audited experiments behind the design, plus an optional vision companion pack for M2+ Macs. By 2026-09-02 the repository showed about 410 forks.
结果
As of 2026-09-02 TurboFieldfare remains an independent research project: Apache-2.0 code with no company, funding, or monetization, and future work pointed at iPhone/iPad ports and more low-memory Macs.
背景
TurboFieldfare是一个开源的Swift和Metal推理引擎,用于运行Google的Gemma 4 26B-A4B,这是一个26B参数的混合专家模型,每个token只激活数十亿参数。它没有将完整的14.3GB4-bit权重保存在内存中,而是保持1.35GB共享核心和FP16 KV缓存驻留,并从SSD流式读取每个token所需的路由专家,从而将内存占用降至约2GB。
Andrey Mikhaylov,一位iOS和Metal工程师,将其构建为一项赌注:在现代Apple Silicon上SSD带宽可以替代RAM。他于2026-07-29发布Show HN,包含测量结果——8GB M2 MacBook Air约5-6 token/s,M5 MacBook Pro约31-35 token/s——以及一个流式安装程序,可将Hugging Face上的约15GB权重直接重新打包为自定义格式,而无需在磁盘上暂存完整检查点。
该帖子获得919分和345条评论,评论者在M1 MacBook和MacBook Neo硬件上进行了基准测试,随后Creative AI News和ifun.de进行了报道。Creative AI News统计第一天内有800+ HN分和1,600+ GitHub星;截至2026-09-02,仓库显示约410个分叉。
该项目明确针对特定场景:其作者将其定位为与Ollama、LM Studio和llama.cpp相对的运行时,专注于将单一模型推向低内存Mac,而非通用替代品。截至2026-09-02,它仍然是免费(Apache-2.0)、独立且未商业化的,下一步是iPhone和iPad的移植。
这件事要成立,得有什么
- 内存而非计算是阻碍26B级模型进入消费级笔记本电脑的瓶颈。
- Gemma 4 26B-A4B是混合专家模型,因此每个token仅有一小部分参数被激活,无需将全部权重驻留内存。
- 针对此单一工作负载,自定义Metal内核和模型专用运行时优于包装通用的MLX或llama.cpp。
- 快速的Apple SSD使磁盘带宽成为RAM容量的实用替代。
- HN的开发者受众可以直接克隆、构建和基准测试代码,将发布声明转化为社区验证的结果。
可借鉴之处
为单一硬约束编写模型专用引擎可以胜过通用运行时,而发布真实的测量代码可以让单个工程师借助整个社区作为基准测试团队。
后续进展
截至2026-09-02,TurboFieldfare仍在积极开发中:已完成103次审计实验、包含社区基准测试指南、提供loopback OpenAI兼容服务器和可选的视觉包,约410个分叉反映了活跃的社区。作者将其描述为独立研究项目,与Google无关,并将iPhone和iPad的移植列为主要未来工作。德国网站ifun.de将其视为该尺寸模型能在8GB Mac上运行的证明,同时指出权衡之处:基础硬件的输出较慢,且SSD速度很重要。
资料来源
- TurboFieldfare - Gemma 4 26B-A4B inference in about 2 GB of RAM
- Run Gemma 4 26B on a Mac in 2GB RAM: TurboFieldfare
- Show HN: Open-source engine running Gemma 4 26B in 2 GB RAM on any M-series Mac
- Lokale KI: Freie App bringt Googles Gemma 4 auch auf das MacBook Neo
发现哪里写错了?告诉我们。
轮到你了
你刚读完一家。说说你在做什么,看看谁在赌同一件事。
免费账号 · 3 次免费提问 · 不用绑卡