EN
返回档案库

档案库 · AI 与模型 · 技术决策 · 2026

Swiftlet 在 Mac 上仅用 4.3 GB 内存流式运行 80B Qwen 模型,在 iPhone 上运行 35B 模型

一个开源的 Swift+Metal 运行时,通过从磁盘流式加载 MoE 专家,在 Mac 上以 4.3 GB 峰值内存运行真正的 Qwen3-Next-80B,并在 iPhone 上运行 35B 模型。

Swiftlet (leonickson1)

它在赌什么真正的 Qwen3-Next-80B 可以在 Mac 上以 4.3 GB 内存运行——以及 35B 在 iPhone 上运行——通过从 SSD 流式加载路由专家,而不是加载全部权重。已上线

做的是什么生意

An open-source (Apache-2.0) Swift and Metal inference runtime for Qwen3-Next and Qwen3.5/3.6 MoE models on Apple Silicon, offering a Swift package, CLI, OpenAI-compatible local server and the Priv AI iOS app that embeds SwiftletCore.

起因

Posted by developer leonickson as a Show HN on 2026-08-03, Swiftlet was built from scratch in about 10,000 lines of Swift and Metal, written with Claude Code against mlx-lm references and validated layer by layer, after earlier expert-streaming projects such as TurboFieldfare proved the thesis for Gemma.

经过

The thread (312 points, 141 comments) debated prefill limits, SSD read-disturb and whether disk-streamed speeds could ever be practical. The author conceded prefill is the weak spot and put batched expert reads for long prompts atop the roadmap, alongside a phone speed pass and a 6-bit container tier.

结果

Working end to end as of 2026-09-05: the runtime ships qpack containers for 35B, 80B and 397B Qwen models, and the open-source Priv AI iOS app embeds SwiftletCore so end users can download a 35B model and chat fully on-device.

背景

Swiftlet 是一个开源(Apache-2.0)的 Swift 和 Metal 推理运行时,用于 Apple Silicon 上的 Qwen3-Next 和 Qwen3.5/3.6 专家混合模型系列。它提供 Swift 包、CLI、兼容 OpenAI 的本地服务器,以及嵌入 SwiftletCore 的 Priv AI iOS 应用,最终用户可下载模型并在设备端聊天。

运行时的关键观察是 MoE 模型每个 token 只激活几十亿参数,因此其余权重无需驻留内存。Swiftlet 将稠密核心保持在内存中,将路由专家以固定步长的 .qpack 块存储在磁盘上,并通过有界 LFU+新近度淘汰缓存来流式加载每个 token 所需的专家。

结果是真正的 4 位 Qwen3-Next-80B(磁盘上 42 GB)在 M5 Mac 上以约 4.3 GB 峰值内存运行,速度 4.5-5 token/秒;35B 模型在 iPhone 17 上以约 2.5 GB 内存运行,约 1 token/秒。社区基准验证了 8 位 80B 在 64 GB M4 Max 上从 6.9 GB 内存提供服务的表现。

开发者 leonickson 于 2026-08-03 在 Hacker News 上发布了 Swiftlet,获得 312 分和 141 条评论。截至 2026-09-05,运行时端到端可用;路线图重点包括批量预填充、手机解码速度优化和 6 位容器层级。

这件事要成立,得有什么

  • MoE 稀疏性是一个真正的大门:80B 模型每个 token 仅激活约 3B 参数,因此仅提取路由专家的运行时可以将峰值内存降低一个数量级。
  • 一次获取,一次读取:固定步长的 .qpack 块将专家加载转换为单次 SSD 预读,运行时编译的 Metal 着色器无需构建时工具链即可在 GPU 上执行前向传播。
  • 公布诚实的限制——预填充速度等同于解码速度,手机约 1 token/秒——设定了预期,因此讨论集中在 SSD 物理限制上,而不是将演示视为虚假。
  • 可安装的应用使声明可验证:Priv AI 嵌入 SwiftletCore,任何拥有 iPhone 17 的人都可以下载 35B 模型并自行验证。

可借鉴之处

在普通硬件上运行真正的前沿级模型比演示更有说服力:80B 用 4.3 GB 内存改变了本地 AI 的含义,而公布预填充慢的权衡建立了可信度。

后续进展

截至 2026-09-05,Swiftlet 端到端可用,仍是一个单人、无资金的开源项目。README 记录了 35B、80B 和 397B 容器的验证输出、@Avicennasis 贡献的社区基准,以及明确的路线图:批量预填充(公认的弱点)、手机速度优化和 6 位容器层级。App Store 上的 Priv AI 在“实验性”设置下嵌入了 SwiftletCore 的流式模型。在所审查的来源中,未报告公司、融资轮次或除科技博客外的媒体报道。

资料来源

发现哪里写错了?告诉我们。

轮到你了

你刚读完一家。说说你在做什么,看看谁在赌同一件事。

免费账号 · 3 次免费提问 · 不用绑卡

相关案例