EN
返回档案库

档案库 · AI 与模型 · 产品决策 · 2023–2026

Boson AI押注开源Higgs语音模型能超越云巨头;融资7000万美元,仓库星标7500个

前AWS科学家Smola和李沐开源Higgs TTS,以培育语音AI技术栈;融资7000万美元,同时Higgs RealTime准备挑战OpenAI和Meta。

Boson AI

它在赌什么语音是下一个人类与AI的交互界面,而开源权重全栈模型系列可以在成本上击败OpenAI和Meta——开源带动采用,付费API实现变现。在扩

做的是什么生意

Boson AI builds foundation audio models — Higgs TTS, speech-to-speech and avatar APIs — for conversational voice agents, targeting enterprises in finance, telecom, healthcare and insurance, with open weights for earlier models.

启动资金$70M raised across seed rounds; backed by Chinese entrepreneur Su Hua and Temasek's venture arm (Fortune, 2026-07-27).

起因

Alex Smola, a former distinguished scientist at AWS, co-founded Boson AI in 2023 with Mu Li (李沐), his former student and a co-creator of the MXNet deep-learning framework, after concluding the industry was moving beyond text-only interfaces into multimodal audio and vision. The company began shipping Higgs-series models and open-sourced Higgs TTS 2 in May 2025.

经过

Higgs TTS 2's open release built community traction — the boson-ai/higgs-audio repo hit 7.5K GitHub stars by 21 October 2025 (7.5x growth in Q4 2025, ROSS Index) — and the company kept shipping: Higgs TTS 3 on 04 June 2026 (100+ languages, zero-shot voice cloning, inline emotion control), a Higgs Avatar API in June 2026, and a Higgs Audio Hackathon in March 2026. Fortune reported $70M raised, backed by Su Hua and Temasek, with enterprise targets in finance, telecom, healthcare and insurance.

结果

Live and scaling: as of September 2026 Boson AI is preparing Higgs RealTime, its first speech-to-speech model, claiming roughly one-tenth the cost of rivals like OpenAI; the Higgs Audio v3 release now lives on Hugging Face with a hosted API at boson.ai.

背景

Boson AI构建基础音频模型——文本到语音、语音到语音和虚拟形象生成——用于对话式语音代理。其Higgs系列包括Higgs TTS 2(2025年5月开源,基于超过1000万小时音频训练)、Higgs TTS 3(2026年6月,支持100多种语言,具备零样本克隆和内联情感控制)、Higgs Avatar API,以及即将推出的Higgs RealTime语音到语音模型。

公司由Alex Smola(前AWS杰出科学家)和李沐(他的学生、MXNet框架联合创建者)于2023年创立,基于对AI将超越纯文本界面的信念。Boson的策略是开放权重发布以促进开发者采用,同时通过托管API和企业许可获得收入。

开源押注体现在GitHub上的表现:截至2025年10月21日,boson-ai/higgs-audio仓库的星标达到7500个(增长7.5倍,根据Runa Capital ROSS指数2025年第四季度)。财富杂志2026年7月报道,该公司已筹集7000万美元,投资方包括宿华和淡马锡风投部门,目标客户包括金融、电信、医疗和保险,并声称其模型成本约为OpenAI竞争对手的十分之一。

用一句话概括其赌注:语音是下一个人类与AI的交互界面,一个全栈、更便宜、开放权重的替代方案可以在OpenAI、Meta和ElevenLabs之间开辟一条道路——即使面对能将语音捆绑到现有平台的大型厂商。

这件事要成立,得有什么

  • 开源早期Higgs模型积累了开发者的好感度和GitHub可见性,无需广告预算,为后续付费API所使用的生态播下了种子。
  • 十分之一成本的声称针对了语音AI中成本最高的问题——推理成本——使价格成为对抗资金充足的大型厂商的楔子。
  • 全栈押注(TTS、ASR、虚拟形象、语音到语音)让企业有一个供应商就能完成整个语音循环,并满足数据驻留需求。
  • 首先瞄准金融、电信、医疗和保险,为早期公司获得了狭窄的企业滩头阵地,然后再扩展到消费级规模。

可借鉴之处

开放权重发布是模型初创企业的低成本分销:免费提供早期模型可获得GitHub可见性和开发者好感,而付费API和企业许可则可稍后实现价值捕获。

后续进展

截至2026年9月2日,Boson AI正在运营并扩展。Higgs TTS 3于2026年6月4日发行,带开放权重在Hugging Face上,并在boson.ai上提供免费托管预览;Higgs Avatar API于2026年6月推出;Higgs RealTime(公司首个语音到语音模型)计划于2026年8月左右推出(来源:Crypto Briefing、财富杂志)。公司报告约7000万美元融资,投资方包括宿华和淡马锡,并销售支持本地部署、数据驻留的企业解决方案,覆盖金融、电信、医疗和保险。

资料来源

发现哪里写错了?告诉我们。

轮到你了

你刚读完一家。说说你在做什么,看看谁在赌同一件事。

免费账号 · 3 次免费提问 · 不用绑卡

相关案例