EN
返回档案库

档案库 · 硬件与设备 · 技术决策 · 2016–2025

Groq的LPU赌注:病毒式传播的500 tok/s演示,6.4亿美元融资,Meta合作

由谷歌TPU联合发明人创立的仅推理芯片初创公司,在2024年走红,以28亿美元估值融资6.4亿美元,并为Meta的官方Llama API提供支持。

Groq

它在赌什么大语言模型推理(而非训练)将成为瓶颈,而一种具有确定性时序、专为推理设计的LPU芯片,能够在速度和每token成本上超越GPU。在扩

做的是什么生意

AI inference hardware and cloud: designs the LPU (language processing unit) chip, manufactures it at Samsung's foundry, and sells fast low-latency model inference via the GroqCloud API and data-center deployments.

启动资金Over $1B raised; the August 2024 Series D added $640M led by BlackRock at a $2.8B valuation, with Neuberger Berman, Cisco, KDDI and Samsung Catalyst Fund participating.

起因

Jonathan Ross helped invent Google's TPU, then co-founded Groq in 2016 with Douglas Wightman. The bet was contrarian: skip the GPU training arms race and build a language processing unit whose only job is fast, predictable LLM inference.

经过

Groq stayed quiet for years, then hit public consciousness on 19 February 2024, when the Hacker News post 'Groq runs Mixtral 8x7B-32k with 500 T/s' drew 847 points and 472 comments. In August 2024 it raised a $640M Series D led by BlackRock at a $2.8B valuation, taking total funding past $1B; GroqCloud had 356,000 developers and the company planned to deploy 108,000 LPUs by Q1 2025.

结果

Still running and scaling: in April 2025 Groq announced a partnership with Meta to power the official Llama API at up to 625 tokens/sec, with more than 1.4 million developers on its platform.

背景

Groq制造定制芯片,专为一项任务:快速运行大语言模型。其LPU(语言处理单元)是为推理而非训练设计的,公司声称现有开源模型在其上运行的速度是传统处理器的10倍,能耗为其十分之一。

创始人Jonathan Ross在2016年与Douglas Wightman共同创立Groq之前,曾参与发明谷歌的TPU。该公司在相对默默无闻中耕耘,直到2024年2月19日,“Groq以500 T/s运行Mixtral 8x7B-32k”的帖子登上Hacker News榜首,获得847分和472条评论,使LPU速度成为AI行业本周的演示。

速度带来了资本和客户。2024年8月,Groq完成了由BlackRock领投的6.4亿美元融资,估值28亿美元,总融资额超过10亿美元,GroqCloud上有35.6万开发者,并计划在2025年第一季度部署10.8万个LPU。2025年4月,它宣布合作,为Meta的官方Llama API提供支持,速度高达每秒625个token。

这一赌注是推理——而非训练——将成为AI经常性成本的瓶颈,而一种具有可预测延迟的专用芯片将赢得该市场,即使面对Nvidia的路线图。Groq仍为私有,正在扩大其云和企业部署,而Nvidia仍控制着它所攻击的AI芯片市场的大部分份额。

这件事要成立,得有什么

  • 推理是规模化业务:每个部署的模型每天都会产生token,因此每token成本比峰值训练性能更重要。
  • 病毒式的500 T/s演示在销售之前就创造了需求——GroqCloud在几个月内达到35.6万开发者。
  • 单一用途芯片使设计足够简单,能用小团队投入生产,而GPU平台则复杂度高。
  • 与Meta合作使Groq进入官方Llama API,将开源模型冠军变成了其分发渠道的锚点。

可借鉴之处

选择瓶颈,而非市场:Groq并没有试图在训练上超越Nvidia;它赌的是推理速度将更重要,并将速度作为产品——使一家芯片初创公司成为Meta的推理合作伙伴。

后续进展

截至2025年4月下旬,Groq仍为私有,正在扩张:Meta Llama API合作(高达每秒625个token)已向部分开发者预览,GroqCloud开发者超过140万,公司正在扩大其三星4纳米LPU供应,朝着10.8万芯片的部署目标迈进。其竞争仍来自Nvidia的路线图和云巨头的定制芯片;悬而未决的问题是,随着GPU供应商增加低延迟产品线,仅推理芯片能否保持其成本优势。

资料来源

发现哪里写错了?告诉我们。

轮到你了

你刚读完一家。说说你在做什么,看看谁在赌同一件事。

免费账号 · 3 次免费提问 · 不用绑卡

相关案例