档案库 · 开发与企业工具 · 技术决策 · 2025–2026
Kog:赌GPU的瓶颈在软件而非芯片:让现有GPU上的LLM推理快30倍
法国独立创始人逆向工程NVIDIA H200 / AMD MI300X至汇编级;3,000 TPS演示登上HN首页,收获200+商机
Kog
做的是什么生意
Sells the Kog Inference Engine (KIE), software that speeds up LLM inference on standard datacenter GPUs like the Nvidia H200 and AMD MI300X
启动资金:Seed round co-led by Varsity VC; backed by France's Bpifrance, the French Tech 2030 program and cloud provider Scaleway (amounts undisclosed)
起因
Solo founder Gaël Delalleau combines two backgrounds: solid-state physics from École Polytechnique, and four DEFCON CTF finalist appearances as a white-hat hacker. His earlier startup, TC50 2009 alum Stribe, was co-founded with Kamel Zeroual — the Varsity VC founder who later co-led Kog's seed round.
经过
Kog emerged from stealth in May 2026 with a Hacker News tech preview claiming 'extremely fast single-request decoding' on the AMD MI300X and Nvidia H200 — 3,000 per-request tokens per second with Laneformer 2B, since open-sourced. The demo generated 200+ business leads. Listening to prospects, Kog learned enterprise customers wouldn't fine-tune small models, so it refocused from small-model demos to accelerating the large models enterprises actually deploy.
结果
Still pre-product-market fit as of Sep 2026: an 11-person team hand-optimizing chip by chip, working toward a first major model at 10x speed in September 2026 — the milestone that is supposed to unlock a Series A.
背景
Kog是在押注与整个AI推理产业相反的方向。当市场为Cerebras的IPO欢呼,推崇定制推理芯片时,法国初创公司Kog声称真正的提升空间位于企业已有的GPU内部。其2026年5月的Hacker News技术预览展示了在AMD MI300X和Nvidia H200(标准数据中心硬件)上每请求每秒3,000 token的性能,使用的正是其随后开源的20亿参数模型Laneformer 2B。
该方法源于创始人不寻常的双重背景。Gaël Delalleau曾在巴黎综合理工学院学习固体物理学,并四次参加DEFCON的夺旗赛。他将Kog的方法描述为理解“物理定律,以及GPU的定律”——向下逆向工程硬件至汇编与二进制代码,并将其用于非设计目的。这意味着对每款芯片进行数周或数月的人工研究,这一限制塑造了整个公司:只有11名员工,Kog每次只能支持少数几种芯片架构。
其定位在拥挤的赛道中很关键。同为法国公司的ZML,通过硬件无关的软件层绕开CUDA;而Kog则明确区分自己,将自己与斯坦福的Hazy Research相比,但更聚焦于GPU加速。其切入点是解码速度(生成中的顺序部分)受限于软件而非芯片,而更新的GPU拥有供应商技术栈从未释放的内存带宽。演示验证了这一点,足以产生200多个实实在在的商业线索。
市场告诉Kog要改变目标。潜在客户不愿微调小型专用模型,因此该初创公司将工程重点从2B演示模型转向加速企业已运行的大模型。这是一个更艰难的技术目标,Delalleau承认公司必须在筹集A轮前证明该方法能迁移到LLM。欧洲主权技术顺风——BPI France、French Tech 2030和Scaleway——在尝试期间提供了资金支持。
这件事要成立,得有什么
- Delalleau反转了行业问题:不是问‘我们需要什么芯片’,而是问‘在我们的芯片中还留有多少潜力’——这比制造硅片的赌注更便宜
- 黑客方法是护城河:将每款GPU逆向工程至汇编与二进制级别需要数月,难以复制且难以自动化——正因如此,Kog每次只能支持少数芯片
- 在真实的企业硬件(H200、MI300X)上演示,而非在奇特芯片上跑基准测试,使得其主张对真正的买家可信,从而获得200多个线索
- 根据潜在客户的行为而非创始人偏好转向大模型,使公司与企业的实际投资保持同步
可借鉴之处
当每个人都通过购买新硬件来应对硬件瓶颈时,逆向思维是你已有的硬件尚未被充分利用——但前提是你愿意深入挖掘去证明它
后续进展
截至2026-09-03,Kog是一家未产生收入、有11名员工的巴黎初创公司,面临着自设的最后期限:到2026年9月实现首个主要模型10倍加速,CEO Delalleau称这将解锁A轮融资。Laneformer 2B已开源;设计合作伙伴正在KIE基础上构建提示到应用的产品。团队计划将其人工芯片优化编码为代理式流水线。Bpifrance、French Tech 2030和Scaleway带来了主权技术顺风;Varsity VC是披露的领投方。悬而未决的问题是:30倍加速能否从2B模型推广到前沿规模的LLM?
资料来源
- Kog is going deeper to squeeze more inference out of GPUs
- French Startup Kog Targets 30x Faster GPU Inference Speeds
- Hacker News: Kog — real-time LLM inference on standard GPUs
发现哪里写错了?告诉我们。
轮到你了
你刚读完一家。说说你在做什么,看看谁在赌同一件事。
免费账号 · 3 次免费提问 · 不用绑卡