EN
返回档案库

档案库 · AI 与模型 · 战略决策 · 2025–2026

标准智能:红杉7500万美元投资,训练代理处理原始视频

一个由大学辍学生组成的六人实验室,押注像素级视频预训练而非语言模型,将能产生可使用任何计算机的代理。

Standard Intelligence

它在赌什么一个在数百万小时原始计算机使用视频上预训练的模型,将泛化成一个能操作任何软件的代理,无需手工构建工具链。在做还没上线

做的是什么生意

Standard Intelligence is a six-person AI research lab in San Francisco, founded by Galen Mead and Devansh Pandey, building FDM-1: a foundation model pretrained directly on millions of hours of screen video that predicts mouse movements, clicks and keystrokes. Its goal is an agent that explores and operates software the way a person would, and it has also released an open conversational-speech model, hertz-dev.

启动资金$75M Series A announced April 2026, co-led by Sequoia Capital and Spark Capital, with angels including Andrej Karpathy, Stanley Druckenmiller and Milan Kovac; the team numbered six people at the time of the round.

起因

Galen Mead and Devansh Pandey met in 2022 as teenagers in the Atlas Fellowship, a selective program for high-school students interested in AI alignment, then left their undergraduate programs to found Standard Intelligence. Sequoia's write-up calls their bet the 'Tesla FSD approach applied to knowledge work': pretrain on the raw stream of computer use and let generality emerge, instead of hand-engineering workflows.

经过

FDM-1, the lab's first foundation model trained directly on computer-use video, can extrude a CAD gear in Blender, drive a car around a San Francisco block after an hour of fine-tuning and find bugs by exploring software, according to Sequoia. On April 30, 2026 Standard Intelligence announced a $75M Series A co-led by Sequoia and Spark Capital, with Andrej Karpathy among the angels; Pulse2 reported that the founders say FDM-1 moved computer use 'from a data-constrained regime to a compute-constrained one.'

结果

Still a research lab: FDM-1 has demonstration videos but no public product or API as of April 2026. The round funds compute scaling and alignment research on 'general learners,' and the lab has released an open speech model, hertz-dev, while the six-person team hires researchers.

背景

Standard Intelligence 是旧金山的一个六人AI研究实验室,由 Galen Mead 和 Devansh Pandey 创立,他们在 Atlas Fellowship 中相识,离开大学后致力于对齐通用人工智能。其投资方红杉认为,通用计算机代理的最佳路径在于原始视频:在计算机使用流上预训练,让通用性涌现,就像特斯拉从像素扩展到自动驾驶一样。

实验室构建了一个1100万小时的计算机操作数据集,红杉称其为行业内最大的数据集,同时其视频编码器比竞争对手方法在token效率上高约50倍,使得数小时的30帧每秒屏幕录像可以适应100万token的上下文窗口。其第一款模型 FDM-1 在数据上训练,能够在 Blender 中挤出CAD齿轮,经过一小时微调后能驾驶汽车,并通过探索软件找到缺陷。

2026年4月30日,Standard Intelligence 宣布由红杉资本和 Spark Capital 联合领投的7500万美元A轮融资,天使投资人包括 Andrej Karpathy、Stanley Druckenmiller 和 Milan Kovac。Pulse2 报道创始人的声明:FDM-1 将计算机使用从数据受限转变为计算受限,并且该资本解锁了几个数量级的计算能力。

截至2026年4月,FDM-1 是一个带有演示的研究模型,而非产品。开放问题是视频预训练能否击败 OpenAI、Anthropic 和 Google 销售的语言模型代理栈。实验室还发布了开源语音模型 hertz-dev,以及如何在不到50万美元下构建30 PB存储的描述。

这件事要成立,得有什么

  • 数据在框架无法扩展的地方规模化:1100万小时的屏幕视频是他人未构建的预训练集,并且随着人类使用计算机而自动增长。
  • token效率是解锁点:一个效率高约50倍的视频编码器使训练数小时的30帧每秒footage成为可能,而非不可能。
  • 逆势资本:红杉和 Spark 支持了一个没有产品的六人团队,押注新的预训练框架而非包装来构建通用代理。
  • 对齐是赌注的一部分:创始人在AGI对齐奖学金中相遇,并将安全研究视为扩展的条件,而非事后补救。

可借鉴之处

当所有人都围绕现有模型搭建脚手架时,返回到它从未使用的数据:原始屏幕视频成为这个六人实验室相对于所有代理框架的优势。

后续进展

截至2026年4月30日,Standard Intelligence 正在使用其7500万美元A轮融资,据其创始人称,以“几个数量级”的规模扩展计算,并招聘研究人员,研究他们所谓的通用学习者的对齐科学。FDM-1 仍然是一个研究模型,仅有演示视频而非产品,实验室还发布了 hertz-dev(一个开放的8.5B参数语音模型),并撰写了在不到50万美元下构建的30 PB存储集群。视频预训练代理能否在真实计算机工作上击败语言模型代理栈,仍无定论。

资料来源

发现哪里写错了?告诉我们。

轮到你了

你刚读完一家。说说你在做什么,看看谁在赌同一件事。

免费账号 · 3 次免费提问 · 不用绑卡

相关案例