档案库 · AI 与模型 · 产品决策 · 2026
Silmaril押注提示注入防御必须自我修复:YC W26防火墙在20毫秒内阻断攻击
YC 2026年春季初创公司Silmaril销售AI代理的运行时防火墙,大约20毫秒内阻断有害工具调用,并在每次攻击后一小时内重新训练。
Silmaril
做的是什么生意
Silmaril sells runtime security for AI agents: a firewall that evaluates intent, application context, and execution state, blocks harmful tool calls in about 20 milliseconds, and retrains itself within an hour.
起因
Aum Upadhyay built security frameworks protecting AWS's AI infrastructure, and Eduardo Velasco developed hardened models for Amazon's homepage; after leaving, the pair became whitehat hackers and, by their account, hacked OpenAI, Anthropic, Google, and Microsoft 15 times in two weeks. Seeing how far ahead attackers were, they founded Silmaril in San Francisco in 2026 in Y Combinator's Spring 2026 batch.
经过
Silmaril launched in 2026 claiming it blocked 96% of real-world contextual and emerging attacks versus 61% for leading guardrails, with about 20ms latency overhead and a self-healing loop that retrains and deploys updated weights within an hour. YesPress reported 95.6% accuracy across 131 attack techniques versus 79.2% for Perplexity BrowseSafe and 74.3% for Lakera GuardAI, and the company said it had stopped $28M of customer damages.
还没有结局,它还在跑。
背景
Silmaril,一家位于旧金山的初创公司,属于Y Combinator 2026年春季批次,押注提示注入防御不能是静态过滤器。随着AI代理阅读网页、邮件和文档并据此行动——调用工具、转移资金、访问数据库——一份不可信文档中的一句话可以借用代理的手,因此公司问了与护栏不同的问题:不是“这个输入坏吗?”而是“这个执行是否走向有害?”
联合创始人Aum Upadhyay和Eduardo Velasco来自同一学科的对立面:Upadhyay构建了保护AWS AI基础设施的安全框架,Velasco为亚马逊主页开发了加固模型。离职后,两人成为白帽黑客,据他们自称,在两周内入侵了OpenAI、Anthropic、Google和Microsoft共15次,这让他们确信攻击者领先于所有现有防御。
该产品为代理包裹一个运行时防火墙,读取用户意图、应用上下文和执行状态,在大约20毫秒内阻断有害工具调用,并运行自主威胁猎杀代理来探测每个客户应用的多步攻击链。验证的漏洞喂给再训练循环,在一个小时内更新部署权重,匿名学习跨部署共享。
公司声称对真实世界上下文威胁的阻断率达到96%,而领先护栏为61%,并阻止了2800万美元的客户损失,但这些数字是自行报告的。Silmaril处于早期阶段——团队大约两到三人——在拥挤的AI安全淘金热中与Lakera、Prompt Security、Protect AI和HiddenLayer竞争。
这件事要成立,得有什么
- 提示注入是工具调用代理最大的未解决风险,而这一市场在代理出现前几乎不存在。
- 基于结果的检测能捕获多步攻击,而单输入分类器在设计中就会错过。
- 20毫秒延迟让控制措施无形到足以保持启用——这是控制措施被部署还是被禁用的差别。
- 自我再训练循环加上匿名威胁共享随着每次部署而增值,这是安全产品很少拥有的网络效应。
可借鉴之处
在全新的故障模式中,可辩护的主张是速度加学习:一个增加20毫秒并自我再训练的控制措施符合部署现实,而需要手动调整的过滤器会被关闭。
后续进展
截至2026年9月,Silmaril处于种子阶段,团队大约两到三人,通过语言SDK集成,为Claude Code、OpenClaw和OpenCode提供代理插件,以及LiteLLM等AI网关,以SaaS或自托管方式销售。它引用了AICPA SOC和ISO 27001认证,以及云安全联盟和NVIDIA孵化计划的成员资格,但性能和损失数字仍然是公司自己的,独立基准尚未完成。
资料来源
- Launch YC: Silmaril: Self-healing Prompt Injection Defense
- Silmaril: The Self-Healing Firewall for AI Agents
- Silmaril: Security for agents that self-improves
发现哪里写错了?告诉我们。
轮到你了
你刚读完一家。说说你在做什么,看看谁在赌同一件事。
免费账号 · 3 次免费提问 · 不用绑卡