档案库 · AI 与模型 · 产品决策 · 2018–2024
ELYZA看好日语大语言模型能击败英语优先模型,KDDI将其纳入麾下
东京的ELYZA构建了针对日语优化的大语言模型,声称日语能力达到GPT-4水平;2024年KDDI将其变为子公司,销售企业生成式AI服务。
ELYZA Inc. [株式会社ELYZA]
做的是什么生意
Tokyo-based LLM startup (University of Tokyo Matsuo lab spin-off) that builds Japanese-language large language models and enterprise GenAI services (ELYZA LLM for JP, ELYZA Works).
启动资金:KDDI invested 'several billion yen' [数十億円, on the lower end of the range per KDDI's CEO] for the 53.4% stake; exact amount undisclosed.
起因
ELYZA was founded in September 2018 by members of the University of Tokyo Matsuo lab and focused on LLM research and enterprise deployment from summer 2019. On 2024-03-12 it released the 70B-parameter ELYZA-japanese-Llama-2-70b, claiming the highest Japanese-language accuracy among domestic models, matching global ones.
经过
On 2024-03-18 ELYZA, KDDI and KDDI Digital Divergence signed a capital/business alliance: from 2024-04-01 KDDI held 43.4% and KDDI Digital Divergence 10.0%, making ELYZA a consolidated subsidiary while keeping a swing-by IPO path. KDDI said it would build roughly ¥100 billion of compute infrastructure for it and roll out enterprise/local-government GenAI services from spring 2024.
结果
Still running as KDDI's enterprise-GenAI engine: it supplies Japanese LLMs and AI services to enterprises and local governments, with a swing-by IPO as the stated goal.
背景
ELYZA于2018年9月由东京大学松尾实验室成员创立,从2019年夏季开始专注于大语言模型研究和企业部署。其赌注是日本企业需要真正精通日语的模型——而英语优先的前沿模型留下了这个空白——因此东京的小型实验室可以通过针对日语优化开放模型来取胜,而不是追逐全球前沿。
该方法跳过了最昂贵的步骤:ELYZA没有从头预训练模型,而是采用Meta的开放Llama模型,并添加大规模日语预训练和指令微调,同时获得经产省支持,独家使用日本AIST ABCI超级计算机13%的资源。2024年3月,它发布了700亿参数的ELYZA-japanese-Llama-2-70b,声称在国内模型中日语表现最佳。
2024年3月18日,ELYZA、KDDI和KDDI Digital Divergence签署资本和业务联盟:从2024年4月1日起,KDDI持有43.4%,KDDI Digital Divergence持有10.0%,使其成为合并子公司,同时保留swing-by IPO路径。KDDI——本身没有自研前沿模型,而NTT(Tsuzumi)和软银都在构建自己的模型——表示将投资约1000亿日元建设计算基础设施,并从2024年春季开始销售企业和地方政府生成式AI服务。
2024年6月26日,ELYZA发布了Llama-3-ELYZA-JP-70B和Llama-3-ELYZA-JP-8B,声称70B模型在2024年6月底的两个日语基准(ELYZA Tasks 100和Japanese MT-Bench)上匹配或超过了GPT-4、Claude 3 Sonnet和Gemini 1.5 Flash,并将8B模型开源到Hugging Face。
这件事要成立,得有什么
- 英语优先的模型难以处理日语,因此通用的全球大语言模型在日语企业应用上留下了准确性空白。
- 在开放Llama模型上进行构建,跳过了耗资数十亿美元的预训练步骤,同时仍然产生差异化的日语模型。
- 松尾实验室的血统加上METI/AIST超级计算机接入,提供了初创公司无法买到的信誉和算力。
- KDDI没有自研前沿模型,而NTT和软银都在构建自己的模型,因此收购ELYZA可以立即获得国内大语言模型的可信度。
- swing-by IPO结构让ELYZA在运营商的算力和销售资产中保持创始人主导的增长。
可借鉴之处
小型实验室可以通过掌握大厂忽视的细分领域(日语流利度)并站在开放模型上跳过最昂贵的步骤来竞争;退出方式是收购一家需要国内AI信誉的电信运营商。
后续进展
截至2024年6月下旬,ELYZA作为KDDI的合并子公司运营:2024年6月26日发布了Llama-3-ELYZA-JP-70B和8B(70B提供API和演示网站,8B在Hugging Face开源),并与KDDI一起推出企业和地方政府生成式AI服务,包括与Altius Link开发的联络中心大语言模型;swing-by IPO仍是既定目标。
资料来源
- ELYZAとKDDIグループ、生成AIの社会実装に向け資本業務提携を締結
- KDDI、生成AIのELYZA子会社化 最高性能の日本語LLMを展開
- 「GPT-4」超えを達成した国産日本語LLM、AIスタートアップのELYZAが開発・公開
发现哪里写错了?告诉我们。
轮到你了
你刚读完一家。说说你在做什么,看看谁在赌同一件事。
免费账号 · 3 次免费提问 · 不用绑卡