首页 > 资讯 > 九识建成首个L4万卡集群,无人驾驶进入多模态大模型新范式

九识建成首个L4万卡集群,无人驾驶进入多模态大模型新范式

雷锋网 2026-09-17 18:14 3 阅读 查看原文

一家做无人车的公司,为什么需要一万多张GPU?

9月10日,九识CEO孔旗在广州宣布战略升级为“城市级物理AI”。一周后的9月17日,CTO庄立首次披露支撑这次升级的底层能力:九识已建成业内首个L4级万卡集群,算力集群总规模近1.5万卡。九识也成为首个建成万卡集群的L4团队。

而万卡算力的背后,是一个正在从百亿级迈向千亿级的九识APEX多模态基座大模型。

无人驾驶下半场:迈入多模态大模型新范式

在智能驾驶圈子里,长期存在一个顽固的偏见:载人自动驾驶是高科技,城市货运无人车,AI壁垒更低。但事实显然不是如此。

九识成立于2021年8月,创始团队是中国无人驾驶的拓荒者,曾在百度硅谷研究院主导了Robotaxi、Robotruck的研发工作,并为第一代Appollo开源平台作出了重要贡献。而创业之初,就选择了崭新的领域RoboVan,过去五年,这家企业围绕技术、场景、商业模式三大核心方向深耕布局。

这五年,九识干了三件事:第一件事,把技术真正做出来,发明了全球第一台Robovan;第二件事:让无人驾驶走进更多真实场景,从聚焦物流到L4技术赋能千行百业;第三件事:跑出了无人驾驶的成熟商业范式——卖车、服务、运力。

从2023年卖出第一台车,到如今,九识全球车队超过3万台,覆盖20多个国家、300多座城市,累计真实运营里程超过2.7亿公里。

但规模跑通之后,一个更根本的问题浮出水面:当无人车面对真实城市里那些无法用规则穷尽的大量长尾场景——无标识乡村道路、临时施工围挡、异形障碍物、人车无序混行、恶劣天气光影突变——分水岭到底是什么?

今天,九识从另一个维度回答了这个问题——正式披露其算力集群突破“万卡”规模,成为业内首家建成L4万卡集群的L4无人驾驶企业。

这也意味着无人驾驶开始迈入多模态大模型的新范式。

万卡算力集群,让车拥有“自我进化”的能力

万卡集群,指的是由超过一万张加速卡组成的高性能计算系统,用以训练基础大模型。

单张AI加速卡像一个高速计算单元,万卡集群则像一座由上万台计算设备组成的‘AI超级工厂’,能够把一个复杂的大模型训练任务拆解后并行处理。

更重要的是,算力的层级,将在基础设施上决定一家智驾企业的智能上限。真实的城市货运场景,充满了长尾非标路况,根本无法用人工规则穷尽。

九识的解法是用大模型去学习物理世界,而万卡集群就是训练这些模型的硬性前提。万卡算力集群,是支撑千亿大模型演进的硬核底座。

据九识披露,其APEX多模态基座大模型正在由百亿级参数规模向千亿级迈进。APEX融合了海量真实L4驾驶数据与互联网语言、视频等知识语料和真实运营的人类决策数据,通过APEX 基座训练完成后,向下赋能数据、模型、评测,实现迭代闭环。

万卡集群赋予九识的,是“自我进化”的能力。3万台车、300多座城市、2.7亿公里真实L4运营数据,每天都在喂养这套算力体系。算力越强,模型迭代越快。模型越强,运营成本越低,更多客户愿意用,车跑起来又产生更多稀缺数据。

孔旗说过一句话:“复杂城市开放道路能够产生高价值数据,而商业模式本身需要赚钱,才能持续获取数据、推动技术进步。”算力不是成本,是飞轮的起点。

APEX九识基座世界模型,让车“理解物理世界”

九识此次战略升级的核心,落在“九识大脑”上——它是九识无人车实现服务与城市治理生态的核心基座。而九识大脑的核心,是正从百亿迈入千亿的APEX多模态基座大模型。

APEX赋予九识的,是“理解物理世界的变化”。

这种能力带来四个层面的质变。

场景推理与决策能力更强,具备预测推演能力,长时序博弈预判大幅提升行驶平顺性与安全性。

知识融合能力更强,融合全网视频、交通文本、人类驾驶经验,统一理解交通灯、交警手势、道路标识、本地通行规则,跨城市通用性更强——这正是无图L4在陌生道路当日部署、全场景泛化通行的底气。

仿真业务能力提升,离线仿真动力学、人车行为高度还原,百万级工况并行仿真可信,大量边缘危险场景可在云端仿真完成验证,减少实车安全风险。

模型蒸馏与车端部署价值更高,一站式蒸馏完整端到端智驾大脑,感知、预测、规划统一权重;一套基座适配多款RoboVan车型,批量轻量化,大幅降低多车型迭代成本。

车云协同:车端跑日常,云端解难题,模型自进化

基于APEX多模态基座大模型,九识构建了一套车云协同机制。核心逻辑很简单:场景越复杂,云端大模型介入越深。

当前主流的车端端到端模型,可以较好覆盖覆盖30+km/h的一般道路行驶场景,但存在能力边界。九识打造的车云联动大模型架构,会针对不同路况与速度区间分层部署模型:在5-30km/h复杂道路场景,依托车端VLA进行本地实时推理的同时,会调用云端VLA模型进行理解增强。而在0-5km/h末端场景,除了车端VLA模型和云端VLA理解增强模型,更创新推出了安全员Agent,能够自主完成极端场景下的救援脱困,作出绕行、重新规划路线、靠边停车等高阶决策。通过车端基础算力与云端增强能力的有机结合,九识突破传统L2方案的场景局限,实现常规道路、复杂路况、救援脱困的全场景覆盖。

九识和L2的本质区别不在于车速,而在于车端知道自己“不行了”时会主动降速或停车,呼叫云端分析并给出指令,而不是被动等待接管。

这套协同能持续进化,靠的是闭环迭代:真实数据回流至APEX基座,基座能力提升后支撑云端模型升级,云端模型再通过蒸馏输出更优的车端模型。APEX通过知识蒸馏和物理推演,构建起覆盖车端VLA、云端VLA、安全员Agent等模型矩阵,各模型产出的场景数据持续回流,反哺基座迭代优化。

一个细节值得注意:九识的VLA并不强制翻译成人类语言再去操控车。它更像人类行动前的“念头”——看到前方有车决定刹车让行,这个“念头”比说出“我要刹车”快得多,也更抽象、更压缩。九识用对齐人类语言的方式,让模型在决策前先思考因果。

车端保证实时安全,云端提供认知上限,Agent兜底极端场景。万卡算力是硬件工厂,APEX多模态基座大模型是软件大脑,2.7亿公里L4真实运营里程是场景底座。三者形成数据、算力、模型、工程四重自增强壁垒。

商业规模不是终点,是燃料

九识此次战略升级的底气,来自已经跑通的商业化规模:覆盖20多个国家、300多座城市,真L4实际运营里程超过2.7亿公里,运营车队规模3万多台,三年运力增长100倍。

但这些数字真正的价值,不在于规模本身。而在于2.7亿公里背后,是一个通用大模型公司拿不到的东西:真实物理世界的稀缺数据。每一台车每天在开放城市道路上遇到的交警手势、施工围挡、临时管制、人车混行,都在为APEX多模态基座大模型提供训练燃料。这些场景无法在实验室里穷举,也无法靠仿真完全复现。它们只能从真实的城市运营中来。

这正是九识从无人车公司走向城市级物理AI服务商的底层逻辑。从“运货”延伸到“城市治理”,无人车成为城市管理的能力延伸。

通用大模型公司没有物理世界的数据,做自动驾驶的公司没有足够规模的真实运营数据。九识同时拥有两者。

当3万台车每天都在为一个大模型提供稀缺的物理世界数据,规模本身就不再是终点,而是燃料。 在实现大规模商业化后,九识本质上是一家具有稀缺数据资源的大模型公司。

雷峰网 雷峰网