Veeda AI由前NVIDIA研究员Sanja Fidler等人创立,专注开发专为机器人训练设计的多模态世界模型,通过高保真、物理准确的模拟环境支持交互式试错学习,解决具身智能数据成本高、质量低的瓶颈;公司近期完成9000万美元种子轮融资,技术路线融合生成式AI与物理仿真,目标是实现Sim2Real闭环训练。
物理AI的规模化,受限于数据的数量和质量,数据受限于数量和质量的原因又在于获取成本。
人类的学习范式是在与环境的互动中不断试错直至成功,大语言模型也是跨越了海量文本的被动训练,转向交互式任务与反馈,才解锁了全新能力。
想象下,如果机器人能通过与世界的交互来学习,它有可能很大程度上解决具身智能数据成本和质量的悖论。
但是,现实世界目前并不具备让机器人通过试错来学习的可行性,因为这不安全、成本高、耗时长。要实现交互式学习的规模化,机器人必须在模拟现实中学习。
Veeda AI正在开发用于模拟物理世界的多模态“世界模型”。其目标是构建可无限扩展的模拟环境,通过高频交互训练具身智能体。
它由前NVIDIA研究员、知名计算机科学家Sanja Fidler领衔创立,近日完成9000万美元种子轮融资,本轮融资由Khosla Ventures与Radical Ventures联合领投。
在联合创立Veeda前,Sanja Fidler(CEO )曾任NVIDIA AI研究副总裁,掌管空间智能实验室,并共同推动了3D场景合成与生成式AI领域的底层技术突破。
联合创始人Zan Gojcic曾任NVIDIA研究总监,在神经重建及构建自主智能体训练所需的高保真模拟环境方面造诣深厚。联合创始人Huan Ling曾任NVIDIA生成式AI研究经理,后出任某生成式AI初创公司首席科学家,在开发复杂系统所需的实时高分辨率视觉合成技术方面具有丰富经验。

Veeda的创始团队,图片来源:Veeda
Zan Gojcic与Huan Ling在NVIDIA期间与Sanja Fidler长期共同研究。Sanja Fidler和团队在参与Omniverse相关工作时,发现Physical AI“真正缺失的关键拼图是内容”。
团队因此从3D生成和神经重建入手,希望把真实世界的数据更快转化为可用于机器人训练的虚拟环境。到后来,3D Gaussian Splatting等技术已经可以让研究者扫描现实空间,再直接导入Isaac(NVIDIA的机器人仿真与训练平台)中训练机器人。
与此同时,他们也看到了传统图形管线的局限:Physical AI还需要对智能体和物理进行建模。团队因此探索另一条路线:让世界模型直接承担内容创建和世界仿真,并基于用户交互生成后续世界。
早期的GameGAN已经在尝试让AI替代游戏引擎,用户输入动作后,由模型生成下一帧;
2021年的DriveGAN进一步使用大量自动驾驶视频;
2023年,团队又把Latent Diffusion扩展到视频,随后沿着规模化训练继续发展到Cosmos。
在进一步研究中,他们面对的问题也逐渐从“怎样生成一个更真实的世界”,转向“怎样让这个世界真正成为Physical AI可以使用的仿真环境”。
Sanja Fidler在2025年的播客中提到,要在现实世界的规模、多样性和真实感下,实现可信且物理准确的仿真,目前仍没有确定的技术路径。传统物理求解器难以覆盖如此复杂的现实世界,生成模型也会出现幻觉、物体消失和穿模。
她认为,两条路线最终可能需要结合:先用物理求解器对部分效应进行3D仿真,再将结果作为世界模型的引导,让世界模型进一步生成更丰富的时空场景。
2026年6月发布的OmniDreams是Sanja Fidler、Zan Gojcic、Huan Ling创业前的最后一批研究之一。它基于Cosmos进行后训练,是一个用于自动驾驶闭环仿真的动作条件化生成式世界模型。它可根据驾驶动作实时生成后续观测,与驾驶策略形成闭环,并支持数分钟连续推演。
NVIDIA还用它进行策略评估,OmniDreams对四种驾驶策略的排名与基于真实数据重建的自动驾驶仿真方案NuRec一致,开始验证生成式世界模型作为训练和评估环境的能力。
Veeda的技术路线和OmniDreams的思路很像:为Physical AI构建模拟现实,并进一步把这种生成式、可交互的世界从自动驾驶扩展到更广泛的机器人训练。
Veeda的核心判断是,具身智能不会仅仅依靠模仿学习而诞生。正如人类在与世界的互动中不断试错直至成功,机器人也必须通过交互来学习,物理AI的突破也将由交互式学习驱动。
但它认为目前现实世界并不具备让机器人通过试错进行学习的可行性。
首先是安全风险高,任何失误都可能造成实质性的物理损失。然后成本也高,硬件设施与操作人员,很难像堆算力一样实现规模化扩展。最后效率也低,现实经验无法以学习所需的规模进行加速或并行处理。
所以结论就是:要实现交互式学习的规模化,机器人必须在模拟现实中学习。
Veeda解决这个问题的方式是构建“多模态基础世界模型”,Veeda的这个“多模态基础世界模型”,区别于生成视频的世界模型,是一个能够接收机器人动作、持续推演环境,并最终用于机器人训练和策略验证的世界模型。
目前Veeda并没有完整的技术博客介绍他们具体是怎么做的(创始团队今年6月都还在NVIDIA做OmniDreams),我们从创始团队之前的工作,以及他们的招聘信息中,可以大致还原出一条从世界模型训练,到机器人策略后训练,再到Sim2Real验证的完整技术链路。
首先是训练“多模态基础世界模型”。它的核心包括动作条件化的视频模型和潜在动力学模型,采用基于整流流(rectified flow)的扩散Transformer、块因果自回归混合架构,以及因果视频分词器;其中视频分词器的压缩比会直接影响模型能够维持多长时间的推演。
为了让世界模型能够响应机器人行为,Veeda会将推演过程条件化于机器人动作片段和相机轨迹。同时,它还计划通过逆动力学和潜在动作模型,从没有动作标注的视频中恢复“伪动作”,从而扩大可用于训练动作条件化世界模型的数据来源,使训练规模不再受限于遥操作数据。
在动作条件化之外,Veeda还要解决长时程推演的稳定性。世界模型在持续推演中会不断使用自身生成的结果,误差也可能随时间累积。Veeda计划通过在模型自身生成的推演结果上训练,采用diffusion forcing、self-forcing对抗累积漂移,并以3D高斯或点图持久化场景状态,使分钟级推演保持连贯。
在此基础上,Veeda还会利用基于物理约束的奖励模型和验证器进行微调,并将模型蒸馏为少步采样器,使智能体能够在模型内部以交互速率实时行动。
Veeda会兼容现有仿真体系。它的世界模型可以接入Isaac Lab、Carla等现有仿真器API,并构建世界模型与策略的闭环:机器人策略输出动作,仿真环境和世界模型据此继续推演,再把新的状态和观测反馈给策略。同时,系统还会记录策略运行中的成功和失败案例,并通过任务成功率以及与真实硬件轨迹的偏差来评估仿真保真度。
此后,Veeda会用仿真工具对π0系列、GR00T N等具身智能基础模型的策略进行后训练。最后再把经过仿真训练的策略部署到真实机器人上,通过真实实验量化Sim2Real差距,评估仿真保真度以及策略经过训练后的提升效果。
整条链路,总结起来是(以下并非Veeda官方披露的完整链路,只根据现有信息总结):
训练世界模型 → 从视频中补充动作信息 → 解决长时程稳定和实时交互 → 接入现有仿真器形成世界模型与策略闭环 → 对π0、GR00T N等策略进行后训练 → 部署到真实机器人做Sim2Real验证。
现在的具身数据,其质量,数量和成本,都是分层的。
质量较高,但成本也很高的是遥操,所以数量受限。
然后是传感数据,比如UMI(手持式平行夹爪+腕部相机采集)和ego(可穿戴相机采集第一人称视频),它们成本相对低,数量相对多。
再下一层是生成类数据,比如世界模型产生的数据,游戏产生的数据。
底层就是互联网视频数据。
高质量的数据贵,低成本的数据质量低,所以行业内(例如NVIDIA)的一些厂商,会用大量低成本数据和少量高成本数据做预训练,然后用高成本数据来后训练。这样的效果也不错,但毕竟是无奈之举。
如果能够同时解决数据的质量和成本问题,就能促进整个行业的发展。
Veeda是试图往这个方向发展,它的表现形式是世界模型和仿真,但核心思想是让模型通过交互来学习。包括此前我们介绍的Reimagine Robotics,其技术内核都是通过交互学习,只不过它是用在后训练。
通过交互学习,可能是AI领域(无论是大语言模型还是物理AI模型)的下一个范式。这很可能是因为它更符合学习的本质,也和人类的学习模式更像。
现在很多neolab押注的RSI(递归自我改进),包括现在非常前沿的Test-Time Training(硅谷有传闻ilya的SSI也在用它),交互中学习都是它们会用到的重要方法。
在物理AI领域,包括各个环节,尤其是智能环节,其范式都还没有收敛,在每一个环节上都还有创新和创业的机会,期待创业者们向这些方向进发。
本文来自微信公众号 “阿尔法公社”(ID:alphastartups),作者:发现非凡创业者的