宇树智元共用一个大脑,神秘模型Demo炸场,10分钟一镜到底
量子位
2026-08-26
热度4002

一段10分钟一镜到底的机器人Demo视频引发行业震动:宇树与智元两款异构机器人共享同一通用大脑,实现跨本体自主协作、长时序任务闭环、动态中断恢复、工具使用及自我进化,展现出超越现有VLA和世界模型的物理推理、自我认知与鲁棒性能力,标志具身智能重大突破。

摘要由 Mars AI 生成
本摘要由 Mars AI 模型生成,其生成内容的准确性、完整性还处于迭代更新阶段。

现在的具身智能公司,把Demo演示片拍得像广告一样精良和夸张,但一刀未剪的真实视频,你看过吗?

前几天,有业内朋友给我发来一条10分钟的Demo,全程一镜到底,无剪辑,无场外遥控,无人工指令,甚至有些粗糙,但呈现的内容却让我直接瘫坐,心情久久不能平静(doge)。

视频中,机器人会把手臂伸出窗外擦窗户,够不到高处时知道自己搬箱子踩在上面,长程任务中途被打断还能精准恢复……

更炸的是,视频中同时出现了宇树和智元的机器人本体,这两款硬件架构、运动自由度、传感系统完全迥异的“竞品”,同用一个“大脑”,互相配合,密切协作,是全球罕见的跨本体通用大脑样本。

不夸张地讲,它可能是一条足以改写全球具身智能行业认知、颠覆赛道技术判断的Demo,甚至可能改变了Scaling Law……

这到底是哪里来的神仙?

视频逐帧拆解,全是名场面

这条视频的信息量实在太大了。我认真地逐帧拆解,结果越看越上头。

密闭空间作业,稳得离谱

拍摄场地是个15m²左右的出租屋,家具密集,过道狭窄,连转身都费劲。这种环境,基本没有遥操作(没办法站下人)和预设脚本的可能性。

这个视频从环境的设计,就怼脸告诉大家,这只能是一条机器人完全自主学习、自主进化、自主决策的视频。

两个机器人在同一个空间里并行干家务活,实时感知边界、规划路径。

全程无碰撞、无迷路、无停滞,完美适配陌生复杂实景环境,就连被牵引绳拴着的战损版机器人都表现出了极强的灵活性。

整段视频没有切镜,没有重拍,也没有人工指令介入。

伸手出窗擦玻璃,动力学能力与自主推理的巅峰具象

从第一个任务起,机器人就展现了“细腻”且超出人类想象的一面。

一台宇树机器人用刮水器擦玻璃,用过刮水器的人都知道,如果力使轻了擦不到,使重了又会出现异响,比拿抹布擦玻璃更考验力度控制和空间感知,上来就给自己加到地狱难度。

只见机器人擦了几下,有一处没擦干净,它居然自己会判断:脏东西可能在外面。

于是它做出了一套我从没看过的动作:侧身、后仰、探头、展臂,把拿着刮水器的手伸出了窗外。(稳如老狗)

一些现有的具身模型,能够把力控做好已经是极限,而这个机器人,却在精确地力矩控制的基础之上,天衣无缝地融合了对于空间环境的感知(伸出手并没有撞到窗框)和动力学的解算。

不仅单一能力做到行业天花板,模型还展现了三位一体的统一化表现。

更让我久久无法平复的是,在没有办法擦干净的情况下,它立即推理决策,将手伸出窗外擦玻璃,这是我第一次看到了模型像人一样的一次自我推理、自我进化。

这充分体现了模型把视觉、触觉、动力学等融合为统一感知,并且具备了自我进化的能力,这一次,我终于相信机器人真的能干活了,而且,将会干到比人更完美。

长时序任务闭环,拒绝误差累积

擦完玻璃,宇树机器人平稳地把刮水器放回原位,落点精准,动作连贯。

别小看这个收尾动作,这意味着它完成了“取工具-作业-收纳”的全流程闭环。

身旁的智元机器人,走近洗衣机,拿出洗干净的坐垫放到沙发后,又返回继续拿出洗干净的娃娃,精准放进了二层衣柜,每件物品都回到了它们应该在的地方。

智元机器人不小心撞到了玻璃,更说明了这是机器人的自主决策,因为摄像头有时解决不了玻璃的反光,而如果人遥操的话可以(doge)。

这两幕是整个10分钟视频最基础能力的缩影,在长时序任务中,每一个任务都完成得丝滑、精准且一步到位,并不会因为任务变多、变长而累计误差,越做越差。

这解决了传统VLA模型最怕长序列任务的弊病。

单从动作表现来说,模型一定用了一套全新的架构,在10分钟的超长任务链里,持续纠错、稳定输出,每一个动作都做到精准可控,鲁棒性堪称行业顶尖。

任务可随意打断,模型能做到断点续做

接下来,画面里出现了一声闹钟的铃声。(放大声音仔细听,不明显)

一开始我没有理解闹钟的意图,反复观看后发现,闹钟是某种设定好的提醒,会中断两位机器人当下的任务,开始执行收纳桌面跟冰箱的特别任务。

奇妙的是,收纳完桌面和冰箱后,机器人继续恢复执行被打断前的任务,这表现出模型具备随时打断、断点续做、任务恢复的能力。

对比市面上一次Demo只能完成一项任务,还得小心呵护,这个粗糙的视频展现出的是机器人在真实作业环境中,不仅耐用、甚至能“一心二用”的超强能力。

接下来是一整套居家收纳长流程:宇树机器人拿取收纳袋放到桌面,智元机器人看到冰箱上的食物,判断应该冷藏储存,就马上执行,并顺便拿出了应该解冻的食物(我猜这个神秘团队可能在暗示,机器人快可以做四菜一汤了)。

全程没有分步指令,机器人自主拆解任务、规划动作,一步步完成从取物到归置的全流程。

如今绝大多数机器人只能执行单任务串行流程,中途遇到干扰,任务基本就崩盘了。而这套模型拥有人类级别的任务优先级判断和动态调度能力,可随时切换任务流,这种灵活性跟稳定性所展现出的智能,远超市面上任何一款已知模型的能力。

智元给宇树戴围巾,跨本体协作名场面

随后,整条视频的最高潮出现了。

两个机器人仿佛商量好了,哥俩一定要一次整理好桌面上的杂物,不能来回搬运。

所以宇树不断往自己的身上放置物体,直到双手占满不知该如何操作了。这时,智元机器人温柔地走近,将桌上的一条围巾缓缓拿起,挂在了宇树机器人的脖子上。

智元机器人发现围巾很长,于是用双手捧起了围巾,这时宇树仿佛也看懂了智元的意思,弯下了腰,智元将围巾绕过宇树的头,挂在了对方的脖子上。

不是吧哥们?!这丝滑感以及彼此眼神的交互,怎么还有股CP感!

视频不是提前设定好的分工,而是模型在跨本体的两个机器人间,自主探索出的协作方案。两个不同品牌的机器人,自主判断各自的能力边界,并完美互补,这已经无限趋近人类的协作,甚至在没有语言的情况下,显得更加默契。

这可能是世界上第一次跨本体的交互,也可能是世界上第一次出现了能够通用本体的模型。

我猜这个神秘团队是想用两个互为竞品的本体告诉大家,这才是真正的通用大脑。

搭毛巾、拎拖鞋,难道机器人不仅会干活,还已经开始“偷懒”了?

挂着一身物品的宇树缓缓走向远方后,智元继续收纳剩余的物品。

这时,它拿起一条毛巾,企图把它挂在自己身上。尝试了一次、两次、三次,终于挂在了自己肩头。

震惊三连!

机器人好像知道怎么最省劲,毛巾挂肩膀上,比拿在手上更省劲。

模型能自主学习,在一次两次没成功之后,不断优化直到成功。

模型能了解自己的本体,可能是它能够跨本体应用的核心原因。

这并不是孤例。

仔细看,机器人整理拖鞋时,它拎的是新拖鞋的挂绳而不是鞋体本身,因为拎绳子更省劲。

又一次震惊!在其他机器人还在为干活而精心打扮的时候,这个模型居然不光把活干了,甚至直接学会“偷懒”了?这真是太聪明了。

又一次高潮,机器人学会使用工具,企图用箱子垫高自己

还没结束,最让我震惊的一幕出现了,在将挂满全身的物品一一归位的过程中,如何把围巾放到第三层柜子,难倒了身高只有1.3米的宇树G1机器人。

神性的一幕出现了!它没有卡住,也没有放弃,而是像人推理一样,自己找了个箱子!对的,找了个箱子!企图站在箱子上垫高自己再试一试。

只见它找到了旁边的箱子,并一把把它推到了地上,企图弯腰搬箱子,却发现自己弯不下腰。

尝试了几次后,就当我以为它总该要放弃了的时候,它惊世骇俗地一脚把箱子踹到了柜子边!

整个过程体现了:

自我推理跟决策的能力。机器人懂得怎么能让自己够到高处的物体,怎么能在弯不下腰的情况下挪动箱子。

模型对身体能力的不断探索。在一次次弯腰尝试的过程中,机器人仿佛越来越了解自己的身体边界,也做出了匹配身体能力的选择。

自我进化的过程。机器人在没有任何教学的过程下,居然学会了用脚来踢箱子,善于利用自己的身体在环境中自我进化。

这一幕,真的让我后背发凉。

要知道,能自主使用工具,可是人类的标志性体现。

而视频中的机器人居然真的学会了使用工具。它知道箱子可以承重,知道站上去能增加高度,甚至知道弯不下腰时可以用脚踢。

这套动作背后,是对物理世界规则的深度理解、对自我能力的不断探索、跟自我决策进化的三者合一。

跨本体能力互补,协同作业,从个体到群体

宇树一脚将箱子踢过去,踢歪了,就在它思考如何将箱子回正的时候,身高1.7m的智元远征A3走了过来,它好像看出了宇树的执着和困境,放下了手里的小拉车(主动切换任务),选择去帮助同伴。

只见,像毕业授勋一样,宇树弯腰低头,智元缓缓地拿下了围巾,放到了架子上。

细节里的每一步,都体现了藐视其他模型的能力。

两个机器人对于自身以及彼此间硬件能力的了解和配合,跨越了个体智能,走向了群体智能。

智元将围巾绕过了宇树的脑后,才能轻巧地取下围巾(此处可以脑补其他机器人会如何拽下这条围巾),展示出对于力度控制和跟空间感知的极致理解。

机器人将围巾折了三折,是对于如何更好地把围巾放进衣柜的自主判断,这才是真正的具身“智能”。

最后,智元帮助完宇树后,默默离开,将最后一件衣服稳稳地放进了洗衣机(我猜它判断出了搭在洗衣机上的是脏衣服),这条十分钟的一镜到底终于结束了。

虽然我不知道这个模型的架构,但是我相信大家跟我一样已经惊呆了。

第一次跨本体协作、第一次看见机器人的自主进化、第一次类人的自主决策选择最优路径、极致的空间感知跟力控、任务随意打断、学会使用工具……这个模型的每一个动作、每一帧都是一个很好的Demo,但他们就这么静静地出现在这个十分钟一镜到底的视频里,而且呈现方式是这么简单直接。

仿佛是一种轻松随意、信手拈来就能做到的王者感。

底层技术跳出主流模型固有框架

为什么视频中的机器人能贡献这么多名场面?

我从知情人士那里了解到,最重要的原因是,这套模型跳出了当前主流具身模型的所有固有框架。

现阶段主流具身模型大概可以分为VLA、WAM和传统世界模型三类,它们都有暂时无法突破的瓶颈。

△图片由AI生成

具体来说,VLA是“数据直觉派”,依托海量视觉、语言、动作数据做端到端拟合。但它的本质是“看图猜动作”,缺失物理推理能力,长序列任务会持续累积误差,陌生场景泛化能力近乎为零,且高度绑定专属本体。

而WAM和传统世界模型是“预判空想派”,试图先建模世界规律再规划动作,但存在致命的“知行割裂”问题。模型能看懂场景、预判状态,但面对需要物理动力学推理的实操场景,依旧只能依赖训练数据推演,无法适配真实环境的动态变数。

这些主流具身模型存在共同的底层致命缺陷:数据驱动的任务拟合。

也就是说,所有动作都是基于海量数据的“概率猜测”,而非对物理规则的深度理解。这导致模型的能力上限被训练数据牢牢锁死。

而且据说,视频中的模型只用了几十个小时的视频数据训练。如此少的数据量就能达到这样惊人的效果,Scaling Law还存不存在?真的要打一个问号了。(美股大跌预告)

从细节看,视频中的模型起码展现了现阶段VLA和世界模型无法企及的四个能力:

动力学建模:轨迹满足动力学可行性,能计算补偿力矩和前馈项,外推泛化能力绝佳;

自我认知能力:不像VLA靠条件反射,也不像WAM靠时序统计,它像人一样思考“下一步最接近目标的动作是什么”;

自适应能力:能补足因果推理,解决长尾问题,边做边进化;

自我进化能力:在完成任务的过程中,技能自增长,策略自进化,仿佛能自我驱动产生学习目标,并主动推理实现价值。

支撑这一切的,是三个底层技术内核。

物理约束动力学学习。区别于VLA、WAM纯数据驱动的训练模式,它的核心是物理规则前置、动力学预测驱动。拎拖鞋挂绳、肩搭毛巾、站箱子登高,都不是数据教的,是模型与环境交互自主探索出的最优解。

跨本体统一建模。通过统一的动作表示空间与本体自适应机制,让同一套模型适配不同品牌、不同架构的硬件平台。相当于为具身智能完成了“软硬件解耦”,终结了硬件绑定算法的时代。

长时序鲁棒闭环。依托全局任务调度框架,自主处理全程突发干扰、动作误差、任务切换,避免传统模型长流程误差累积崩盘的问题,具备真实家庭、复杂场景落地的核心能力。

如果你了解具身模型的现状,看完以上内容之后,估计也会惊掉下巴。

当其他团队的Demo还在堆砌短时长、精修、单任务时,这个神秘视频已经完成了10分钟无修剪、跨品牌、多协同、全流程、自进化的真实实景落地。

当其他模型还在“靠数据猜动作”时,这套模型仿佛已经实现了完全的自我决策、自我学习、自我进化。让大家看到,机器人不仅真的可以干活,而且能力还在快速自我进化,给人无限的想象空间。

更重要的是,这个模型仿佛让我们看到,大家热火朝天在争论的是三年、五年、还是十年会到来的机器人真的能够替人干活的未来,今天就出现在了你的面前。

一个不知道是哪里来的团队,仿佛颠覆了所有的技术路径,颠覆了Scaling Law,做出了真正的具身“智能”,逼近了具身智能的ChatGPT时刻。

目前还不知道这个神秘模型出自谁家,但我相信此刻,大家的疑问都跟我一样:到底是谁!!!

哪位大神有什么小道消息么!!!

本文来自微信公众号“量子位”(ID:QbitAI),作者:诺亚

本内容旨在传递行业动态,不构成投资建议或承诺。
为你推荐

商务合作:TG:@Lottie96