如意小报
版块首页原文 ↗
AI · 新闻详情

清华具身模型登顶全球第一!突围GPT-6、英伟达,不靠外挂和额外数据

大模型 · 量子位 · 量子位 · 2026-10-09 · 重磅值 88.32
真正值得关注的不是量子位这一条动作本身,而是它可能把「大模型」的竞争焦点推向能力、成本与开放生态的再平衡。
发生了什么:星动纪元选择将视频预测与动作学习分阶段训练,重点不是「视频、动作一锅炖」,而是把两者「解耦」,重新「排序」。
为什么重要:模型能力的变化,可能重塑下一批产品的技术底座。
观察窗口:后续要看开放范围、价格策略、真实评测以及开发者是否愿意迁移。
正文来源:原文正文机器翻译
原文链接:https://www.qbitai.com/2026/10/502125.html

星动纪元选择将视频预测与动作学习分阶段训练,重点不是「视频、动作一锅炖」,而是把两者「解耦」,重新「排序」。

而且,GPT-6-Astra、Physical Intelligence的π0.5、英伟达GR00T-N1.7等一众全球头部具身模型,这次都被甩在了身后。

出手的是一家中国机器人公司—— 清华唯一持股的嫡系具身公司,星动纪元 。

近日,星动纪元 自研的世界动作模型VPP2 ,一举登顶 RoboDojo仿真榜单 。

综合平均成功率32.26%,综合平均得分39.26分,两个指标双双第一。

RoboDojo号称 具身智能界的「珠穆朗玛峰」 ,由香港大学MMLab牵头,全球近20所顶尖学术机构共同建设。

它专挑机器人不擅长的地方出题:换个环境,还会不会干活?东西摆歪了,还能不能抓准?任务做到一半,还记不记得前面发生了什么?

星动纪元VPP2不仅拿下综合第一,在 泛化能力、精细操作、记忆能力 三个维度上,也拔得头筹。

据说,这次VPP2 没有额外加数据 ,也 没用Agent RSI等增强手段 , 仅靠「标准数据集」 ,就把一众高手给卷了下去。

这代表着VPP2模型本身足够强,性能提升来自预训练,基座足够泛化,因此不靠外挂增强策略,不靠扩充数据「刷分」。

VPP2给出的解法,是先把视频预测能力练到足够强,再让机器人在陌生环境里真正动起来。

从目前披露的多项测试结果来看,VPP2已经成为世界动作模型WAM赛道中,最有竞争力的选手之一。

机器人Demo越做越炫,模型榜单分数也越来越高,但真要问一句,谁的机器人更聪明、更能干活?

比如让机器人抓杯子。在训练时见过的桌面上,它可能百发百中。结果换个杯子、挪下位置,立刻开始怀疑人生。

它的目标是为具身智能建立统一、可复现的评测标准,仿真测试 包含42项双臂操作任务 ,覆盖泛化、精准操作、长程任务、记忆、开放词汇指令理解五个维度。

传统机器人模型在熟悉任务上可能接近满分,一旦环境、物体位置、任务组合发生变化,成功率可能明显下降。

RoboDojo专门对这类复杂情况进行考察,看机器人面对变化时,有多少泛化能力。

作为对比,在RoboDojo仿真基准的后训练评测中, GPT-6-Astra 的平均成功率为22.48%,平均得分28.97分。

这里两个指标各有侧重:成功率看机器人能否完整完成任务;平均得分则衡量任务推进到了哪一步,即便没能全部完成,也能体现其阶段性表现。

换句话说, VPP2不仅完成任务的比例更高,面对没能做完的任务,也体现出了更强的阶段性完成能力。

拆开五项能力维度来看,VPP2在泛化、精准操作、记忆三个维度上,同样拿下第一。

这三项能力对应着机器人进入真实世界的几道难关:换个环境还能不能干活,操作能不能做准,以及连续执行任务时能不能记住前面的步骤。

不过,RoboDojo再难,考场终究还是「仿真环境」。真到了物理世界,物体的摩擦、形变、位置偏差,又会陡生变数。

这次,团队直接把VPP2 部署到真实ALOHA双臂机器人 上,测试了抓取、放置、堆叠、折叠、倾倒等10类零样本操作任务。

结果,VPP2再次交出领先成绩: 平均成功率58.5%,高于π0.5的40%。

榜单第一,证明的是它在标准评测体系里的能力;真机零样本操作,则进一步考察这些能力能否迁移到真实物理环境。

这类模型的基本思路,是借助视频预测理解物理世界接下来会如何变化,再把这种预测转化为机器人动作。

想理解VPP2的突破,先来看一个简单任务:让机器人把桌上的杯子放进盒子里。

但机器人得判断杯子的位置、机械臂的运动轨迹、夹爪何时闭合,还要预测整个操作过程中,物理世界会发生什么变化。任何一步出了偏差,都可能翻车。

一方面,普通视频模型擅长生成画面,但画面看着合理,和符合真实物理规律是两回事。

比如要求抓左边的杯子,模型却预测抓起右边那个。视频照样能生成,机器人执行时却会直接跑偏。

基于这一思路,星动纪元选择将视频预测与动作学习分阶段训练,重点不是「视频、动作一锅炖」,而是把两者 「解耦」 ,重新 「排序」 。

第二阶段,固定时长视频后训练与蒸馏,让预测能力跟得上机器人实时执行的速度。

第三阶段,动作专家训练,将视频预测转化为具体动作,同时尽量保住原有的泛化能力。

三个阶段层层递进,最终指向 两个核心突破 :预测能泛化,行动也能泛化。

星动纪元以阿里开源的Wan2.1-I2V-14B为基础,整合机器人操作、人类活动、通用视频等多种数据,覆盖不同机器人本体和操作方式。

团队没有简单地把视频一股脑喂给模型,而是先将操作过程切分成语义完整的片段,再配上详细描述。

比如,不能只告诉模型「把杯子放进盒子」,还要明确是哪只机械臂、哪个杯子、哪个盒子,以及整个操作过程。

VPP2索性把任务描述得更细,让语言指令和物理操作形成更稳定的对应关系。

传统短时预测关注接下来几帧会发生什么,而VPP2直接让模型学习一次完整操作从开始到结束的变化。

机器翻译/自动整理可能存在误差,请以原文为准。

继续阅读

正在加载推荐…