清华具身模型登顶全球第一!突围GPT-6、英伟达,不靠外挂和额外数据
星动纪元选择将视频预测与动作学习分阶段训练,重点不是「视频、动作一锅炖」,而是把两者「解耦」,重新「排序」。
本条来自 量子位(AI / 中文),聚焦 technology。 星动纪元选择将视频预测与动作学习分阶段训练,重点不是「视频、动作一锅炖」,而是把两者「解耦」,重新「排序」。
星动纪元选择将视频预测与动作学习分阶段训练,重点不是「视频、动作一锅炖」,而是把两者「解耦」,重新「排序」
- 好家伙,世界动作模型(WAM)赛道,中国团队直接冲到了全球第一?!
- 不是,哥们儿,这么夯的模型到底是怎么练出来的啊???
- VPP2在仿真里展现出的泛化能力, 到了真机上还能成立吗?
- 星动纪元选择将视频预测与动作学习分阶段训练,重点不是「视频、动作一锅炖」,而是把两者「解耦」,重新「排序」
星动纪元选择将视频预测与动作学习分阶段训练,重点不是「视频、动作一锅炖」,而是把两者「解耦」,重新「排序」
星动纪元选择将视频预测与动作学习分阶段训练,重点不是「视频、动作一锅炖」,而是把两者「解耦」,重新「排序」。
好家伙,世界动作模型(WAM)赛道,中国团队直接冲到了全球第一?!
而且,GPT-6-Astra、Physical Intelligence的π0.5、英伟达GR00T-N1.7等一众全球头部具身模型,这次都被甩在了身后。
出手的是一家中国机器人公司—— 清华唯一持股的嫡系具身公司,星动纪元 。
近日,星动纪元 自研的世界动作模型VPP2 ,一举登顶 RoboDojo仿真榜单 。
综合平均成功率32.26%,综合平均得分39.26分,两个指标双双第一。
RoboDojo号称 具身智能界的「珠穆朗玛峰」 ,由香港大学MMLab牵头,全球近20所顶尖学术机构共同建设。
它专挑机器人不擅长的地方出题:换个环境,还会不会干活?东西摆歪了,还能不能抓准?任务做到一半,还记不记得前面发生了什么?
星动纪元VPP2不仅拿下综合第一,在 泛化能力、精细操作、记忆能力 三个维度上,也拔得头筹。
据说,这次VPP2 没有额外加数据 ,也 没用Agent RSI等增强手段 , 仅靠「标准数据集」 ,就把一众高手给卷了下去。
这代表着VPP2模型本身足够强,性能提升来自预训练,基座足够泛化,因此不靠外挂增强策略,不靠扩充数据「刷分」。
不是,哥们儿,这么夯的模型到底是怎么练出来的啊???
我们往技术路线里扒了扒,你别说,VPP2这次的突破,还真有点东西。
它瞄准了世界动作模型的一道老大难问题:预测错了,动作就跟着错。
VPP2给出的解法,是先把视频预测能力练到足够强,再让机器人在陌生环境里真正动起来。
从目前披露的多项测试结果来看,VPP2已经成为世界动作模型WAM赛道中,最有竞争力的选手之一。
机器人Demo越做越炫,模型榜单分数也越来越高,但真要问一句,谁的机器人更聪明、更能干活?
比如让机器人抓杯子。在训练时见过的桌面上,它可能百发百中。结果换个杯子、挪下位置,立刻开始怀疑人生。
这也是为什么,RoboDojo这套评测值得关注。
它的目标是为具身智能建立统一、可复现的评测标准,仿真测试 包含42项双臂操作任务 ,覆盖泛化、精准操作、长程任务、记忆、开放词汇指令理解五个维度。
传统机器人模型在熟悉任务上可能接近满分,一旦环境、物体位置、任务组合发生变化,成功率可能明显下降。
RoboDojo专门对这类复杂情况进行考察,看机器人面对变化时,有多少泛化能力。
平均成功率32.26%、平均得分39.26分,两个指标均位居榜首。
作为对比,在RoboDojo仿真基准的后训练评测中, GPT-6-Astra 的平均成功率为22.48%,平均得分28.97分。
而 VPP2 分别领先9.78个百分点和10.29分。
这里两个指标各有侧重:成功率看机器人能否完整完成任务;平均得分则衡量任务推进到了哪一步,即便没能全部完成,也能体现其阶段性表现。
换句话说, VPP2不仅完成任务的比例更高,面对没能做完的任务,也体现出了更强的阶段性完成能力。
拆开五项能力维度来看,VPP2在泛化、精准操作、记忆三个维度上,同样拿下第一。
这三项能力对应着机器人进入真实世界的几道难关:换个环境还能不能干活,操作能不能做准,以及连续执行任务时能不能记住前面的步骤。
不过,RoboDojo再难,考场终究还是「仿真环境」。真到了物理世界,物体的摩擦、形变、位置偏差,又会陡生变数。
VPP2在仿真里展现出的泛化能力, 到了真机上还能成立吗?
这次,团队直接把VPP2 部署到真实ALOHA双臂机器人 上,测试了抓取、放置、堆叠、折叠、倾倒等10类零样本操作任务。
也就是说,无需针对这些测试任务进行额外微调,机器人就得直接上手。
结果,VPP2再次交出领先成绩: 平均成功率58.5%,高于π0.5的40%。
在10类任务里,VPP2拿下了9类最佳成绩。
榜单第一,证明的是它在标准评测体系里的能力;真机零样本操作,则进一步考察这些能力能否迁移到真实物理环境。
两份成绩单摆在一起,VPP2的技术优势就更值得深挖了。
要知道,VPP2走的是 世界动作模型(WAM)路线 。
这类模型的基本思路,是借助视频预测理解物理世界接下来会如何变化,再把这种预测转化为机器人动作。
但这条路线长期存在一个问题:视频预测得漂亮,不代表机器人真的会干活。
本条目归入「Technology AI」垂直,涉及真实话题:technology。
· 市场:关注 technology 对相关品类与竞争格局的潜在影响。
· 消费者:受众行为与偏好变化值得追踪。
· 品牌:本动向对品牌资产建设的启示。
· 渠道:内容分发与触点组合(社媒 / 电商 / 线下)的协同值得复盘。
· 核心话题:technology。
· 可思考:如何把「technology」的洞察,转化为可衡量的内容与增长动作?
面试中可引用「清华具身模型登顶全球第一!突围GPT-6、英伟达,不靠外挂和额外数据」:围绕 technology,说明你对行业动向的判断与可落地动作。
本条目相关英文术语可在「商务英语」模块按话题检索,用于外企面试表达训练。
本条正文未命中预设商业词表,可前往 /english 系统学习。
系统商务英语 →