0.2秒急停、秒级重规划!因果智能走进真实世界
这是一台机器人正在关闭微波炉门时,因人手突然插进来而紧急悬停的时间
本条来自 量子位(AI / 中文),聚焦 technology、ai。 这是一台机器人正在关闭微波炉门时,因人手突然插进来而紧急悬停的时间。
这是一台机器人正在关闭微波炉门时,因人手突然插进来而紧急悬停的时间
- 这是一台机器人正在关闭微波炉门时,因人手突然插进来而紧急悬停的时间
- CRIS-0给出的破局解法,是「因果」——
- 更有意思的是CRIS-0展现出的常识推理与物理感知能力:
- 这些Demo背后,到底是一套怎样的技术架构?
- 这是一台机器人正在关闭微波炉门时,因人手突然插进来而紧急悬停的时间
这是一台机器人正在关闭微波炉门时,因人手突然插进来而紧急悬停的时间
这是一台机器人正在关闭微波炉门时,因人手突然插进来而紧急悬停的时间
这是一台机器人正在关闭微波炉门时,因人手突然插进来而紧急悬停的时间。
当一只金属易拉罐被混在蛋糕盘里端向微波炉,机械臂会先把易拉罐挑出来放到一旁,确认盘子里安全了,再将其送入炉内。
说实话,看这几段Demo的时候,我整个人是有点愣住的。
长期关注具身的朋友应该都有体会,现在很多机器人看起来挺炫酷,但大部分时候都是在「背题」。一旦光照变了、东西被踢了一脚、或者指令稍微带点隐含意图,机器人瞬间就抓瞎了。
但你即便像视频里这样,疯狂拿手电筒闪这个机器人的眼睛,它依然置若罔闻。。。
不过,刚才那些画面,不是提前录好的动作回放,也不是碰巧猜对的统计相关性。
面对接连不断的突发扰动,系统是基于对物理世界因果规律的理解,实时推理出了这一连串动作。
驱动这个机器人的这套系统,代号叫 CRIS-0 。
它的背后,正是由加州大学圣地亚哥分校(UCSD)助理教授、CMU因果学派学者黄碧薇创立的因果智能企业——
三个月前,量子位曾报道过这家公司选择的因果智能路线。当时很多人以为因果AI还停留在数学公式和思维实验里。
如今,Aether AI亮出了官方Demo。
在具身机器人的落地场景中,最让工程师头疼的向来不是标准流程,而是无处不在的意外。
传统机器人面对突发扰动,要么机械地重复旧坐标导致碰撞,要么干脆全流程报错卡死;而端到端黑盒模型在几十步的长程任务里,更是极易产生累积误差,一步走偏满盘皆崩。
CRIS-0给出的破局解法,是「因果」——
让机器人从「看到什么」,走向「理解为什么发生、改变什么会影响结果」。
在面对外部突发干扰的Coffee Preparation测试中,机器人抓取咖啡机时遭遇人为移位、光照突变。CRIS-0在 平均2秒内 就识别出了因果变量的改变并完成实时重规划,在10次随机扰动中实现了 9次有效恢复 。
咖啡机被推开,系统追踪的是「把手相对位姿」这一关键因果变量。当发现变量状态发生偏移,它只会修正接近和抓取的动作阶段,无需回归原位重启。
抗干扰只是基本功,到了长程自主任务中,因果驱动的优势体现得更为彻底。
在「客厅寻物与整理」这种多达数十步的连续任务中,系统把长程目标拆解为原子化、可验证的因果阶段,每推进一步都执行前置与后置条件检查。
更有意思的是CRIS-0展现出的常识推理与物理感知能力:
在清理桌面时,它会把散落的普通书本整理至茶几,却把涉及个人隐私的账单收纳进抽屉;
面对两个外观相似的饮料罐,它先通过抓取晃动来感知罐体重量与内部液体状态,确认为空罐后才扔进垃圾桶,感知到未喝完的饮料则稳稳放回原位。
最后,在面对模糊需求时,因果还能大幅提高提示词泛化性,从而带来个性化理解能力。
在Personal Pick and Place测试中,面对类似「给我拿一瓶适合晨跑后喝的饮料」等20条需要隐含推理的模糊指令,系统取得了 18次精准抓取与放置 的成绩。
它不是靠记忆关键词去碰运气,而是结合时间、用户状态与环境上下文,把「运动后需要补充能量且避免高糖」作为隐藏因果变量抽取出来,自动匹配对应操作。
这些Demo背后,到底是一套怎样的技术架构?
回答这个问题前,或许我们得先讲清楚另外一个问题——
物理世界和纯数字世界完全是两码事。在电脑里写代码或者聊天,输错了还能撤回,但在现实世界里,摩擦力、重力、碰撞、光线变化,各种突发情况每秒钟都在发生。
传统的端到端模型,比如VLA方案,虽然学得很快,但在面对长流程任务时,有一个致命弱点,那就是误差累积。
第1步有点小偏差,第2步偏差变大,到了第10步,整个动作可能就已经彻底变形了。更要命的是,单一黑盒模型在遇到干扰时,它不知道到底发生了什么,往往只能硬着头皮继续往下按原计划推,或者直接崩溃停机。
而另一种常见的Agent方案,虽然会做步骤拆解,但它的思考逻辑基本停留在纯文本或者多模态大模型的概率推理上。
每次环境一变,它得先把画面转成文本,等模型在那慢吞吞琢磨「下一步该干嘛」,等你推理完了,手可能早就被门夹到了。。。
CRIS-0展现出来的这种抗干扰和连贯性,背后到底是怎么做到的?
在CRIS-0的系统里,有一个非常底层的改变,叫做统一状态与因果变量。
以前的机器人看世界,看的是密密麻麻的图像像素。但在CRIS-0眼里,它关心的不是世界表面长什么样,而是任务到底进行到了哪一步,任务本身就是一个因果状态进度条。
举个特别接地气的例子,比如机器人去铺桌布。
它不会傻乎乎地去计算整张桌布每个像素的坐标,而是实时追踪几个核心因果变量。比如桌布有没有被夹爪真正抓住,桌布的角点离目标位置还有几厘米,拉动的时候有没有发生滑移。
一旦抓取滑脱了,系统立刻知道是「抓住」这个因果变量不满足了,那么任务状态就直接退回到重新抓取的阶段,而不是把整套动作推翻重来,或者盲目地继续往后拉空气。
在官方公布的咖啡制作干扰测试里,面对咖啡机反复移位、光照突变这种折磨人的场景,系统平均在2秒内就能识别出关键变量的变化并完成重规划,10次外部扰动里做到了9次有效恢复。
本条目归入「Technology AI」垂直,涉及真实话题:technology、ai。
· 市场:关注 technology、ai 对相关品类与竞争格局的潜在影响。
· 消费者:受众行为与偏好变化值得追踪。
· 品牌:本动向对品牌资产建设的启示。
· 渠道:内容分发与触点组合(社媒 / 电商 / 线下)的协同值得复盘。
· 核心话题:technology、ai。
· 可思考:如何把「technology」的洞察,转化为可衡量的内容与增长动作?
面试中可引用「0.2秒急停、秒级重规划!因果智能走进真实世界」:围绕 technology、ai,说明你对行业动向的判断与可落地动作。
本条目相关英文术语可在「商务英语」模块按话题检索,用于外企面试表达训练。
三个月前,量子位曾报道过这家公司选择的因果智能路线。当时很多人以为因果AI还停留在数学公式和思维实验里。…