Can Embodied Intelligence Be Trusted? Sergey Levine Points the Way
宇树风波后,具身智能还值得相信吗?顶级机器人学者Sergey Levine指明方向
At the 2026 World Robotics Conference, Sergey Levine pointed out that the robotics industry is undergoing a shift from controlling the body to developing decision-making capabilities. He emphasized that robots need to combine prior knowledge with real-world experience to achieve true intelligence. Although robots are still in the foundational technology stage, through data flywheels and scaling, they may eventually enable broader applications.
Sergey Levine emphasizes the need for robots to move beyond mere physical control and develop robust decision-making capabilities. He highlights the importance of combining prior knowledge with real-world experience to train robots effectively, and warns that the industry is still in the early stages of scaling up, requiring a healthy ecosystem and proper data sources.
Source: Machine Heart — Robotics on WeChat · Read original article ↗
编辑|山辉
最近有个平台很有意思,有 4.4 万人在这个平台给机器人教「生活经验」。
他们把日常活动拍成视频,再上传给机器人学习。
8 月 25 日,Figure 正式公开数据平台 Index。过去四个月,
来自 108 个国家的用户已经上传超过 160
0 万
条真人任务视频,平台每秒接收 30 分钟的新内容,相当于每天记录 4.9 年的人类工作。
图源:https://www.figure.ai/news/introducing-index?
Figure 已经向这些「老师」支付
1500 万美元
,未来 12 个月还准备在数据和算力上投入超过
10 亿美元
。
毕竟语言模型可以直接「读」互联网,但机器人要学的「生活经验」可没那么好获得。
几天前的 2026 世界机器人大会上,宇树科技创始人王兴兴也谈到了机器人行业的「ChatGPT 时刻」。根据他的估计,
真正的突破仍需等待两三年;如果进展不顺利,可能还要等待五至十年。
能后空翻的身体、1600 万条人类视频和数十亿美元投入,机器人究竟还缺什么,才能真正从演示走向规模化?
最近,全球最具影响力的机器人学习学者之一、Physical Intelligence 联合创始人 Sergey Levine 做客 The Peterman Pod,给出了一个很好的回答。
视频链接:https://www.youtube.com/watch?v=9OSbaPjv0Rc
在他看来,机器人行业正在经历一场问题的转移。
过去的任务是控制机器人的身体,现在的难题是教会机器人自己决策,想要通向未来,必须找到真正值得规模化的东西。
机器人的身体先于大脑成熟
在大模型主导机器人研究以前,Boston Dynamics 几乎就是先进机器人的代名词。Atlas 后空翻、跑酷、跳跃的视频曾经一次次刷屏。近年来,它却不再像过去那样占据舆论中心。
Serge
y Le
vine:
我会这样解释:从某种层面来说,机器人学研究的是怎样构建复杂系统。
人们很容易把 AI 划分成几个不同领域,比如大语言模型、计算机视觉和机器人。但这三者中,有一个和其他两个并不完全相同。
制造机器人需要处理整个系统中的所有组成部分:怎样连接线路、使用什么能源、执行器应该如何设计,一直到机器人怎样进行高层规划、决定下一步执行什么任务。
我们看到不同公司发布的不同视频和演示时,可能会认为它们都属于「机器人」。但实际上,
它们分别聚焦于机器人技术栈的不同部分。
Boston Dynamics 的许多经典成果,
主要展示了极为先进、经过精心设计的硬件,以及传统控制方法。
他们拥有非常出色的控制工程师,负责设计和配置整个系统,
但相对较少强调机器人的决策能力。
在特定发展阶段,这种路线非常合理。因为如果连机器人的身体都造不出来,在上面运行什么样的决策系统都没有意义。
机器人技术现在已经进入了另一个阶段。硬件当然仍有继续改进的空间,但从许多方面来看,现有硬件已经「足够好」。眼下最大的挑战,是建立一套真正有效的决策循环,让机器人能够对环境中的一切做出智能反应。
这里的「决策循环」未必指符号层面的高层决策,也可能包括非常底层的决策。真正的问题在于:机器人是否需要考虑周围环境,还是只需要控制自己的身体?
如果要让机器人在平地上完成后空翻,它主要需要处理自己的身体。但如果要从桌上拿起一个咖啡杯,尽管这个动作从某些方面看比后空翻简单,机器人却必须真正理解外部世界正在发生什么,不能只关注自身。
从技术的发展结果来看,我认为这恰好可以被视为 AI 和控制系统之间的分界线:控制系统负责控制机器人的身体;AI 则需要考虑机器人以外的世界。
主持人:
如果你能回到刚进入这个行业的时候,根据现在掌握的所有知识,给当时的自己一条建议,你会说什么?
Sergey Levine:
过去几年里,我认识到了一件和自己早期思路不太一样的事情:想要有效解决机器人问题,
必须利用非常广泛的先验知识。
机器人学习领域的许多人曾经有过一种想法,我自己最初也认同这种观点:既然人类可以从零开始学习,机器人或许也应该从零开始。
早年,我们在 Google 进行大规模机器人学习研究时,做过一个叫作「机械臂农场」的项目。我们在一间会议室里摆放了许多机械臂 —— 当时没有真正的实验室,所以只能使用会议室 —— 然后让所有机械臂不断抓取物体。
我们的想法是:如果它们抓取数百万个物体,应该就能学会非常通用的抓取策略。这套方法基本奏效了。机器人确实学会了抓取各种物体。但再想向前一步,就变得非常困难。好,现在机器人可以拿起任何东西了,但然后呢?这项能力并没有很好地成为学习更复杂技能的垫脚石。
我认为,部分原因在于,
我们当时完全采用了「白板式」思路:一切从零开始,看看机器人能否在没有任何先验知识的情况下逐渐学会各种行为。但如果能够把机器人的亲身经验与其他来源的知识结合起来,整个问题会容易解决得多,也现实得多。
真正关键的并不是语言,而是能否获得先验知识,并用这些知识为学习过程搭建脚手架。先验知识可以通过各种方式获得。人类也不完全依靠语言获取知识,猴子当然更不是。人和动物还会通过观察,学习其他人和其他生物的行为。
因此,先验知识拥有许多不同来源。关键是,你必须想办法把这些知识引入机器人系统。否则,你实际上是在要求机器人解决一个比人类和动物面临的问题更加困难的问题。
想象一下:让一个人组装宜家家具,但他一生中从来没有见过任何家具。这当然会非常困难,因为他甚至不知道自己为什么要组装这些东西,也不知道最终成品应该是什么样子。
所以,先验知识非常重要。我依然非常支持让机器人通过亲身经验学习。但如果要给年轻时的自己一条建议,我会说:更加认真地对待先验知识
机器人既没有数据矿山,也没有「撤回键」
《2026 年人形机器人产业发展报告》称,今年上半年,中国人形机器人出货量已经超过 4 万台,占全球出货量的 97%。ACE Robotics 董事长王晓刚同时给出的另一个数字:过去几年,整个行业积累的具身数据总量大约只有 10 万小时,远不足以训练机器人基础模型。
Sergey Levine 提到,目前机器人研究使用的许多硬件来自中国。它们质量不错、价格相对便宜,也能达到研究所需的标准。但在世界范围内,软件和数据的规模化仍然没有完成。
机器学习进入物理世界以后,既失去了可以直接下载的互联网数据,也失去了随时重来的低成本环境。
主持人:
如果 OpenAI 或 Anthropic 开始大举投资机器人,你认为会给这个行业带来怎样的影响?其他竞争者会因此感到担忧吗?
Sergey Levine:
公平地说,机器人领域的生态可能还没有机器学习的其他分支那么健康。
计算机视觉和自然语言处理天然适合形成以机器学习为核心的生态,因为它们拥有可以自由获取的数据,业内也普遍接受使用学习方法。
此外,
这些领域面临的安全顾虑没有机器人那么严重
—— 至少在物理安全层面是如此。人们当然有理由担忧 AI 安全,但这和一台实体设备可能直接造成身体伤害,仍然不是一回事。
因此,在计算机视觉和自然语言处理领域,建立严肃的大规模机器学习项目相对容易一些。机器人领域却不是这样。
传统上,机器人学并不是一个特别愿意共享数据的学科。所以我认为,围绕机器人学习开展的活动越多,人们的思维方式就越有可能转向这样一种未来:
大家开始接受机器人将由学习得到的模型控制,而非由人工设计的控制器控制;机器人领域会产生大量数据,而这些数据必须得到共享。
因为任何一家机构都不可能只在一个垂直领域里,独自建立真正的基础模型。整个机器人行业的思考方式,需要逐渐从传统的工厂自动化,转向我们看待计算机视觉和自然语言处理的方式。从这个意义上说,尽管我为 Physical Intelligence 正在开展的工作感到自豪,但要推动所有人朝这个方向转变,只靠一家公司是不够的。
主持人:
目前,机器人可以使用不同类型的数据,比如模拟数据,也可以采集真实世界里的物理交互数据。哪类数据最好,哪类数据最差?它们各自有哪些优缺点?
Sergey Levine:
机器人社区对这个问题有大量讨论,不同研究者的观点有时完全相反。我自己的看法是:
如果模型已经对物理世界形成了充分理解,那么它会更容易吸收各种不同来源的数据。
如果你想学习驾驶飞机,至少在一部分训练过程中,你大概率会使用飞行模拟器。你能够理解模拟器,是因为开始训练以前,你已经拥有大量关于世界的知识,可以用来理解模拟器中发生的事情。你知道,自己使用飞行模拟器学习驾驶飞机,并非单纯在玩电子游戏。你正在获取一些之后可以应用于真实飞机的知识,也理解模拟器与现实之间存在一层抽象关系。
观看别人做事也是如此。
假设你看着某个人做饭。即使你无法亲身感受到他的每一个动作,你仍然可以调用自己的经验。你会想:「我看到他拿起了盐瓶。我以前也往食物里撒过盐,所以大致知道他在做什么。」于是,你可以把这段行为抽象成「加盐」,不必分析对方每一块肌肉的运动。
我想表达的是:
一旦你理解了怎样利用自己的身体完成动作,也理解自己如何体验物理世界,其他来源的知识就都可以与这套理解连接起来。亲身经验提供的基础,可以帮助你对其他一切信息进行「落地」。
由此推论,如果一个机器人基础模型使用大量真实的具身数据进行训练,并由此获得了对物理世界的基础理解,它可能会更善于吸收其他来源的知识。这个观点和一些人的想法恰好相反。
看到互联网数据为大语言模型带来的成功后,人们很容易认为:机器人也应该采用相反的路线 —— 先用 YouTube 视频训练模型,再在此基础上加入机器人数据。
但我认为,正确的顺序可能正好倒过来。
只要先建立扎实的机器人经验基础,就可以在上面继续加入其他所有数据,而且模型反而会更善于吸收这些知识。
主
持人
:
假设人形机器人没能在个位数年内取得成功,你认为它最可能因为什么而失败?
Sergey Levine:
机器人想要真正发挥作用,必须达到很高的可靠性、鲁棒性和泛化水平。这个标准要高于我们通常对大语言模型,或者图像、视频生成模型的要求。
因为这些生成式 AI 工具通常需要与人类互动。你让大语言模型完成一项任务,它的第一次回答可能不完全符合要求。于是你修改提示词,继续和它反复交互。
也正因如此,即使早期的语言模型工具 —— 比如第一版 ChatGPT—— 远没有今天的模型强大,也已经具备实用价值。用户可以不断尝试和调整,直到模型基本解决问题。这和使用搜索引擎类似。你输入一个查询,没有得到想要的结果,就换一种问法,再次搜索,最后总能找到需要的信息。
但机器人的全部价值,只有在它能够自主完成任务时才会释放出来。
如果每执行一项任务,都需要有人守在旁边反复调整和指导,那么这几乎违背了使用机器人的初衷。所以,最大的风险在于:机器人究竟能否顺利达到实际应用要求的可靠性和鲁棒性?
我个人非常看好强化学习之类的技术。它们可以利用机器人自主获得的经验,继续打磨最后几个百分点,让系统从 95% 的成功率真正走向 100%。这一步非常重要,但目前还没有得到解决。
主持人:
作为一个旁观者,我经常在推特上看到中国机器人团队发布的演示,效果非常惊艳。从某些方面看,他们似乎已经走在了前面。但我并没有很深的专业背景,所以很好奇你的看法:你怎样评价中国的机器人产业?他们真的发展得更快吗?
Sergey Levine:
对于我们这些在美国和欧洲从事相关工作的人来说,一件很有价值、也很有建设性的事情,就是思考:我们能从中学到什么?
在我看来,其中一条重要经验是:
必须建立一个健康的生态系统。
所谓生态系统,当然包括优秀的研究人员和工程师,也包括健康的开源生态。但这还意味着,所有为机器人产业提供支持的行业,本身都必须保持健康。
这些行业不只有计算机科学、机器学习和模型研发,还包括供应链、制造业和硬件研发。所有这些环节都非常重要。
其中有些方面,美国做得相当好;但在另外一些方面,美国这些年多少有些放任它们衰退了。我们应该观察世界各地正在发生什么,关注中国实验室以及其他国家实验室取得的优秀成果,并从中吸取一条教训:我们需要努力建设一个更加健康的生态,为所有支撑机器人发展的环节投入资源。
我并不擅长商业或投资,所以不能声称自己知道具体应该怎么做。但我认为,我们必须充分认识到,
这是一个需要整体发展的系统。我们不可能只做好其中一个环节,再把其他所有事情都外包出去。
主持人:
在整个生态系统的这些组成部分中,以一名美国机器人研究者的视角来看,哪一部分如果得到改善,会对机器人技术进步产生最大的影响?
Sergey Levine:
我认为,
能否获得可靠、低成本的硬件,肯定是一个非常重要的问题。
目前,机器人研究使用的许多硬件确实来自中国。这些硬件质量不错、价格相对便宜,也能够达到研究人员通常需要的标准。不过,如果我们在美国国内也能获得这些硬件,当然会非常好。
我不认为这件事存在任何不可逾越的困难。关键只是要接受一个事实:整个生态系统都需要得到支持,不能只扶持其中一个环节。
先找到真正值得规模化的东西
机器人行业已经给出了三种收集经验的办法。
Figure 通过 Index 动员 108 个国家的普通用户,记录家庭、餐厅、办公室和工厂里的真实任务。ACE 准备让生产线工人佩戴传感器,用两年时间收集数千万小时动作数据。北京人形则建立百万小时数据池,让视频预测与机器人动作相互训练。
但数据更多,并不必然意味着能力更强。Levine 反复强调,机器学习能够规模化的前提,是先找到正确的技术和正确的数据。机器人目前还没有进入类似 GPT-4 到 GPT-5 的稳定 Scaling 阶段,整个行业仍在寻找那些真正可以被放大的杠杆。
主持人:
大语言模型已经产生了前所未有的影响,也吸引了巨额投资。物理 AI 和人形机器人潜在的市场规模甚至可能更大。人形机器人目前发展到了什么阶段?你预计这项技术最终会以怎样的方式真正进入现实世界?
Sergey Levine
:
过去几年 —— 更准确地说,是过去十年 —— 机器学习带给我们的一个重要经验是:只要把规模做起来,它就能奏效。现在看来,这一点似乎理所当然,但以前并非如此。
不过,这里面有一个前提:
你必须找对值得规模化的东西。
以语言模型为例,最初人们开始研究这类模型时,主流架构是 LSTM。LSTM 的表现还算可以,也远远胜过此前的方法,但它的可扩展性并不好。Transformer 真正重要的地方,并不在于它在数学上多么优雅,而在于它更容易扩展。人们可以用海量数据、非常多的参数来训练它。
所以,一项技术的发展通常分为几个阶段。
首先
,
你
要弄清楚什么东西可以被规模化,也就是找到具有可扩展性的技术。随后,再投入工业级的资源:增加大量数据、扩大模型规模。这个时候,某种「魔法」才会真正出现。
因此,在进行更基础的技术研发时,关键是找到那些能够撬动规模的杠杆:确定正确的架构,找出大致合适的要素组合。完成这些工作,本身可能已经能实现一些很酷的效果,但它还不足以真正改变世界。只有当你开始持续拉动规模化这根杠杆时,事情才会发生实质性的变化。
回到你的问题,我认为机器人目前还没有进入类似 GPT-4 到 GPT-5 的阶段 —— 也就是投入工业级资源、扩大模型规模,能力便会随之提升的阶段。
机器人现在仍处在确立基础技术的阶段。
所以,我们目前不应该期待机器人模型每个月都会变得更大、更强,并沿着某条可预测的缩放曲线持续进步。实际上,随着正确技术逐渐被开发出来,机器人模型的缩放规律本身也还在变化。我认为我们现在正在把一块块拼图放到正确的位置,而且距离拼完整已经非常近了。许多关键拼图正在陆续就位。
但也正因如此,这项技术接下来会走向哪里,仍然很难预测。它还没有进入那个可以通过缩放规律进行稳定预测的阶段,而是处在寻找和组合关键拼图的阶段。
主持人:
最先实现规模化的实验室,也可能最先取得突破。这里或许会出现一种指数级增长效应:机器人部署得越多,发展速度就越快;发展得越快,又越容易扩大部署,由此形成一个不断加速的数据飞轮。你认为机器人行业会出现这种情况吗?
Sergey Levine:
这种说法确实有很大一部分是正确的,但有一个重要细节必须注意:你需要把正确的东西规模化。
真正的关键在于建立一套有效的正向反馈循环 —— 部署的机器人越多,模型能力就越强。这个逻辑完全说得通。困难在于,人们很容易用错误的方式来建立所谓的数据飞轮。
假设我经营着一家汽车公司,生产线上有一条机械臂负责焊接汽车。它每天都在执行焊接任务,每个月可以完成上百万次焊接。如果我只是把这些操作记录用作数据飞轮,那么最终得到的东西,很可能仍然只是一台更擅长焊接汽车的机器人。但这台机器人原本就已经部署在生产线上,也已经能够焊接汽车了。在此基础上继续取得一点边际提升,未必具有多大价值。
这就是为什么我们必须把正确的东西规模化。
数据并不是一种完全可替换的标准化商品。它不像电力或石油,不是简单地买得越多越好。机器人需要的是具有异质性和多样性的数据。
所以,数据飞轮的基本方向没有错,但你需要使用正确的技术,扩大正确的对象,并获得能够支持多样化学习的数据来源。对机器人来说,数据更像一套教育课程,而非一种可以买来囤积的标准化商品。
主持人:
如果让你提出一份不必特别具体的路线图,从现在到「机器人进入我家、替我做事」这个终极目标,中间需要经过哪些关键里程碑?
Sergey Levine:
机器人最困难的部分,始终是泛化能力。
当一家公司展示自己的机器人系统时,单看一段演示,通常很难判断它究竟展现了多强的泛化能力。例如,机器人完成高难度特技的演示,看起来当然非常激动人心。但这类内容往往带有一定程度的编排。它和机器人在任何一户家庭里,每次都能可靠地完成任务,并不是一回事。
如果单独观察,泛化能力通常没有那么惊艳。因为泛化是经过许多次试验才能体现的特征,无法通过单次演示充分展现。你看到的可能只是一台机器人完成某件非常普通、毫不起眼的事情。真正令人兴奋的是:它使用的是一个从未见过的物体,身处的是一个从未测试过的环境。实际上,这比完成一套已经练习过上百万次的杂技后空翻困难得多。
这份路线图的核心首先是获得更强的泛化能力;其次,还要产生一种二阶效应:机器人泛化得越好,就越能进一步获得更强的泛化能力。这条路线上的一个关键里程碑,是非常明确地证明:机器人进入一个训练阶段从未接触过的环境后,能够利用自主收集的经验持续进步。
比如,我先在实验室里完成后端工作,得到一个模型和一套适应算法,再把它部署到新环境中。这个环境可能是一户家庭,也可能是一座工厂。无论在哪里,它都需要执行真实任务。刚开始时,它的表现可能只是勉强过得去。但随着时间推移,它会不断改善,最终达到现实应用所需的可靠性,而非提升到 50% 左右就触及上限。
这意味着整个过程已经真正实现自动化:机器人一边收集有用的经验,一边持续改善自身。
接下来,我就可以把它部署到许多不同领域,让它执行人们真正需要的任务、收集有价值的经验,并用这些经验继续改进模型。
另一个重要里程碑,是找到一种明确而实用的方法,在不同场景间迁移知识和常识,以此提高系统的可靠性。
比如,你开车行驶在路上,突然看到一辆消防车和许多交通锥。即使你以前从未遇到过这种情况,常识也会告诉你:「我应该减速。」你可能不知道怎样处理才是最优选择,但至少不会径直冲过交通锥,干扰消防员工作。这就是常识。
如果机器人能够利用常识,从意外状况中恢复,那会非常重要。例如,机器人把锅铲放进了烤箱。它从语义上应该知道,这不是锅铲应有的收纳方式,于是重新打开烤箱,把锅铲取出来。如果它能这样处理,就说明我们可以利用常识纠正错误。
我认为,这会是另一个重要进展。
主持人:
那么再看看比较乐观的路径。假设一切进展顺利,十年后我们拥有了能力极强的模型和机器人。最终目标会是终结人类劳动吗?
Sergey Levine:
我认为,
把机器人理解成「机械人类」是一个错误。
从某种层面上说,计算机有点像「机械大脑」。但在 20 世纪 90 年代和 21 世纪初,个人计算机真正普及时,首先发生的事情并不是人们用计算机替换自己的大脑。
我们看到的,
是各种不同形态的计算机大量涌现,也就是所谓的普适计算。
你的书桌上有一台计算机,口袋里可能也有一台;冰箱里可能有,汽车里也可能有。因为计算变得非常容易获得,所以任何东西里都可以加入一点计算能力。
我认为,最早在 20 世纪四五十年代思考计算机的人,应该很难想象这样的未来。他们可能设想的是占据整个房间的巨型计算机,负责制定或控制一个国家的政策,而不会想到每个人的冰箱里都会有一点计算能力。
以此类推,未来可能会是「所有东西里都有一点物理执行能力」。许多现在必须亲自完成的日常琐事,未来都可能得到一点自动化帮助。
另一个值得参考的例子,是现代编程智能体。当然,编程智能体最终会走向哪里,目前仍然没有定论。但从今天软件工程师的实际体验来看,大多数人似乎更倾向于认为,编程智能体增强了自己的能力,而非让自己陷入恐慌。
当然,肯定也有人会感到恐慌。但至少从我接触过的软件工程师以及我自己的体验来看,使用 AI 工具扩大个人能够完成的工作量,更多是一种能力增强。
这个类比可能相当直接,因为软件工程确实是一份真实存在的工作,AI 已经进入这个职业,并为从业者提供了更大的杠杆。
所以,这是我们可以参考的另一个例子。
不过,真实结果究竟如何,仍然需要时间证明。
参考链接:
https://www.figure.ai/news/introducing-index
https://www.developing.dev/p/sergey-levine-current-state-of-humanoid?r=n49ky
https://www.worldrobotconference.com/news/3649.html
https://www.reuters.com/technology/ace-robotics-ceo-says-robot-brains-will-have-chatgpt-moment-by-end-2027-2026-08-21/
© THE END
转载请联系本公众号获得授权
投稿或寻求报道:[email protected]
Source:Machine Heart — Robotics on WeChat · mp.weixin.qq.com