IROS 2026 On-Site Observations: Long-Term Tasks, Failure Recovery, World Models
IROS 2026现场观察:长任务、失败恢复、世界模型
The IROS 2026 conference focused on robot performance in long-term tasks, failure recovery mechanisms, and the application of world models. The conference demonstrated robots' ability to perform continuous operations in complex tasks, such as connector insertion and block stacking, and emphasized the synergy between perception, prediction, and execution. Additionally, exhibitors showcased a variety of new sensing devices and dexterous hands, advancing the development of embodied intelligence.
The IROS 2026 conference highlights a shift toward long-term tasks, failure recovery, and world modeling in robotics. Researchers are focusing on continuous operation, robustness, and data-efficient learning, with notable advancements in manipulation, perception, and control. The event underscores the growing emphasis on real-world testing and the integration of diverse sensing modalities.
Source: Chinese robotics — Hardware and sensing · Read original article ↗
![]()
具身智能进入长任务时代。
出品 / Leon、「新物种Sinovum」编辑部
现场拍摄报道于匹兹堡,美国
9 月 27 日至 10 月 1 日,IROS 2026 在匹兹堡召开。一篇论文的中稿,成为笔者此行匹兹堡的契机,也让这场观察得以同时覆盖论文报告、比赛与展馆。
今年大会有超过 1900 篇论文,外加数十场 Workshop、比赛和 170 多家展商。规模仍然很大,但比数字更容易被记住的,是几个具体场景。
一边,人形机器人继续踢球、做高速全身运动;另一边,机器人被放进越来越标准化的测试里。RoCo Challenge 要求机器人完成连接器插入、走线、拧螺丝、电池安装或者积木搭建;Legged Robot Challenge 则把双足、四足机器人放上统一的障碍和测试装置,看它们能不能真正走过去、站稳,再继续执行任务。
展馆里,变化换了一种形式出现。数据手套、外骨骼遥操作、第一视角人类数据被摆到越来越显眼的位置;灵巧手依然密集,但它们旁边开始出现更多触觉、力矩传感器和接触数据工具链。机器人本体也在分化:有的继续追求完整人形,有的干脆装上轮式底盘,有的则把本体做成开放开发平台。
如果只看论文数量,这仍然是一届不断扩大的机器人大会。
但把今年的论文、比赛和展馆放在一起看,机器人面对的问题正在变得更具体:一项任务能不能从头做到尾,连续做几十次以后还能不能稳定,失败以后能不能自己回来,以及完成一个新任务究竟需要多少数据。
01.
从Demo到任务
IROS 2026 共收到 4348 篇投稿,最终录用 1585 篇,录用率仅有 36.45%。
据统计,强化学习仍是今年 IROS 最密集的研究方向,其次是运动与路径规划、视觉感知深度学习;模仿学习和抓取操作也进入前五。导航、机器人控制、多机器人系统、建图和传感器融合则构成了另一组高频主题。
![]()
IROS 2026 论文关键词,制图:「新物种Sinovum」
这些关键词说明,操作、规划、感知和控制仍然是 IROS 的基本盘。更明显的变化,是这些传统问题正在被放进更长、更复杂的任务里:机器人不再只需要完成一次抓取或移动,而要处理动作衔接、双臂协同、接触、失败恢复,以及连续执行中的稳定性。
今年的获奖论文把这种变化表现得尤其直接。
最佳论文奖颁给了 Yumin Lee、Hyoseok Ju 和 Giseop Kim 的 LT-Mem。它用 Live、Delta、Meta 三层记忆记录物体的当前状态、变化事件和长期规律,再根据物体的“易变程度”决定更新、保留还是并行保存多个假设。机器人要长期工作,不只得知道物体现在在哪里,还要记得它曾经在哪里、通常如何变化。
最佳学生论文奖则关注更短、更快的时间尺度。Pei-An Hsieh 等人研究多架四旋翼近距离编队时的下洗气流和空气动力干扰,以物理约束的残差学习补偿未建模扰动,同时保留系统的微分平坦性;真机平均跟踪误差降低 31%,控制循环维持在 5 毫秒。
清华大学、北京大学、银河通用等联合团队的 LATENT 获最佳娱乐与休闲论文奖,它从不完整的真人动作片段中学习击球和移动,再组合成能与真人连续对打的网球策略;UC San Diego 的 SteadyTray 获移动操作最佳论文奖,其 ReST-RL 架构将双足行走与托盘稳定解耦,以残差策略抵消步态晃动;马里兰大学 Zhi Wang 等人的 HumanEgo 凭借少量第一视角人类视频实现零样本机器人技能迁移,获 WORLDS Workshop 最佳论文;iFlax 以神经符号学习缩小长程任务的规划空间,获 ReS AI Workshop 最佳论文。
![]()
IROS最佳学生论文颁奖现场
在人形机器人方向,任务尺度拉长得也十分明显。
ULTRA 用统一控制器让 Unitree G1 根据第一视角感知和稀疏目标完成移动与操作;RISE 以专门策略处理二者的切换;Bi-HIL 则用子任务进度和关键帧记忆组织长程接触密集的双臂任务,并把力反馈送入低层控制。三者共同追问机器人如何衔接动作,并判断“现在做到哪一步”。
这些工作的技术路线并不相同,但有一个共同前提:机器人不再只需要完成一个孤立动作,而要把移动、双手协同、接触和任务进度连续处理下去。
任务一旦变长,失败就更难被藏起来。
FRAMES 用视觉语言模型持续监控 Unitree G1:在 100 次实验中识别出 48/50 次失败、接受 46/50 次成功,准确率为 94%,但端到端恢复仍在测试。RaC 则收集机器人接近失败时的人类纠正,在挂衬衫、密封盒盖等双臂任务中,表现较标准模仿学习提升超过两倍。失败不再只是需要清洗的“脏数据”,而开始成为训练材料。
到了比赛现场,这些问题被进一步标准化。
RoCo Challenge 今年设置了两条赛道。Industrial Board Assembly 要求机器人完成连接器插入、走线、拧螺丝和电池安装;Brick Assembly 则要求机器人用积木搭建指定结构。比赛明确把物理理解、灵巧操作、长时程推理和泛化作为四项核心能力,并从前期仿真筛选一路进入匹兹堡真机决赛。
比赛策划人、CMU 机器人学博士生刘瑞轩告诉「新物种Sinovum」,“拼装任务把 Physical AI 最难的几个问题集合在同一个平台上:对物理的理解、精细灵巧操作、长程任务的分析与执行,以及泛化。”
![]()
RoCo Challenge比赛现场,来源:受访者提供
Legged Robot Challenge(LRC)则把标准化评测放在了移动能力上。它沿用 IEEE/RAS 足式机器人挑战的思路,在统一地形、障碍和操作任务上测试机器人,目的不是展示一个最好看的动作,而是让不同本体的移动、鲁棒性和自主能力真正能够横向比较。
![]()
LRC比赛现场
从论文里的长时程操作,到 RoCo 的连续装配,再到标准化的足式机器人测试,今年 IROS 对机器人能力的衡量正在被放进更长的时间里。
一项技能能不能做出来仍然重要,但当任务需要连续十几步甚至持续几个小时,动作衔接、失败监测、恢复和长期运行的可靠性都会变得更重要。
而任务越长,另一笔账也越难绕开:这些能力,到底需要多少数据才能学出来?
02.
机器人的「经验来源」
走进 IROS 展馆,这个问题变得具体:数据手套、外骨骼遥操作和第一视角记录并列出现,数据采集开始分化成不同路线。
第一步,是先把人的动作采下来。
荷兰公司 MANUS 首次展示了模块化手套体系 Nexus,让同一个顶部模块切换到不同手套,按应用需要采集不同类型的数据,用户在调整采集方式时不必重搭一套硬件。
同时发布的 Core 3.2 软件新增原生 ARM64 支持,可通过 Linux SDK 和 ROS 2 包部署到 ARM 架构的机器人平台,并补上了 Python SDK 和 NVIDIA Isaac Teleop 的触觉反馈支持。校准也做了改进,手部解算能更好地适应不同人的手型,捏合动作的精度更高。
![]()
MANUS 的 Nexus 方案
诺亦腾把全身动捕、数据手套和低延迟动作映射组合起来,让人的身体与手部动作可以一起进入机器人遥操作和示范数据采集流程。
![]()
诺亦腾展示的数采方案
Xsens 也用全身动捕把人的动作重定向到人形机器人,并接入 NVIDIA Isaac Sim,串起示范采集、仿真训练与部署。在现场,操作员穿惯性动捕服,动作实时映射到人形机器人上。
Xsens动捕展示
DexMate 则用可穿戴外骨骼把人的上肢动作映射到 Vega 的双 7 自由度机械臂,并直接记录示范数据;Vega 的轮式底盘、VR 接口和匹配真机的仿真模型,又让采集、训练、仿真与实机测试能够在同一平台完成。
![]()
DexMate 的 Vega机器人
RAI 展示的 Koala Gripper 则从末端反推采集工具:手持版记录人的示范,电驱版在机器人上复现,两者共享结构和动作空间,以减少数据采集与执行硬件之间的落差。
![]()
现场展示的Koala Gripper
光轮智能用 EgoSuite、SimReady 和 RoboFinals 串起第一视角数据、仿真资产与模型评测;
![]()
光轮智能的展台
鹿明机器人则用 Ego Vue、NexCore 和 Station Lite 展示了从第一视角数据采集、技能开发到插头插接与毛巾折叠等真机验证的闭环。
![]()
鹿明的 Ego Vue
数据有了,还需要一具身体把动作真正做出来。再往里走,“手”很快成为一个高密度品类。
舞肌展出的WUJI Hand 2 仿生灵巧手拥有 20 个主动自由度、1000Hz 控制频率和高度反驱能力,可实现柔顺、低阻力的精细操作,佩戴 WUJI Glove 实时遥操作,能完成从人手动作采集、重映射到机器人执行的闭环。
![]()
WUJI Hand 2
Sharpa 作为比较完整的一个样本,则把 D01 触觉机器人、21 主动自由度的 W02 灵巧手和 AE01 高保真外骨骼触感数据手套三个新品放在一起,串起动作采集、触觉反馈和机器人执行。
Sharpa 的 AE01
星动纪元把 XHand 系列全带了过来,包括 XHand 1 Pro、XHand 1 和 XHand 1 Lite;强脑科技展示的 Revo 3 灵巧手拥有 21 个全直驱、可反驱主动自由度,并结合全掌触觉与视触觉感知,为精细抓取和接触操作提供反馈;因时机器人则首发 RH5MK1 系列 22 自由度直驱灵巧手,把更紧凑的直驱结构和高精度运动控制带到五指操作中。
![]()
星动纪元、强脑科技和因时机器人灵巧手产品线
但能够复现动作,并不等于机器人已经理解了接触。另一种明显趋势,是越来越多公司不再把“手”当成孤立硬件。
Robotiq 把自适应夹爪、六维力矩和指尖触觉传感器接入 Contact Core,同步机器人状态与接触数据;其 28 单元指尖模块以 1000Hz 采样,并通过 ROS 2 和 Isaac Sim 接口把真实接触继续送入训练与仿真。
![]()
Robotiq 展示其在 Isaac Sim 的呈现
帕西尼和非夕从不同方向补上接触感知。帕西尼把触觉传感器、数据采集手套和机器人足底触觉做成一条产品线,让手部操作与行走接触都能产生训练数据;非夕则把力反馈放进自适应机械臂和双臂操作,在插入、装配等任务中根据接触力实时调整动作。
![]()
帕西尼展示拧灯泡操作(左)与非夕现场展示的四个机械臂 (右)
珞石把人形机器人、力控技术和具身智能方案放在同一展位,重点展示机器人接触工件后依据外力实时调整动作的能力。
不难发现,今年 IROS 展馆里正在被拆开的,其实是同一链条:真实世界里的经验,怎样被采下来,再变成机器人能用的数据。
一端是 MANUS、诺亦腾、DexMate、RAI、光轮和鹿明在降低示范采集与规模化处理的门槛;中间是舞肌、强脑、因时、星动纪元、大寰和 Sharpa 把灵巧手做得更接近真实操作;另一端是 Robotiq、帕西尼、非夕和珞石补上视觉看不到的接触与受力信息。
它们并没有给出统一答案。
一小时第一视角视频、一小时遥操作和一小时仿真,对模型的价值完全不同;一只 21 自由度的手也不一定比一只结构简单的手更容易学会任务;触觉传感器再灵敏,如果信号只显示在屏幕上,而没有真正进入控制或 policy,也很难改变机器人能力。
当视觉、动作、力和触觉都进入训练流程,接下来的问题才会来到模型这一侧:机器人究竟是在记住越来越多动作,还是开始学会预测一个动作之后,物理世界会发生什么。
03.
感知、预测、执行
手伸到杯子旁边,视觉上可能已经“够到了”,但夹爪未必真的建立接触;水龙头被推了一下,也不代表它已经打开。长任务里,这种微小差别会不断累积,因此机器人不仅要知道下一步做什么,还得确认上一步是否真的完成。
VLA 提供了一条相对直接的路线:把视觉、语言和机器人状态输入同一个模型,再输出动作。但真实环境并不会按照离散动作一步步推进。同一条抓取轨迹,可能因为摩擦、遮挡、物体位置或者接触角度不同,得到完全不同的结果。
今年 IROS 上一些 VLA 工作正补足这种状态理解。Georgia Tech 等团队提出的 OG-VLA,就在 VLA 中加入正交视图生成,希望获得更稳定的 3D 空间表示,让模型更清楚物体在哪里、彼此是什么关系。
与它相邻的另一条路线,是让系统跨时间保留状态。最佳论文入围奖 Streaming Gaussian Encoding 来自 4D 场景理解,并非操作 VLA,它持续更新高斯查询,在跨帧追踪中保留几何、语义、物体身份和可见性,关键不只是“看得更多”,而是下一帧不要忘掉上一帧建立的世界。
但看清位置仍不等于确认接触。另一篇入围最佳论文的 VTAP Gripper 将指尖触觉阵列与可在视觉、触觉间切换的主动掌心结合,完成易碎物抓取、针筒重定向和插孔等任务,也说明精细操作未必只能依赖拟人手。
展馆里,戴盟机器人则用 DM-Tac、Data-Nexus 和 Daimon-TWM 串起触觉采集、处理与世界模型,让接触信号进入预测和控制。
确认状态之后,下一步是预测动作会怎样改变环境。Physical World Models Workshop 与 WorldArena 2.0 开始追问世界模型能否服务规划、强化学习和真机操作。星尘智能展示的 Lumo-2 在潜在空间预测动作相关的状态变化。
世界模型也不一定都在生成未来。
获最佳论文入围奖之一的 DAWN 以带噪深度训练、干净深度监督,对齐两种观测,让 Unitree Go1 依靠原始深度完成楼梯、跨沟和登台跑酷。它说明,如果机器人无法从噪声中稳定识别当前状态,未来预测也就失去了起点。
预测仍只是中间一步。高层模型的更新以几十甚至几百毫秒计,接触和平衡控制却需要数百赫兹乃至 1kHz 的反馈。LITHE 把系统拆成负责逻辑的“Brain”和维持 1kHz 控制的“Spine”;Shallow-π 则将 VLM 主干和动作头由 18 层蒸馏到 6 层,速度提升两倍以上,成功率下降不到一个百分点。前者守住实时闭环,后者缩短模型进入闭环的距离。
这些模型和控制最终还要落到不同身体上。
萝博派对 RP1 首次亮相,作为面向开发者的全栈开源双足人形机器人,160 N·m 峰值扭矩、3 m/s 速度及可替换的运控、感知、交互和数据采集头,让同一本体覆盖步态控制、Sim-to-Real、端到端策略和具身数据采集,现场还演示了连续动作、抗扰和平衡恢复。
萝博派对的 KickMe环节
银河通用现场既有 ET1 表演,也开放 G1 的 VR 遥操体验,呈现自主生成与人类示范两条路径。
银河通用的 ET1
越疆 Atom 和宇树探索完整人形,至简动力 iX 转向轮式双臂,松延动力 Bumi 与“小悦”强调轻量化与人机共处。
智元则带来了全尺寸远征 A2 与小型灵犀 X2参加。
![]()
智元机器人的 A2、X2
加速进化的 Booster T2 同样是双足人形,但更偏开发平台,专业版用的是 NVIDIA Thor 芯片,算力 2070 TFLOPS。
加速进化的 BoosterT2
Fauna Robotics 的 Sprout 只有 3.5 英尺高、约 50 磅重,外壳柔软,没有夹点和锐边,目前主要卖给做研究的实验室。
![]()
Fauna Robotics 的 Sprout
法拉第未来的具身智能产品线(EAI)则以“一脑多形”覆盖轮式、四足和人形平台,现场摆出了多种形态的机器人,其中 9 款配置是 9 月中旬刚发布的。
![]()
法拉第未来的具身智能产品
眺月科技的 Hopcopter 则在跳跃与飞行间切换,以单点着陆和被动回弹适应复杂地形。
眺月科技的 Hopcopter
索尼为研发版 aibo 配了 ROS 2 SDK,让这只可爱的机器狗也能用于 Isaac Sim 仿真、强化学习和人机交互研究。
索尼的机器狗aibo
本体分化说明,感知、预测和控制最终都要经受不同身体的检验。
今年 IROS 还看不到一套已经收敛的具身智能架构。VLA 在继续补空间与状态理解,世界模型在学习稳定表征、尝试预测未来,触觉和力反馈也在进入模型,底层控制却依然牢牢占据着毫秒级的物理闭环。
这几条路线真正争夺的,其实是机器人系统里的边界:哪些问题应该交给模型,哪些状态必须显式预测,哪些反馈又根本来不及交给大模型处理。
走完整个展馆后,会发现机器人依然会打球、跑步,也依然有足够吸引镜头的 Demo。但越来越多工作开始把时间花在那些没那么好看的部分:动作之后世界会不会按预期变化,预测错了能不能及时发现,策略给出答案以后,身体又能不能在真实的摩擦、碰撞和误差里把它执行出来。
机器人离“会想”越来越近,但真正决定它能不能进入现实世界的,仍然是预测和执行之间那一段没有被填平的距离。
- End -
![]()
一个计算化学家的「反二向箔」远征|对话三向纪元余沛源
当AI开始替学生思考,一个教了30年书的教授重新理解课堂|对话波士顿学院 Rick Arrowood
What the source reports
Publisher-reported claims, with original evidence. These results have not been independently verified by RoboSignal.
Reported numbers
Reported accuracy
94%
What remains unknown
Not established in the collected evidence: Environment, Control, Data origin.
Reported performance applies to the described task. It does not establish general autonomy or deployment readiness.
Source excerpts and review record
Automatically extracted; no manual editorial approval recorded.
FRAMES 用视觉语言模型持续监控 Unitree G1:在 100 次实验中识别出 48/50 次失败、接受 46/50 次成功,准确率为 94%,但端到端恢复仍在测试。
Open source S22
RaC 则收集机器人接近失败时的人类纠正,在挂衬衫、密封盒盖等双臂任务中,表现较标准模仿学习提升超过两倍。
Open source S23
失败不再只是需要清洗的“脏数据”,而开始成为训练材料。
Open source S24
Pei-An Hsieh 等人研究多架四旋翼近距离编队时的下洗气流和空气动力干扰,以物理约束的残差学习补偿未建模扰动,同时保留系统的微分平坦性;真机平均跟踪误差降低 31%,控制循环维持在 5 毫秒。
Open source S17
Source:Chinese robotics — Hardware and sensing · 163.com