具身智能需要怎样的数据?

读《Data Pyramid for Embodied Manipulation》

从可扩展性与机器人对齐之间的张力出发,理解具身智能的五层数据金字塔。
论文阅读
具身智能
机器人数据
作者

neutrino

发布于

2026年8月15日

最近开始接触机器人数据,原本以为工作只是标定,后来才发现背后是一整套采集、同步、质检和处理管线。

带着这个背景读 Data Pyramid for Embodied Manipulation (Ye 等 2026年),我最关心的问题是:具身智能缺的是更多数据,还是更接近真实行动的数据?

论文用两个维度组织现有数据:一是能否低成本扩展,二是能否与真实机器人的观察、状态和动作对齐。二者往往存在矛盾:越容易规模化的数据,通常离真实执行越远;越接近真实机器人的数据,采集成本又越高。

五层数据金字塔

五层并不是简单的优劣排名,而是用不同成本提供不同的监督信号。

图 1: 具身操作的数据金字塔:从通用数据、仿真数据、第一视角数据和 UMI 数据,到与真实执行最对齐的机器人数据;右侧同时概括了各层的应用与发展趋势。图片来源:Data Pyramid for Embodied Manipulation (Ye 等 2026年)
数据层 能提供什么 主要问题
通用视觉语言数据 物体、语言、空间关系和常识 缺少动作与物理反馈
仿真数据 可控的状态、动作、奖励和失败样本 存在 sim-to-real 差距
第一/第三视角数据 人类操作步骤、运动和行为语义 没有机器人可直接执行的动作标签
UMI 式数据 末端执行器或物体中心的操作轨迹 仍需完成坐标、夹爪和机器人本体的映射
真实机器人数据 观测、状态、控制动作及真实后果 采集昂贵,任务和硬件覆盖有限

底层数据规模大,可以提供语义和行为先验;越往上,数据与真实动作和动力学越对齐,但数量也越少。因而,通用数据不能替代真实轨迹,真实轨迹也无法独自解决泛化问题。金字塔更像一张数据地图,而不是一种已经验证的最优配方。

目前还缺什么

论文总结的问题主要有六类:触觉数据不足,失败与恢复轨迹稀缺,跨层级采集难以扩展,不同机器人本体的状态和动作难以统一,人类操作先验难以迁移到灵巧手,以及不同数据应该如何混合仍缺少可靠规律。

其中我更关注触觉、失败恢复和灵巧手。视觉能看到物体是否移动,却很难判断接触力、滑移、形变和抓取稳定性;第一视角视频虽然包含大量人手操作先验,也不能直接映射到机器人手的关节与接触方式。如何提取可迁移的物体状态、接触关系和技能表征,仍是关键问题。

回到数据采集

这篇论文也让我意识到,采集并不是把传感器数据录下来就结束了。一条轨迹能否用于训练,还取决于时间戳是否连续、多相机是否同步、视频是否断流或遮挡、传感器流是否异常,以及标定文件是否与当前硬件匹配。

图 2: 仿真数据的基础设施与采集方法:左侧是机器人本体、传感器、场景、物体和仿真引擎,右侧是人工遥操作、轨迹回放、规则执行与自主生成等采集方式。图片来源:Data Pyramid for Embodied Manipulation (Ye 等 2026年)
Ye, Yifan, Yankai Fu, Yaoxu Lv, 等. 2026年. Data Pyramid for Embodied Manipulation. https://arxiv.org/abs/2607.24744.

完整的数据管线应该覆盖:采集 → 同步与标定 → 端侧质检 → 筛选与标注 → 训练使用。如果问题没有在采集阶段被发现,金字塔顶端最昂贵的真实机器人数据也可能只是噪声。

所以,具身智能的数据问题不只是“采得更多”,还要让不同来源的数据能够对齐,并保证每条高成本轨迹都真实、完整、可复用。这也是数据采集和质量控制真正重要的地方。

参考资料