Co-training Egocentric Video and Robot Demonstrations:用人类第一视角视频增强机器人导航

Task: Language-conditioned Mobile Robot Navigation
Method: Egocentric Visual Odometry, Motion-intention Conversion, Human-Robot Co-training
Venue: arXiv
Year: 2026
Paper: https://arxiv.org/abs/2606.01951
Code: 未公开

一句话总结

论文把人类第一视角视频通过视觉里程计转换为离散运动意图,再与少量机器人示范共同训练 VLA 导航策略;在目标物变化和未见起点上,共训练模型明显优于只用机器人数据或只用人类视频。

研究背景与动机

机器人示范数据昂贵:需要真实平台、遥操作员、安全环境和重复采集。

相比之下,人类第一视角视频数量更多,也包含丰富的目标导向行为。

然而人类视频不能直接作为机器人动作监督,因为:

  • 摄像机运动与机器人控制空间不同;
  • 单目视频缺少绝对尺度;
  • 人类头部运动含有抖动和观察动作;
  • 机器人只执行平面移动等受限动作;
  • 两种数据的外观、动力学与时间尺度不同。

论文的目标不是让机器人直接模仿人体关节,而是从头戴相机视频中提取平台无关的运动意图,再与机器人动作数据共享训练。

这为利用大规模人类视频补充机器人数据提供了一条相对轻量的路线。

方法详解

1. 从人类视频恢复相机运动

管线使用 SuperPoint 提取局部特征,LightGlue 建立相邻帧匹配。

随后通过 Essential Matrix 与 RANSAC 估计相机相对运动,并把六自由度运动投影到平面 $SE(2)$。

由于单目视觉里程计不能恢复真实平移尺度,论文对平移进行归一化,把它解释为“运动方向或意图”而非米制速度。

2. 运动信号稳定化

原始头部轨迹包含大量抖动,作者使用多级处理:

  • 速度裁剪;
  • 窗口大小 $N=5$ 的中值滤波;
  • Kalman 滤波,$Q=0.005$、$R=0.5$;
  • 连续运动离散化为机器人动作类别;
  • 众数滤波移除持续少于 12 帧、约 200 ms 的短暂变化。

这一步把不稳定的视觉运动估计转成更接近移动机器人控制指令的离散标签。

3. 共同训练的 VLA 架构

视觉侧使用冻结的 SigLIP2 与 DINOv3 特征。

特征经过 Transformer adapter 融合:

  • 8 层;
  • 隐藏维度 512;
  • 前馈维度 2048。

动作生成使用基于 Conditional Flow Matching 的 DiT:

  • 8 层;
  • 动作 horizon 为 32。

模型共同接收人类视频派生的运动意图和机器人示范动作,在同一策略空间学习目标导向导航。

4. 数据组成

机器人数据包含 150 次真实导航试验,主要围绕红苹果目标,并从四个起点采集。

人类数据包含约 240 段视频,来自包含红苹果、绿苹果和橙子的任务设置。

论文还区分简单场景与干扰物场景,以测试目标外观变化和视觉干扰。

这里最重要的数据不对称是:机器人示范只覆盖有限目标,而人类视频覆盖更多目标类别。

因此实验能检验人类视频是否提供语义与行为泛化,而非只增加同分布样本数量。

5. 三种训练条件

作者比较:

  1. Robot-only:只使用机器人示范;
  2. Human-only:只使用人类第一视角视频派生标签;
  3. Ours:人类视频与机器人示范共同训练。

这一设计直接检验两种数据是否互补。

实验关键数据

1. 真实机器人平台

实验使用 CobotMagic 真实机器人,并测试对不同水果目标和干扰场景的导航。

指标包括:

  • NoD:无干扰场景成功率;
  • Dist:有干扰物场景成功率。

2. 不同目标上的表现

训练数据 红苹果 NoD / Dist 绿苹果 NoD / Dist 橙子 NoD / Dist
Robot-only 88.9 / 22.2 88.9 / 22.2 88.9 / 22.2
Human-only 11.1 / 11.1 22.2 / 11.1 5.56 / 11.1
Human + Robot 100 / 88.9 88.9 / 88.9 100 / 94.4

Robot-only 在无干扰场景中看似稳定,但遇到干扰物后都降到 22.2%。

Human-only 几乎无法直接控制真实机器人,说明仅靠平台不匹配的人类运动意图不足以学习可执行策略。

共同训练同时保留了机器人可执行性和人类视频带来的语义覆盖。

3. 未见起点泛化

训练数据 未见起点成功率 (%)
Robot-only 41.7
Human-only 0.0
Human + Robot 75.0

共同训练相对 Robot-only 提升 33.3 个百分点。

这支持人类视频确实提供了有助于路径或目标泛化的行为先验。

4. 结果边界

实验规模仍较小,动作空间主要是二维地面导航。

论文没有证明同样方法能扩展到:

  • 机械臂六自由度控制;
  • 接触丰富的操作;
  • 与真实人类同步协作;
  • 长时程多阶段任务。

亮点与洞察

1. 不追求精确人机动作同构

作者没有强行把人体运动映射成机器人连续控制,而是提取更抽象的运动意图。

这种“先找共享低维接口”的思路比直接动作重定向更稳健。

2. 人类数据与机器人数据缺一不可

Human-only 的失败非常有信息量。

人类视频能扩展语义和状态覆盖,却不能替代机器人本体上的可执行性数据。

这说明人类视频能补充语义与状态覆盖,但不能消除机器人本体数据采集。

3. 第一视角数据可以提供任务条件下的行为先验

人类头戴视频同时看到目标、障碍与自身运动方向,更接近“人在当前情境下会怎么行动”。

这类信息可以帮助预测人的下一步动作或意图。

4. 跨载体学习的关键是表示对齐

论文在 $SE(2)$ 运动意图层对齐人和机器人。

这表明跨载体学习的关键不是直接混合原始动作,而是找到两种载体都能表达、又与目标任务相关的中间表示。

局限性

1. 单目视觉里程计存在噪声和尺度歧义

大量滤波与离散化说明原始头部运动信号并不稳定。

弱纹理、动态物体、快速转头和遮挡都可能破坏标签质量。

2. 训练数据配比与控制变量仍需更清楚

性能提升可能同时来自更多数据、更多目标类别和跨域正则化。

如果没有严格匹配数据量和语义覆盖,很难把增益归因于“人类第一视角”本身。

3. 动作空间过于简单

二维导航与六自由度操作、双手协作或递交接触有很大差距。

运动意图映射在高维动作中会更困难。

4. 不是人机协作实验

人类视频用于离线训练,测试时没有真实协作伙伴。

它不能证明策略能理解人的即时需求或适应人的在线行为。

5. 环境和任务规模有限

目标主要是三类水果,机器人数据只有 150 次试验。

结论是否能推广到复杂室内环境尚不清楚。

相关工作与启发

与 EgoExo-WM 的关系

EgoExo-WM 通过把外部视角视频转换为近似第一视角,扩展未来预测训练数据。

本论文则把第一视角视频转换为运动意图标签,扩展策略训练数据。

两者都说明跨视角、跨载体数据必须经过结构化转换,而不是直接混合。

与机器人自模型的关系

Egocentric Visual Self-Modeling 用机器人自身第一视角预测动作后果。

本论文利用人类第一视角提供目标导向行为先验。

二者分别提供机器人自身动力学先验与人类目标导向行为先验,关注点互补。

可推广的实验设计原则

评价跨载体共训练时,至少应比较:

  1. 只用机器人示范;
  2. 只用人类视频派生标签;
  3. 不经结构化转换的直接混合;
  4. 使用共享中间表示的共同训练。

各条件还需要控制样本量、目标类别覆盖和训练步数,否则性能提升可能只是数据更多。

除总体成功率外,还应单独报告跨对象、跨起点和干扰场景泛化,以判断人类视频到底补充了什么信息。

评分

维度 评分 说明
问题重要性 8.5/10 降低机器人数据成本是具普遍性的难题
方法新颖性 8.0/10 将头部 VO 转成共享运动意图并共训练,接口设计有启发
实验可信度 7.0/10 真实机器人结果清楚,但任务和数据规模较小
可复现性 7.5/10 视觉里程计、滤波和模型参数较具体
研究启发性 8.5/10 说明跨载体数据需要结构化对齐和公平数据消融

综合评分:7.9/10。

这篇论文证明人类第一视角视频可以通过共享运动意图改善机器人导航训练,但其结论仍限于小规模二维导航任务。

来源与相关论文