Egocentric Visual Self-Modeling:机器人从第一视角学习自身动作动力学

Task: Robot Dynamics Prediction and Damage Adaptation
Method: Egocentric Visual Self-Model, Action-conditioned Forward Dynamics
Venue: arXiv
Year: 2022(v3, 2024)
Paper: https://arxiv.org/abs/2207.03386
Code: 未公开

一句话总结

论文让机器人用连续五帧第一视角图像和 12 维电机角度预测自身六自由度位姿变化,并用该模型在线评估候选动作;模型能适应不同身体构型,甚至在腿损坏后通过约 30 分钟真实运动数据恢复行走。

研究背景与动机

传统机器人控制依赖人工建立的运动学和动力学模型。

这类模型在结构已知、传感器可靠时非常有效,但面对以下变化会失配:

  • 机器人构型改变;
  • 地面材质变化;
  • 执行器性能衰减;
  • 腿或关节损坏;
  • 难以精确建模的接触与滑移。

论文研究一个更具适应性的方向:机器人能否像生物一样,通过自身第一视角观察学习“我的动作会让我怎么移动”?

作者避免依赖外部动作捕捉和预定义本体模型,把视觉当作机器人自我运动的主要反馈。

这类模型称为 egocentric visual self-model。

方法详解

1. 输入与预测目标

模型输入包括:

  • 连续 5 帧 $128\times128$ 灰度第一视角图像;
  • 一个 12 维电机角度向量。

输出为机器人位姿增量:

$$
(\Delta x,\Delta y,\Delta z,
\Delta roll,\Delta pitch,\Delta yaw).
$$

模型因此学习动作与下一步自身运动之间的映射。

视觉历史可以帮助估计当前运动状态、地面纹理和滑移趋势,而电机角度描述准备执行的身体构型。

2. 网络结构

视觉编码器由 48 层卷积/ResNet 结构和 5 层 LSTM 组成。

动作编码器使用 3 层全连接网络。

视觉与动作特征融合后,再经过 5 层全连接网络预测六维位姿变化。

尽管模型被称为 self-model,它本质上是一个短时程视觉条件的前向动力学模型。

3. 基于模型的动作选择

控制时,系统并行评估 100 个候选动作。

模型预测每个动作会造成的位姿变化,再选择最接近期望移动方向的候选。

在 RTX 3090 上,整个循环以约 5 Hz 运行。

这种“预测候选后果再选择”的结构与世界模型规划高度一致,但动作 horizon 很短,候选也由预设步态机制产生。

4. 训练数据与仿真到真实

PyBullet 中设置 4 种地面纹理域,每个域采集 100k 步,共 400k 步数据。

作者使用视觉增强减小仿真到真实的外观差距。

对新机器人构型,可以冻结视觉编码器,只重新训练后续动力学部分。

新构型只需 200k 步,而初始模型使用 400k 步。

这表明视觉运动表征具有一定跨身体构型迁移能力。

5. 损坏后的在线再学习

论文进一步破坏机器人的一条腿,使原模型失配。

机器人用视觉里程计残差检测行为异常,并在真实环境中进行 motor babbling 采集新数据。

约 30 分钟、7000 步数据后重新训练模型,机器人能够恢复有效移动。

这是论文最引人注目的自适应实验。

实验关键数据

1. 四方向预测误差

论文比较 action-only、IMU 和视觉自模型。

输入方法 前进 后退 向右 向左
Action-only $3.10\times10^{-3}$ $1.90\times10^{-3}$ $2.80\times10^{-3}$ $2.30\times10^{-3}$
IMU $2.40\times10^{-3}$ $1.80\times10^{-3}$ $2.10\times10^{-3}$ $2.20\times10^{-3}$
Ours(rug) $1.90\times10^{-3}$ $1.40\times10^{-3}$ $1.60\times10^{-3}$ $1.50\times10^{-3}$

其他纹理上的视觉模型误差也大致处于 $1.3$–$1.6\times10^{-3}$。

视觉历史优于只看动作或 IMU,说明环境外观与视觉运动信息有助于预测接触动力学。

2. 迁移到 Atlas 构型

模型 三组预测误差
无图像输入 .338 / .461 / .471
视觉自模型 $5.99\times10^{-4}$ / $7.05\times10^{-4}$ / $5.77\times10^{-4}$

视觉信息带来数量级上的改善。

3. Atlas 实际移动结果

控制方法 前进 向右 向左
无图像模型 .406 -.696 1.53
固定 gait .450 .346 .410
视觉自模型 1.27 2.01 1.67

视觉自模型在三个方向的实际位移表现都更好,尤其避免了无图像模型在向右任务中反向移动。

4. 损坏恢复结果

一条腿损坏后,原模型的预测与实际视觉运动出现明显残差。

机器人采集约 7000 个真实步、用时约 30 分钟进行再训练,随后恢复移动能力。

论文以行为曲线和演示支持这一结论,但这种恢复仍依赖受控的 motor babbling 和重新训练流程。

亮点与洞察

1. 第一视角可以成为统一的自我运动反馈

相比为每种身体结构重新定义精确状态,视觉提供了跨构型的共享观察接口。

这对模块化、软体或损坏机器人特别有吸引力。

2. 世界模型首先应预测可验证的后果

论文预测的是六维位姿增量,而不是完整未来图像。

低维结果更容易用于动作选择和误差检测。

这说明世界模型不一定要生成高保真视频;低维、可验证的动力学结果同样可以直接支持控制。

3. 候选动作排序是可落地的规划接口

100 个候选动作并行通过前向模型评估,再选择期望结果最佳者。

这种候选生成—前向预测—目标评分的接口也可推广到其他机器人规划任务。

4. 预测残差可以触发适应或求助

损坏实验表明“模型预期”与“实际观察”的差异可以作为异常信号。

对自适应控制系统而言,较大的结果残差可触发:

  • 重新观察;
  • 停止当前动作;
  • 更新动力学或环境模型。

局限性

1. 任务只覆盖基础移动

论文主要验证前后左右移动,无法说明模型能处理复杂操作、物体接触或多人交互。

2. “自模型”范围有限

模型预测短期位姿变化,不包含身体语义、任务目标、他人状态或长时程因果结构。

名称容易让人误以为它建模了更完整的机器人自我概念。

3. 对纹理和视觉里程计有依赖

弱纹理、光照变化、动态遮挡和镜面地面可能降低视觉运动估计质量。

4. 控制频率较低

5 Hz 对慢速步态可接受,但不适合高动态接触或快速操控。

5. 候选动作来自预设生成器

模型只负责评估,仍依赖 gait generator 提供可执行候选。

复杂任务中的候选覆盖和搜索成本尚未解决。

6. 损坏适应仍需重新采集与训练

30 分钟恢复很有价值,但并不是即时在线适应。

真实任务中 motor babbling 还可能带来安全风险。

相关工作与启发

与 EgoExo-WM 的关系

EgoExo-WM 以人类动作预测人类第一视角未来。

本论文以机器人动作预测机器人第一视角下的自身运动。

两者都使用第一视角建立动作条件预测,但一个建模人体动作,另一个建模机器人自身动力学,不能互相替代。

与人类视频共训练的关系

Co-training Egocentric Video and Robot Demonstrations 说明人类第一视角可以扩展策略覆盖,但必须与机器人示范共同训练。

本论文则强调机器人自身数据对于可执行动力学建模不可替代。

开放研究问题

这篇论文仍留下几个直接问题:

  1. 六维位姿增量预测能否扩展到物体操作与丰富接触;
  2. 在弱纹理和动态遮挡下,视觉自模型如何保持稳定;
  3. 5 Hz 推理频率能否满足更快速的控制任务;
  4. 能否在不进行危险 motor babbling 的情况下完成损坏后适应;
  5. 候选动作来自固定 gait generator 时,模型对真正未见动作的外推能力如何。

评分

维度 评分 说明
问题重要性 8.5/10 身体变化与损坏适应是长期自主机器人的关键问题
方法新颖性 8.0/10 用第一视角作为跨构型自模型输入,思想鲜明
实验可信度 8.0/10 包含仿真、真实、构型迁移和损坏恢复多组实验
可复现性 7.0/10 网络和数据规模明确,但完整控制管线较复杂
研究启发性 9.0/10 为视觉动力学、候选排序和预测残差提供清晰范式

综合评分:8.1/10。

这篇论文最值得继承的不是“视觉自模型”这个名称,而是以低维、可验证的动作后果支持候选选择与异常检测的研究方式。

来源与相关论文