Task: Robot Dynamics Prediction and Damage Adaptation
Method: Egocentric Visual Self-Model, Action-conditioned Forward Dynamics
Venue: arXiv
Year: 2022(v3, 2024)
Paper: https://arxiv.org/abs/2207.03386
Code: 未公开
一句话总结
论文让机器人用连续五帧第一视角图像和 12 维电机角度预测自身六自由度位姿变化,并用该模型在线评估候选动作;模型能适应不同身体构型,甚至在腿损坏后通过约 30 分钟真实运动数据恢复行走。
研究背景与动机
传统机器人控制依赖人工建立的运动学和动力学模型。
这类模型在结构已知、传感器可靠时非常有效,但面对以下变化会失配:
- 机器人构型改变;
- 地面材质变化;
- 执行器性能衰减;
- 腿或关节损坏;
- 难以精确建模的接触与滑移。
论文研究一个更具适应性的方向:机器人能否像生物一样,通过自身第一视角观察学习“我的动作会让我怎么移动”?
作者避免依赖外部动作捕捉和预定义本体模型,把视觉当作机器人自我运动的主要反馈。
这类模型称为 egocentric visual self-model。
方法详解
1. 输入与预测目标
模型输入包括:
- 连续 5 帧 $128\times128$ 灰度第一视角图像;
- 一个 12 维电机角度向量。
输出为机器人位姿增量:
$$
(\Delta x,\Delta y,\Delta z,
\Delta roll,\Delta pitch,\Delta yaw).
$$
模型因此学习动作与下一步自身运动之间的映射。
视觉历史可以帮助估计当前运动状态、地面纹理和滑移趋势,而电机角度描述准备执行的身体构型。
2. 网络结构
视觉编码器由 48 层卷积/ResNet 结构和 5 层 LSTM 组成。
动作编码器使用 3 层全连接网络。
视觉与动作特征融合后,再经过 5 层全连接网络预测六维位姿变化。
尽管模型被称为 self-model,它本质上是一个短时程视觉条件的前向动力学模型。
3. 基于模型的动作选择
控制时,系统并行评估 100 个候选动作。
模型预测每个动作会造成的位姿变化,再选择最接近期望移动方向的候选。
在 RTX 3090 上,整个循环以约 5 Hz 运行。
这种“预测候选后果再选择”的结构与世界模型规划高度一致,但动作 horizon 很短,候选也由预设步态机制产生。
4. 训练数据与仿真到真实
PyBullet 中设置 4 种地面纹理域,每个域采集 100k 步,共 400k 步数据。
作者使用视觉增强减小仿真到真实的外观差距。
对新机器人构型,可以冻结视觉编码器,只重新训练后续动力学部分。
新构型只需 200k 步,而初始模型使用 400k 步。
这表明视觉运动表征具有一定跨身体构型迁移能力。
5. 损坏后的在线再学习
论文进一步破坏机器人的一条腿,使原模型失配。
机器人用视觉里程计残差检测行为异常,并在真实环境中进行 motor babbling 采集新数据。
约 30 分钟、7000 步数据后重新训练模型,机器人能够恢复有效移动。
这是论文最引人注目的自适应实验。
实验关键数据
1. 四方向预测误差
论文比较 action-only、IMU 和视觉自模型。
| 输入方法 | 前进 | 后退 | 向右 | 向左 |
|---|---|---|---|---|
| Action-only | $3.10\times10^{-3}$ | $1.90\times10^{-3}$ | $2.80\times10^{-3}$ | $2.30\times10^{-3}$ |
| IMU | $2.40\times10^{-3}$ | $1.80\times10^{-3}$ | $2.10\times10^{-3}$ | $2.20\times10^{-3}$ |
| Ours(rug) | $1.90\times10^{-3}$ | $1.40\times10^{-3}$ | $1.60\times10^{-3}$ | $1.50\times10^{-3}$ |
其他纹理上的视觉模型误差也大致处于 $1.3$–$1.6\times10^{-3}$。
视觉历史优于只看动作或 IMU,说明环境外观与视觉运动信息有助于预测接触动力学。
2. 迁移到 Atlas 构型
| 模型 | 三组预测误差 |
|---|---|
| 无图像输入 | .338 / .461 / .471 |
| 视觉自模型 | $5.99\times10^{-4}$ / $7.05\times10^{-4}$ / $5.77\times10^{-4}$ |
视觉信息带来数量级上的改善。
3. Atlas 实际移动结果
| 控制方法 | 前进 | 向右 | 向左 |
|---|---|---|---|
| 无图像模型 | .406 | -.696 | 1.53 |
| 固定 gait | .450 | .346 | .410 |
| 视觉自模型 | 1.27 | 2.01 | 1.67 |
视觉自模型在三个方向的实际位移表现都更好,尤其避免了无图像模型在向右任务中反向移动。
4. 损坏恢复结果
一条腿损坏后,原模型的预测与实际视觉运动出现明显残差。
机器人采集约 7000 个真实步、用时约 30 分钟进行再训练,随后恢复移动能力。
论文以行为曲线和演示支持这一结论,但这种恢复仍依赖受控的 motor babbling 和重新训练流程。
亮点与洞察
1. 第一视角可以成为统一的自我运动反馈
相比为每种身体结构重新定义精确状态,视觉提供了跨构型的共享观察接口。
这对模块化、软体或损坏机器人特别有吸引力。
2. 世界模型首先应预测可验证的后果
论文预测的是六维位姿增量,而不是完整未来图像。
低维结果更容易用于动作选择和误差检测。
这说明世界模型不一定要生成高保真视频;低维、可验证的动力学结果同样可以直接支持控制。
3. 候选动作排序是可落地的规划接口
100 个候选动作并行通过前向模型评估,再选择期望结果最佳者。
这种候选生成—前向预测—目标评分的接口也可推广到其他机器人规划任务。
4. 预测残差可以触发适应或求助
损坏实验表明“模型预期”与“实际观察”的差异可以作为异常信号。
对自适应控制系统而言,较大的结果残差可触发:
- 重新观察;
- 停止当前动作;
- 更新动力学或环境模型。
局限性
1. 任务只覆盖基础移动
论文主要验证前后左右移动,无法说明模型能处理复杂操作、物体接触或多人交互。
2. “自模型”范围有限
模型预测短期位姿变化,不包含身体语义、任务目标、他人状态或长时程因果结构。
名称容易让人误以为它建模了更完整的机器人自我概念。
3. 对纹理和视觉里程计有依赖
弱纹理、光照变化、动态遮挡和镜面地面可能降低视觉运动估计质量。
4. 控制频率较低
5 Hz 对慢速步态可接受,但不适合高动态接触或快速操控。
5. 候选动作来自预设生成器
模型只负责评估,仍依赖 gait generator 提供可执行候选。
复杂任务中的候选覆盖和搜索成本尚未解决。
6. 损坏适应仍需重新采集与训练
30 分钟恢复很有价值,但并不是即时在线适应。
真实任务中 motor babbling 还可能带来安全风险。
相关工作与启发
与 EgoExo-WM 的关系
EgoExo-WM 以人类动作预测人类第一视角未来。
本论文以机器人动作预测机器人第一视角下的自身运动。
两者都使用第一视角建立动作条件预测,但一个建模人体动作,另一个建模机器人自身动力学,不能互相替代。
与人类视频共训练的关系
Co-training Egocentric Video and Robot Demonstrations 说明人类第一视角可以扩展策略覆盖,但必须与机器人示范共同训练。
本论文则强调机器人自身数据对于可执行动力学建模不可替代。
开放研究问题
这篇论文仍留下几个直接问题:
- 六维位姿增量预测能否扩展到物体操作与丰富接触;
- 在弱纹理和动态遮挡下,视觉自模型如何保持稳定;
- 5 Hz 推理频率能否满足更快速的控制任务;
- 能否在不进行危险 motor babbling 的情况下完成损坏后适应;
- 候选动作来自固定 gait generator 时,模型对真正未见动作的外推能力如何。
评分
| 维度 | 评分 | 说明 |
|---|---|---|
| 问题重要性 | 8.5/10 | 身体变化与损坏适应是长期自主机器人的关键问题 |
| 方法新颖性 | 8.0/10 | 用第一视角作为跨构型自模型输入,思想鲜明 |
| 实验可信度 | 8.0/10 | 包含仿真、真实、构型迁移和损坏恢复多组实验 |
| 可复现性 | 7.0/10 | 网络和数据规模明确,但完整控制管线较复杂 |
| 研究启发性 | 9.0/10 | 为视觉动力学、候选排序和预测残差提供清晰范式 |
综合评分:8.1/10。
这篇论文最值得继承的不是“视觉自模型”这个名称,而是以低维、可验证的动作后果支持候选选择与异常检测的研究方式。
来源与相关论文
- 原论文:Egocentric Visual Self-Modeling for Robot Dynamics
- 人体第一视角动作条件世界模型:EgoExo-WM
- 人类第一视角与机器人示范共训练:Co-training Egocentric Video and Robot Demonstrations