EgoExo-WM:将外部视角人类视频转化为第一视角世界模型训练数据

Task: Action-conditioned Egocentric Future Prediction and Planning
Method: EgoX-Body View Conversion, DINOv3 Latent World Model, Candidate Ranking
Venue: arXiv
Year: 2026
Paper: https://arxiv.org/abs/2605.15477
Code: 未公开

一句话总结

EgoExo-WM 先把大量外部视角人类视频转换成近似第一视角视频,再与真实第一视角数据共同训练动作条件潜空间世界模型;在四个数据集上,它稳定改善未来表征和手腕位置预测,并能为人类动作规划候选排序。

研究背景与动机

第一视角世界模型需要学习“给定当前观察和动作,接下来会看到什么”。

这种模型有望服务于:

  • 人类动作预测;
  • 具身规划;
  • 目标条件行为选择;
  • 从人的视角理解交互过程。

瓶颈是带有人体动作标注的第一视角视频很少,而公开视频大多是第三人称或外部视角。

直接把外部视角视频加入训练会造成严重域差异:

  • 相机位置与运动规律不同;
  • 第一视角看不到完整身体,外部视角通常能看到;
  • 手、物体和背景的尺度与遮挡不同;
  • 相同动作在两种视角中呈现完全不同。

论文提出先做视角转换,再进行统一的世界模型训练。

它试图回答:少量经过转换的外部视角视频,能否在固定训练预算下改善第一视角动作条件未来预测?

方法详解

1. 动作表示

每个时间步的人体动作是 69 维:

  • 根节点平移增量;
  • 22 个人体关节的 Euler 旋转。

这个动作空间描述人体全身运动,而不是机器人控制命令。

因此论文学习的是人类视角下的人体动作动力学先验,不能直接当成机器人交互世界模型。

2. 潜空间动作条件世界模型

视觉编码器采用 DINOv3-L,将图像映射到潜表征。

世界模型预测下一时刻表征:

$$
\hat z_{t+1}=f(z_{t-H+1:t}, a_t).
$$

模型在给定历史视觉表征和当前人体动作时,预测动作执行后的未来视觉状态。

训练损失包含两部分:

  1. 预测潜表征与真实未来表征之间的 $L_2$ 损失;
  2. 手腕热图一致性损失。

两项权重设置为 $\lambda=1$。

手腕损失把训练重点部分转向人与环境交互最相关的肢体位置,而非只匹配全局语义。

3. EgoX-Body 视角转换

论文提出 EgoX-Body,把外部视角视频转换为近似第一视角训练样本。

主要步骤包括:

  1. 用 SAM-Body4D 恢复人体姿态;
  2. 用 ViPE 重建四维场景;
  3. 在外部视角视频上叠加人体骨架条件;
  4. 构造头部锚定的第一视角相机先验;
  5. 加入手部 overlay,缓解生成结果中手部缺失;
  6. 使用视频扩散模型生成第一视角视频。

这个管线不是几何上严格的视角重投影,而是几何条件与生成模型结合的域转换。

4. 世界模型架构

世界模型使用 CDiT-L/2:

  • 24 层;
  • 隐藏维度 1024;
  • 16 个注意力头。

训练使用 8 张 A40 GPU,迭代 100k 次。

评估 horizon 为 2 秒,以 4 Hz 采样 8 帧。

这说明方法计算成本较高,而且仍局限于短时程预测。

5. 固定预算的数据设计

所有训练条件保持 200 小时视频预算:

  • Ego-WM:200 小时真实第一视角 Nymeria;
  • Naive EgoExo-WM:190 小时真实第一视角 + 10 小时原始外部视角;
  • EgoExo-WM:190 小时真实第一视角 + 10 小时转换后的第一视角。

外部视角视频来自 HowTo100M、CrossTask 和 100 Days of Hands。

固定总小时数是实验的重要优点:它避免把提升简单归因于更多训练视频。

实验关键数据

1. 评估数据与指标

测试覆盖:

  • HOMAGE:150 个样本;
  • LEMMA:150 个样本;
  • EgoExo4D Bike:125 个样本;
  • EgoExo4D Cooking:125 个样本。

指标为:

  • DINOv3 潜表征 $L_2$,越低越好;
  • wrist PCK@20,越高越好。

2. 世界模型预测结果

数据集 Ego-WM $L_2$ / PCK EgoExo-WM $L_2$ / PCK
HOMAGE .058 / .396 .047 / .531
LEMMA .055 / .527 .045 / .618
EgoExo4D Bike .042 / .561 .040 / .603
EgoExo4D Cooking .053 / .459 .052 / .515

完整方法在四个数据集上均改善平均指标。

HOMAGE 和 LEMMA 的增益较大,Bike 和 Cooking 的 $L_2$ 改善较小,但手腕 PCK 仍然提升。

论文还报告部分 2 秒 horizon 的结果非常接近,例如 Bike 上完整模型约 .049,Ego-WM 约 .050。

这表明长一点的短期预测仍然困难,不能只看平均值宣称显著优势。

3. 用世界模型进行人类动作规划

规划实验使用 UniEgoMotion 采样 4 个候选动作序列,horizon 为 8。

世界模型预测每个候选的最终潜状态,并选择与目标图像潜表征最近的候选。

指标是 MPJPE,数值越低越好。

数据集 无 WM Ego-WM EgoExo-WM
HOMAGE .404 / .471 .383 / .447 .362 / .421
LEMMA .444 / .493 .414 / .455 .396 / .438
Bike .292 / .367 .267 / .341 .245 / .320
Cooking .533 / .580 .519 / .568 .498 / .549

每格是论文报告的两组 MPJPE 条件,完整模型在所有数据集上均最低。

这支持世界模型不仅改善表征预测,也能作为候选动作的结果评估器。

4. 实验能支持到哪里

实验支持“经过视角转换的外部视频能在固定预算下改善第一视角人体未来预测”。

它不直接支持:

  • 对机器人动作后果的预测;
  • 对人机交互联合未来的预测;
  • 接触状态、物体状态和任务成功的准确预测;
  • 长时程开放世界规划。

亮点与洞察

1. 固定数据预算使跨视角贡献更可信

190+10 小时与 200 小时的比较比简单追加数据更严谨。

固定总训练时长使该实验能更可信地归因于视角转换,而不是额外数据量。

2. 视角转换优于生硬混合

Naive 直接混合外部视角无法充分利用数据,而 EgoX-Body 先把它转换到目标观察空间。

这说明跨视角信息需要明确的结构对齐。

3. 世界模型的价值体现在候选排序

论文没有让世界模型直接生成动作,而是用它预测候选动作的未来结果并进行选择。

这是一个通用的基于模型候选排序设计:

  • 上游策略生成若干人体动作候选;
  • 世界模型预测每个候选对应的未来潜状态;
  • 再选择最接近视觉目标的动作序列。

4. 与交互相关的局部监督很重要

手腕 PCK 损失说明只优化全局视觉潜空间不足以确保交互部位准确。

对人类交互动作预测,可进一步把监督放在:

  • 手—物接触;
  • 对象状态转移;
  • 人的可达性与手部占用。

局限性

1. 只预测人类,不预测机器人—人联合动态

动作空间是人体全身运动,没有机器人动作和机器人观察。

因此它是单主体人体动力学模型,不能据此声称已经建模多主体交互未来。

2. horizon 只有 2 秒

短时预测可以帮助局部候选排序,但无法覆盖长程任务分解和多阶段协作。

3. 生成式视角转换存在系统误差

遮挡、接触、小物体和手指细节都可能在转换中丢失或被幻觉补全。

如果错误具有系统性,世界模型会学习到虚假的交互规律。

4. 单人场景为主

论文没有建模另一主体的动作反应,因而缺少协作中的相互影响。

5. 规划候选数量有限

只从 4 个候选中选择,难以说明在更大动作空间中的搜索效率和校准程度。

6. 计算成本较高

8 张 A40 与大型扩散/Transformer 管线使复现和部署成本较高。

相关工作与启发

与人类视频共训练导航的关系

Co-training Egocentric Video and Robot Demonstrations 把第一视角视频转换为运动意图标签。

EgoExo-WM 把外部视频转换为第一视角未来预测样本。

两者共同说明:跨域人类视频只有通过目标任务需要的中间表示,才可能对机器人学习有用。

与机器人自模型的关系

Egocentric Visual Self-Modeling 学习机器人动作导致的自身视觉变化。

EgoExo-WM 学习人体动作导致的人类第一视角变化。

两篇论文分别研究人类动作与机器人动作的单体后果;它们的动作空间、观察空间和评价指标并不兼容,不能直接合并结论。

可推广的研究问题

论文的结果表明,潜空间预测可以不生成完整 RGB 视频,也能用于候选人体动作排序。

仍需进一步回答:

  1. 手腕 PCK 的提升是否会稳定转化为真实接触成功率;
  2. 当候选从 4 个扩展到更大动作空间时,世界模型排序是否仍可靠;
  3. 预测 horizon 超过 2 秒后,误差如何累积;
  4. 生成式视角转换中的手部和小物体错误会怎样影响下游规划;
  5. 潜空间距离是否与人类动作的物理可行性一致。

评分

维度 评分 说明
问题重要性 9.0/10 第一视角数据稀缺是具身世界模型的核心瓶颈
方法新颖性 8.5/10 几何人体条件与视频扩散结合的视角转换有明确新意
实验可信度 8.0/10 固定预算、多数据集、预测与规划两类实验较完整
可复现性 6.5/10 管线复杂、计算成本高,依赖多个大型模型
研究启发性 9.0/10 为动作条件潜空间预测和候选排序提供完整证据

综合评分:8.2/10。

这篇论文对动作条件第一视角世界模型给出了较完整的预测与规划证据,但结论严格限于人体单主体和约 2 秒的短期未来。

来源与相关论文