Event-Driven Proactive Assistive Manipulation with Grounded Vision-Language Planning

Task: Proactive Assistive Manipulation
Method: Event Monitor, Pre/Post State Change Evidence, ID-Grounded VLM Planning
Venue: arXiv
Year: 2026
Paper: https://arxiv.org/abs/2603.23950
Code: 未公开

一句话总结

这篇论文把协作机器人从“收到请求后规划”推进到“观察到人-物交互事件结束后主动规划”:用事件状态机选取稳定的前/后快照,让 VLM 根据状态变化判断 act 还是 wait,再通过对象 ID 和有限动作原语把语义计划落到可验证执行。

研究背景与动机

领域现状:具身 VLM/LLM 已能把语言指令转换为抓取、放置和导航动作,但高层推理通常仍由显式命令、模糊语言、手势或 gaze request 启动。

现有痛点:请求驱动系统只能回答“用户说了以后做什么”,无法像人类队友一样从动作结果推断下一步是否需要帮助。持续查询 VLM 又容易在手仍移动、物体尚未稳定时基于瞬态画面做错误决策。

核心矛盾:主动协作需要开放语义推理,但开放式 VLM 输出难以直接执行;同时,频繁推理有延迟和成本,过晚推理又会错过自然介入时机。

本文要解决什么?

  1. 在没有当前步骤用户请求时,怎样确定高层规划的触发时机?
  2. 怎样让 VLM 利用“发生了什么变化”,而不是只看一张当前状态图?
  3. 怎样把开放式语义推理约束成机器人可以检查和执行的计划?

切入角度:把一次 human-object interaction 定义为造成持续工作区状态变化的事件,并把事件结束视为自然决策点。

核心 idea 一句话:用事件对齐的 pre/post snapshot 表达状态转移,用 VLM 推断协作目标,再用 ID-grounded symbolic plan 缩小语义到控制的执行鸿沟。

方法详解

整体框架

continuous RGB-D stream
-> optical-flow activity signal
-> pre-event / human-action / post-event state machine
-> stabilized snapshots (I-, I+)
-> post-event instance parsing + local object map
-> VLM: infer goal and output pick/place/wait plan
-> local ID/geometry validation
-> robot execution + outcome verification
-> retry / recovery / return to monitoring

系统明确分成 robot-side local stream 与 cloud VLM stream。持续感知、事件检测、几何回投和安全检查留在本地;只有事件结束时才把紧凑证据送给 VLM。

关键设计

  1. 事件监控与稳定快照选择

    • 功能:从连续视频中找到人类操作的开始与结束,并避免使用运动模糊或中间状态。
    • 核心思路:在工作区计算光流幅值活动信号 $\rho(t)$;持续超过 onset threshold 进入 human-action,持续低于 offset threshold 且满足稳定条件后结束事件。
    • 设计动机:事件完成后的状态比操作过程中的任意帧更接近“人刚刚完成了什么”的证据。
    • 相比已有方法:不是固定时间查询,也不是等待语音/手势请求,而是由可观察状态转移触发。
  2. Post-event object map

    • 功能:把 VLM 需要引用的对象与真实几何执行接口连接起来。
    • 核心思路:用 FastSAM 解析 $I^+$,给每个实例分配整数 ID,并在本地保存 bounding box、mask、2D anchor 与 RGB-D grasp proposal。
    • 设计动机:让 VLM 只说“对象 7”,不直接幻觉像素或机器人坐标。
    • 相比已有方法:语义模型负责关系与目标,本地模块负责 metric grounding。
  3. Event-driven VLM planning

    • 功能:从 $(I^-, I^+)$ 推断任务级目标,决定介入或等待。
    • 核心思路:输出限制为 pick(target_id)place(reference_id, relative_pos, offset_scale)wait
    • 设计动机:开放文本适合解释长尾事件,但不适合直接进入控制器。
    • 相比已有方法:显式把 abstention/wait 设为合法动作,避免所有状态都强制生成操作。
  4. 本地验证与恢复

    • 功能:检查 schema、对象 ID、几何可行性和执行结果。
    • 核心思路:执行后刷新观察,验证预期定性空间关系是否成立;失败时有限重试,再进入 recovery。
    • 设计动机:区分 reasoning failure 与 execution failure,避免把机械臂碰撞算成 VLM 推理错误。
    • 相比已有方法:规划输出不是终点,结果验证才闭合 event loop。

损失函数 / 训练策略

论文不是端到端训练新策略,而是系统集成与推理框架。事件检测使用基于光流的规则状态机,实例解析使用现成 FastSAM,VLM 通过 prompt 和结构化输出契约完成 zero/few-shot planning;抓取、回投和关系验证由本地几何模块实现。

因此其核心证据不是训练损失下降,而是不同触发/观察范式下的实机成功率与失败类型。

实验关键数据

主实验

平台为 Yahboom JetCobot、MyCobot 280、RealSense D435i 和 Jetson Orin 8GB。任务是人类逐步摆放数字与运算符,机器人在没有下一步指令的条件下补全等式,或在无可用答案时等待。

方法 Solvable ESR Solvable RSR Unsolvable ESR/RSR 说明
Proposed 0.95 1.00 0.60 事件对齐的 pre/post evidence
Always-on 0.65 0.75 0.35 0.83 s 窗口,最多 3 次查询
Post-only 0.60 0.75 0.25 只有稳定后状态
Request-driven 0.95 0.95 0.40 给出明确补全指令

ESR 是 execution success rate,RSR 是 reasoning success rate;共 40 次测试,solvable/unsolvable 各 20 次。

消融实验

配置变化 现象 说明
去掉 pre-event Ambiguity 和 place failure 增多 单帧无法确认哪些对象刚发生变化
去掉 event gate pick/place 错误更分散 查询窗口会覆盖瞬态手/物运动
加入显式 request 可解场景接近 proposed 指令能消歧,但不再是主动协作
无解场景 Proposed 仍只有 0.60 VLM 会臆测“整理桌面”等替代意图

关键发现

  • pre/post 状态差是比单张后状态更强的意图证据。
  • 主动协作最难的不是可解场景补动作,而是证据不足时可靠地不行动。
  • 事件触发显著减少 planner calls,但当前实验没有覆盖多人、遮挡或长时并发事件。
  • RSR 与 ESR 必须分开报告,否则机械臂碰撞会掩盖高层判断质量。

亮点与洞察

  • 触发接口是贡献,而非 VLM 名称:论文最可迁移的设计是“何时推理”,不是换一个更大模型。
  • 状态转移比状态本身更接近意图:这一点可以迁移到装配、烹饪、护理与工具传递。
  • ID-grounded plan 是合理工程边界:大模型只做它擅长的语义关系,几何与安全留给确定性系统。
  • wait 需要被当作一等动作:主动系统不仅要提高 true intervention,还要控制 false intervention。

局限性

  • 任务被限制在数字积木与明确算术规则,无法证明开放任务中的 goal inference。
  • 观察只来自单个外部 RGB-D 相机,没有研究不同主体视角的互补可观测性。
  • 事件由全局光流阈值检测,复杂场景中的并发事件、遮挡和相机运动会破坏该假设。
  • 每次只看一对快照,没有长期记忆、个体化社会线索或任务阶段 belief。
  • 无解场景错误表明模型缺少 calibrated uncertainty 与 ask/observe 选项。
  • 后续工作可加入 calibrated uncertainty,并显式比较 act / wait / ask / observe 等不确定性动作,而不是强制 VLM 输出唯一计划。

相关工作与启发

  • **vs Crafting with a Robot Assistant**:本文给出自动 trigger 与执行框架;Crafting 提供自然任务中的 gaze、手占用、任务阶段和共适应变量。
  • **vs LLM-Based HRC**:后者从明确语言命令开始,适合作为 request-driven baseline;本文从状态变化开始。
  • **vs EgoExo-WM**:本文不预测候选动作未来;EgoExo-WM 提供 latent rollout 接口,但仍是单主体 human action。
  • 与结果预测方法的关系:本文只根据事件证据直接选择动作,没有显式预测各候选动作的未来结果,因此两类方法可以在相同事件协议下比较。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 重新定义触发范式,比单纯套用 VLM 更有价值。
  • 实验充分度: ⭐⭐⭐☆☆ 有真实机器人和受控基线,但只有 40 次窄任务测试。
  • 写作质量: ⭐⭐⭐⭐☆ 问题、接口和失败类型清楚。
  • 实用价值: ⭐⭐⭐⭐☆ 事件门控与 ID-grounding 很容易迁移到现有系统。