Bridge-WA — Predicting Where and How the World Changes

Bai et al. 2026 · arXiv:2607.02195 · World-change priors for robotic action

速览
方法
Benchmark/任务
实验结果
与课题关系
自测
来源:PDF 原文核对 + 本地分析文件;本地未找到源码仓库,因此“代码印证”暂标记为未开源/未找到。

一句话

Bridge-WA 把大视频/未来变化模型蒸馏成三个机器人可用的世界变化先验:future tokens 表示意图结果,change map 表示哪里会变,motion-flow map 表示怎么变。推理时不跑大生成模型,而是把这些 compact priors 注入 WorldBridge action transformer。

论文逻辑链

问题:VLA 缺少可执行的世界变化预期
方法:大未来变化 teacher 蒸馏三类先验
注入:多源 attention + 分层条件化
结果:VLABench/RoboTwin/LIBERO-Plus/真机提升

核心结构

组件作用推理时是否需要大模型
Future-change teacher基于 Wan2.2-5B,学习从当前图像/语言预测未来变化否,teacher 被移除
Future tokens Tf抽象目标/预期结果是,compact prior
Change map Mc机器人应该影响的空间区域
Motion-flow map Mo局部位移方向和幅度
WorldBridgeAction transformer,用 multi-source memory 和 spatial-temporal bias 接收三类先验

分层条件化

  • early layers:注入 future tokens,提供任务结果语义。
  • middle layers:注入 change map,提供操作区域偏置。
  • late/action decoding layers:注入 motion-flow map,接近动作输出时提供局部运动方向。

伪代码

priors = distill_teacher(obs, instruction)
Tf, Mc, Mo = priors.future_tokens, priors.change_map, priors.motion_flow
h = encode(obs, instruction)
h = worldbridge_layers_early(h, memory=Tf)
h = worldbridge_layers_mid(h, spatial_bias=Mc)
action = action_decoder(h, flow_bias=Mo)

为什么这些 Benchmark

Benchmark测试内容为什么适合 Bridge-WA
VLABench多任务 VLA 操作,含复杂对象交互和任务成功率/过程指标验证“世界会在哪里/如何变化”的先验能否提升通用操作
RoboTwin2.0仿真双臂/多任务,Easy/Hard 分 split考察复杂多物体、多阶段场景下的泛化
LIBERO-Plus基于 LIBERO 的更难变体/OOD 操作评测验证先验对分布外目标、布局和任务变化是否有用
Dobot 真机真实桌面操作 Easy/Hard检查世界变化先验是否能迁移到真实机器人

主结果

评测Bridge-WA强基线结论
VLABench Table 1 Avg SR52.8π0-Fast(delta chunk) 43.1明显领先
VLABench Table 2Avg IS/PS 71.2 / 64.0不只成功率,过程指标也强
RoboTwin2.0Easy 79.7 / Hard 37.7 / Mean 58.7X-VLA 52.3Hard 仍难,但均值领先
LIBERO-PlusAvg 72.1OpenVLA-OFT 69.6, RIPT-VLA 68.4, π0-Fast 61.6, π0 53.6在较难 OOD 类评测上领先
Dobot 真机Easy 73.6%, Hard 69.1%X-VLA Easy 69.6, Hard 58.0Hard 真机提升明显

消融

变体结果
no-world46.3
Future only47.2
Change only48.4
Flow only45.2
Future+Flow48.6
Layered conditioning50.4

结论:单个先验有用但有限,关键是三类先验与网络层级的匹配。

对 2D-RPF/CAPE 的碰撞风险

Bridge-WA 已经占据“where/how the world changes”的高层叙事。如果我们的工作也说“预测哪里变、怎么变来指导动作”,会被直接比较。
Bridge-WA 已覆盖我们应避免/转向
世界变化先验作为 policy conditioning候选动作的 progress/rejection/reranking,而不是先验注入
change map / flow mapobject-centric relation progress score:是否朝正确关系变化
大 teacher 蒸馏 compact world priorsruntime verification,可插拔,不依赖重训大 VLA

自测

  1. Bridge-WA 的三类 world-change priors 分别是什么?
  2. 为什么 teacher 推理时可以移除?
  3. Change map 和 motion-flow map 的区别是什么?
  4. 它和“动作候选验证”路线的核心差异是什么?