VLA 中间表示全景

从 VLM 语义理解到 Action 生成:哪些中间表示真的在加强关联?

结论
分类
论文群览
有效模式
课题定位
风险
来源说明:本页基于本地已分析论文网页与课题讨论整理,重点覆盖 LAP、LA4VLA、Qwen-RobotManip、G0.5、VP-VLA、TraceVLA、ProgressVLA、Bridge-WA、MaskWAM、ImageWAM、DiT4DiT、OASIS、PoseVLA、PosA-VLA、SwiftVLA、VLS、DynaGuide、VERA、Goal-VLA、VoxPoser、SayCan、SuSIE 等方向。目标是群览“中间表示”这条研究脉络,不替代单篇论文精读。

核心判断

构建中间表示确实可以加强 VLM 和 action 之间的关联。这不是一个孤立想法,而是近两年 VLA、机器人世界模型、VLM-guided manipulation 论文里反复出现的主线。

但有效的中间表示必须更接近动作生成需要的变量。它不能只是“解释图像”或“回答 VQA”,而要能进入 action loss、action head、diffusion/flow guidance、reranking 或 policy rollout。

为什么 VLM 到 Action 之间需要中间表示?

VLM hidden state
语义强
缺口
空间/阶段/对象/后果
中间表示
可行动变量
Action head
连续控制

VLM 表征通常擅长回答“图里有什么、语言是什么意思”。动作头需要的是“该动哪个物体、相对谁、朝哪里、现在处于什么阶段、这段动作会不会让世界变对”。中间表示的价值就在于把语义压缩成动作可用的控制变量。

对当前实习生课题的收敛

大方向可以叫:VLA 的中间表示探索。具体切入建议叫:基于物体角色理解的 VLA 动作生成

本课题不是泛泛研究所有中间表示,
而是验证“物体角色理解”能否作为 VLM 语义理解与 action 生成之间的有效中间表示。

物体角色包括:
target      目标物体
anchor      参照物 / 容器 / 放置基准
relation    inside / on / left-of / upper-left 等空间关系
distractor  无关干扰物
stage       approach / grasp / transport / release

中间表示分类

类别中间表示回答的问题进入 action 的方式典型论文
语言动作language-action / atomic action text低层动作如何转成 VLM 熟悉的语言分布?预训练、action token、language-action supervisionLAP, LA4VLA
角色语义target / anchor / relation / stage / action hint指令里的哪个对象和关系应该控制动作?VQA auxiliary、structured fields、adapter、role bottleneckQwen-RobotManip, G0.5, Robo2VLM, CAST 相关方向
视觉提示bbox / crosshair / point / mask prompt目标在哪里,低层策略应该看哪里?把提示画进图像或作为条件 tokenVP-VLA, Goal-VLA, SuSIE, VoxPoser
视觉轨迹visual trace / point track / projected trajectory物体或末端刚才怎么运动,接下来应该往哪走?历史轨迹提示、轨迹 token、监督时空感知TraceVLA, VERA, SwiftVLA
几何位姿SE(3) trajectory / pose token / pose anchor图像空间如何对齐机器人动作空间?轨迹预测辅助 loss、pose token pretraining、attention anchorOASIS, PoseVLA, PosA-VLA
任务进度progress score / stage score动作是否让任务更接近完成?diffusion guidance、progress loss、采样梯度ProgressVLA, VLS 类 progress/guidance 方法
世界变化future mask / change map / motion flow / world-change tokens动作会让世界哪里变、怎么变?world model latent、future mask loss、action transformer 条件MaskWAM, Bridge-WA, DynaGuide
动态 latentvideo hidden feature / image-editing KV / dynamics latent不解码未来图像,能否用隐表示指导动作?Video/Image model hidden states 条件化 action DiT/flowDiT4DiT, ImageWAM, DynaGuide
可行性/价值图affordance map / value map / skill feasibility哪个技能或位置可执行、成功概率更高?planner + policy selection,value map,skill routingSayCan, VoxPoser, VLS, OmniGuide

论文群览:中间表示如何连接 VLM 与 Action

论文/系统中间表示它连接了什么数据/监督来源怎么影响 action对当前课题的启发
LAPNatural language action连续低层动作 ↔ VLM 语言分布把 robot action chunk 转写为自然语言动作language-action pretraining / action learning证明“动作表示语言化”有效,但正样本方向已被占据。
LA4VLAAtomic language-action segments轨迹片段 ↔ 语言动作先验DROID trajectory 切分与 language-action 描述LA-only / LA-to-VLA / mixed pretraining说明数据构造要服务训练范式,不是只造数据。
Qwen-RobotManipVQA / reasoning / alignment fieldsVLM 语义推理 ↔ 操作阶段和动作监督大规模数据清洗、VQA、行为/运动/表征对齐co-training 与数据过滤,提高 OOD 操作普通 VQA 不够,要让 VQA 信息能影响动作。
G0.5Subtask / Stage / ActionHint 等结构化字段长程指令 ↔ 可执行阶段和动作提示结构化任务字段、长程家务任务统一自回归 VLA 条件化可借鉴字段设计,但不能只做 instruction 结构化。
Robo2VLMRobot trajectory QA机器人轨迹 ↔ 可审计问答/诊断trajectory-to-QA主要用于理解与诊断,不一定直接控制可用于生成 role/action QA,但必须接回 action。
CAST / counterfactual labelsCounterfactual instruction labels同一行为/场景 ↔ 不同语言条件反事实重标注增强 instruction following提醒我们不能泛泛说 counterfactual data,必须有动作依赖约束。
VP-VLACrosshair / bbox visual promptSystem-2 VLM grounding ↔ System-1 VLA 控制Qwen3VL planner + SAM3 visual prompt + grounding loss把提示画进图像,让控制器直接读“目标提示”已经被做过;我们要更强调 role 对 action 的绑定。
TraceVLA2D visual trace历史运动轨迹 ↔ 当前动作决策CoTracker 轨迹,历史帧 visual trace作为视觉提示输入 OpenVLA2D 轨迹提示已占位,不要只做“画轨迹”。
ProgressVLAProgress score / progress gradient视觉状态 ↔ 任务完成度 ↔ diffusion actionDINOv2 progress estimator + action-conditioned world modelclassifier guidance 注入 diffusion policy 采样单标量 progress 已有强工作;role 表示应更结构化。
Bridge-WAFuture tokens / change map / motion-flow map当前观测 ↔ 未来世界变化 ↔ action transformer大 world-change teacher 蒸馏future tokens 与 map 分层注入 WorldBridge“哪里变/怎么变”已被占据;我们要聚焦语言角色依赖。
MaskWAMFuture mask / object-centric mask prompt物体 mask ↔ 未来物体变化 ↔ actionmask prompt 与未来 mask predictionmask 既是输入提示又是未来监督说明 object-centric 表示很强;我们的 role 表示可建立在 object tokens 上。
ImageWAMImage-editing KV / hidden cache图像编辑动态 latent ↔ action expert图像编辑模型隐表示推理取 KV/cache,不解码未来图中间 latent 比最终图像更适合动作。
DiT4DiTVideo DiT hidden feature视频动态去噪表征 ↔ Action DiTdual flow matching / tri-timestep用 Video DiT 中间 hidden 条件化 Action DiT支持“中间生成表征比重建帧更有用”的判断。
DynaGuideDynamics latent / action-conditioned guidance候选动作 ↔ 动态后果 ↔ guidanceaction-conditioned dynamics model推理时 latent guidanceaction-conditioned guidance 已常见,不宜作为唯一创新。
VLSVerifier / guidance score候选动作 ↔ 任务/语言一致性VLM/VLS 打分与 guidance推理时修正/选择 action仅做 scorer/reranker 容易撞车。
OmniGuide3D energy / guidance field语言目标 ↔ 3D 引导能量 ↔ action3D/空间目标与能量函数推理时 action-space guidance如果转 3D energy,会进入已有强竞争区。
VERAVisual error + Jacobian / inverse dynamics目标视觉误差 ↔ 动作求解视频/视觉误差与动作模型类似 IBVS:误差 + 动作映射强调“误差表征”可以连接视觉和动作,但不是 role 语义。
OASISCamera-frame SE(3) trajectory视觉观察 ↔ 末端轨迹 ↔ 动作空间SE(3) 轨迹预测辅助监督轨迹中间表示对齐 action decoder几何中间表示路线很强,但依赖 depth/pose 假设。
PoseVLAPose tokens / 3D grounding tokens非机器人 3D 数据 ↔ robot trajectory/actionOmni3D/BOP/Agibot/InternData-A1 等 3D 与轨迹数据pose-centric pretraining + action expert证明中间表示可把非机器人数据迁移到控制。
PosA-VLAPose-conditioned anchor attention末端 pose ↔ 图像 attention ↔ actionEE pose 投影成 task/end-effector anchor mapattention loss + flow matching action loss“pose anchor attention”已占位;我们的 role 表示应避开 pose anchor 主张。
SwiftVLA4D spatiotemporal feature / distilled temporal feature时空视觉知识 ↔ 轻量 VLA action4D geometry transformer + mask-and-reconstruct distillation训练时引入 4D,推理时丢弃说明中间表示也可作为训练期蒸馏信号。
Goal-VLAGoal image / subgoal representation语言目标 ↔ 可视化目标状态 ↔ actionVLM/生成模型产生目标图或子目标用 subgoal/goal image 指导策略目标图像路线已存在,role 表示要强调对象角色而非整图目标。
SuSIESubgoal image高层语言 ↔ 视觉子目标 ↔ 低层策略图像编辑/目标图生成策略追踪生成的子目标证明视觉目标是强接口,但不直接解决 target/anchor 依赖。
VoxPoser3D value map / affordance field语言约束 ↔ 3D 空间可执行目标LLM/VLM 生成 affordance/value maps规划器在 value map 上求解动作空间价值图很强,但偏 3D planning,和 VLA co-training 不同。
SayCanSkill feasibility / value语言任务 ↔ 技能选择 ↔ 可执行性LLM 概率 + affordance value选择技能序列,不直接预测连续动作早期证明“语义可行性”需要接机器人可执行性。
SpatialVLA / CoT-VLA / WorldVLAspatial reasoning / CoT / world knowledge fields语义推理 ↔ VLA action空间推理、CoT、世界知识监督增强 VLA 表征或推理链如果只做 CoT/VQA 容易被归为这一类,必须证明 action 依赖改变。
GR00T / π0 / π0.5 系列VLM prefix + flow/action expert hidden大规模 VLM 表征 ↔ continuous action expert大规模机器人数据和 flow matching action lossprefix 条件化 action expert强 base,但 task language 可能是弱接口;需要显式中间表示增强 steerability。

什么样的中间表示更可能有效?

判据说明反例
动作相关能影响“抓谁、放哪、何时松手、朝哪个方向动”。只回答图里有什么,但不改变 action。
可监督能从现有 benchmark metadata、轨迹、mask、pose、未来帧中自动构造监督。完全依赖人工标注,规模上不去。
可接入 action进入 action loss、action head、adapter、diffusion/flow guidance 或 policy rollout。只训练独立 VQA head 或 offline classifier。
比 heuristic 强需要超过 mask-only、distance heuristic、random augmentation、普通 VQA auxiliary。简单 centroid distance 就能达到同样效果。
能解释失败类型能对应 wrong-object、wrong-region、no-progress、stage mismatch 等。只报告总 success rate,没有机制证据。

常见接入方式

辅助监督
L_action + L_aux
结构化条件
role / pose / progress tokens
动作头调制
adapter / LoRA / FiLM
推理引导
guidance / rerank / value

对实习生课题而言,优先应走“辅助监督 + 轻量 adapter/LoRA + rollout 验证”。只做推理时 rerank 容易撞 VLS/DynaGuide/ProgressVLA;只做 VQA 辅助又容易太弱。

当前课题应如何定位?

推荐标题:

面向动作生成的 VLA 中间表示探索:物体角色理解

更短的内部名称:

基于物体角色理解的 VLA 动作生成
这个题不是泛泛 instruction-following,也不是普通 VQA+VLA co-training。它要验证“物体角色理解”能否作为连接 instruction/image 与 action 的有效中间表示。

物体角色理解作为中间表示

角色含义为什么对 action 重要
target指令要求操作的目标物体决定抓谁、移动谁。
anchor参照物、容器、放置基准决定放哪、相对谁。
relationinside/on/left/right/upper-left 等关系决定目标区域和运动方向。
distractor不应影响动作的干扰物用于约束 action invariance。
stageapproach/grasp/transport/release决定当前动作类型和停止条件。

数据如何服务训练

数据构造方式训练目标必须验证
Role grounding data从 instruction、metadata、mask 中标 target/anchor/relation/distractor。L_role:预测对象角色。角色预测高不够,还要看 action 是否受影响。
Counterfactual intervention data遮挡/替换/移动 target、anchor、distractor;或换 instruction target。L_sensitivity / L_invariance。target/anchor 变化 action 变,distractor 变化 action 稳。
Relation perturbation data改变 target-anchor 相对位置或 left/right/up/down 关系。L_equivariance。空间 OOD、方位 OOD 成功率提升。
Action rollout data记录 base policy 成功/失败、action chunk、mask、stage。L_action 与失败类型分析。wrong-object/wrong-region/no-progress 下降。

训练目标

L = L_action
  + λ1 L_role
  + λ2 L_invariance
  + λ3 L_sensitivity
  + λ4 L_equivariance

核心不是多加一个 VQA loss,而是让这些损失塑形 action 的依赖结构:target/anchor/relation 改变时 action 应变,distractor 改变时 action 不应乱变。

最容易踩的坑

风险为什么危险规避方式
只做 VQA+VLA co-training已有大量类似工作,创新不足。强调 action-sensitive losses 和 rollout 改善。
只做 instruction parser结构化指令不是新贡献。parser 只作为接口,贡献在 action 依赖塑形。
只做 mask / bbox promptVP-VLA、Goal-VLA、SuSIE 已有视觉提示路线。将 mask/object token 用于 role-conditioned action training。
只做 action rerankingVLS、DynaGuide、ProgressVLA 等已有推理引导。优先融入训练,rerank 只能做补充。
只报告 offline accuracy不能证明中间表示加强了 VLM-action 关联。必须做 rollout、action sensitivity、failure reduction。
题目叫 instruction-following范围过大,容易被要求解决所有语言控制问题。收窄为“物体角色理解作为中间表示”。

Go / No-Go

继续条件:角色中间表示进入训练后,action sensitivity / invariance 指标改善,并带来 policy-level rollout 提升。
停止条件:只提升 role/VQA accuracy,不提升 action,不降低 wrong-object/wrong-region,或普通 VQA auxiliary、mask-only baseline 达到同样效果。