VLA 推理时引导 · OOD 问题全景 · VLMGuide 课题规划

聚焦"已部署 VLA(π0.5)在真实场景的 OOD 失败"——分类、已有解法、以及我们的独特方向 · 2026-06-29 更新(P0 探针后重写)
⚠️ 2026-06-29 重大更新:原"familiarity-bias 注意力劫持"假设已被 P0 探针实验四重证据证伪(要旧物时注意力本就聚焦旧物、未被劫持)。主方向重写为 OOD 指令-grounding 注入:真正病灶是指令无法在 attention 层把视觉注意力路由到 OOD 新物体/新方位的 patch(指令拉不动、注意力退化为近均匀)。下方 PART3/PART4 已同步;详见 P0_探针实验_执行记录.md §9 与竞品主文档 §6.6。

一、VLA 在部署中遇到的 OOD 类型

1.1 真机实际观察(松灵双臂 π0.5,一手数据)

#失败现象失败本质所在层能否推理时引导治
1新旧物体混合时,模型偏向抓见过的旧物体,忽略指令要的新物体Object grounding 断裂 指令指代的新物体没 ground 到对应 patch(P0:指令拉不动新物,非"被旧物抢")感知→动作的注意力/grounding✓ 有戏
2训练没见过的行为(如开抽屉),测试做不出行为先验缺失 动作分布里根本没有该技能动作先验层(真盲区)✗ 治不了
3方位指令("放左边")跟随不了语言-空间 grounding 缺失 训练没有方位映射语言→空间 grounding⚠ 部分可治
4夹爪开合不匹配(小→大物体)数据覆盖不足(二值化可绕过)动作细节

1.2 论文报告的 OOD(文献补充)

OOD 类型来源论文描述
推理-动作执行落差DWYS/SEAL (2026)VLA 的文字 plan 100% 正确,但动作没执行对 plan
视觉干扰(背景/干扰物/换本体)ARRO (2026)像素层 mask 即可解决,无需进 VLA 内部
空间/几何偏移VLS/OmniGuide (2026)位置偏移/障碍物/视角变化,在动作空间加梯度可解
语义-可供性 OODDynaGuide (2025)新物体/新场景的行为选择,动态模型梯度引导
行为组合/新行为VERA/InSight (2026)需视频世界模型/数据飞轮+retrain,大机构主战场
关键洞察(2026-06-29 修正):四类失败不在同一层——没有万能方法同时治全部。第 2 类(行为先验缺失)是引导类的绝对盲区,第 4 类是数据问题。第 1 类 + 第 3 类是推理时引导能发力、且全竞品空白的区域。P0 探针进一步把这两类的共同病灶定为 指令-视觉 grounding 在 attention 层断裂:第 1 类 = 指令指代的新物体没 ground 到对应 patch;第 3 类 = 指令的空间关系没 ground 到目标区域。统一为 Instruction Grounding Failure(attention 层可观测、可注入修复)。

二、当前解决方案(竞品怎么做引导)

方法引导层引导信号解决哪类 OOD真机边界/没做什么
DynaGuide
2025 Stanford
动作空间(梯度)独立动态模型梯度分布内行为选择目标人工给定、开环、假设可信
VLS
2026 UW
动作空间(梯度+FK)VLM 写 reward 代码几何/空间无负目标、无可信度收手
OmniGuide
2026 UPenn
动作空间(3D能量梯度)VLM点+3D模型几何/空间恒定开环引导、语义 collapse 为单点
DISCO
2024 NUS
动作分布(投影)VLM 3D keyframe几何/分布固定阈值γ被动、DDPM
DWYS/SEAL
2026 NVIDIA/CMU
动作空间(重采样)VLM 验证执行对齐推理-动作落差✗ 纯仿真依赖 forward rollout oracle、二值丢弃
ARRO
2026 UTN
像素层(mask)Grounding DINO+SAM2视觉干扰目标物体不能 mask,新物体 OOD 够不到
Goal-VLA
2026 NUS
替代 VLA(几何planner)VLM 生成目标图语义(零样本)rigid-grasp 假设,做不了接触丰富任务
LA4VLA
2026 Lin等
训练时(去视觉 LA 预训练)重构数据+预训练范式视觉捷径/方向鲁棒性需重训;自认不解决物体定位/目标选择
VERA
2026 MIT
替代 VLA(14B 视频+Jacobian IDM)视频 rollout + 图像雅可比反解行为泛化(大算力)14B 重型,替代而非引导冻结 VLA
SuSIE/GHIL-Glue
2023-24 Berkeley
目标层(生成+过滤)图像编辑 subgoal语义+低层精度需训低层策略、SuSIE 不检验可达性
共同盲区:竞品分布在动作空间(VLS/OmniGuide/DISCO/DynaGuide 加几何/能量梯度)、行为层(DWYS/SEAL 验证 CoT 忠实度,但依赖 forward rollout、纯仿真)、训练时(LA4VLA 重构数据消除视觉捷径,但需重训、不管目标选择)、或替代 VLA(Goal-VLA/VERA 自搭 pipeline)——没有一篇进入冻结 VLA 内部的注意力/表示层做推理时 grounding 注入。DWYS 的 "plan 说抓 soup、实际抓 cream cheese"(Embodied CoT Faithfulness Gap)正是 grounding 断裂在行为层的体现,与我们 P0 的红 soup 现象同源——但它在行为层验证、我们在 attention 层源头修复。

三、推荐课题

OOD 指令-grounding 注入(Instruction-Grounding Injection for Frozen VLA)

解决的 OOD:第 1 类(指令指代 OOD 新物体抓不到)+ 第 3 类(方位指令跟随不了)——统一为 Instruction Grounding Failure,真机高频、全竞品空白

2026-06-29 重写:原"familiarity-bias steering"经 P0 四重证据证伪(要旧物时注意力本就在旧物上、未被劫持;要新物时是"拉不动"而非"被抢")。新方向打在真正的病灶上。

理由(为什么选这个)

① 真空白
竞品在动作/行为/训练时/或替代 VLA;无人在冻结 VLA 内部注意力层做推理时 grounding 注入
② 病灶已坐实
P0 双口径(image→image / lang→image)证明:指令指 OOD 物时该物 attention 纹丝不动(红物 AOR 0.012 vs 旧物 0.079),grounding 断裂可量化
③ 不 overclaim
诚实解决 grounding 选择层 OOD(第1/3类),不碰行为先验 OOD(第2类,引导盲区+大机构主场)
④ 可视化强
主图=注入前后 attention overlay(指令拉不动新物→注入后落到新物 patch)+ 逐层 AOR + 多指代条形图(P0 已产出)

初步方案(external grounding injection,非 amplification)

观测 I_t + 指令 l → 外部开放词表检测/分割(SAM / OWL-ViT / Grounding-DINO) 定位"指令指代的目标物体/方位区域" → patch 集合 S → 在冻结 π0.5 的有效层窗口注入/抬升 S 的 attention: P0 已定位 = 第 1 次 prefix forward 的 Gemma 第 9–17 层(lang→image 口径) → 修复断裂的指令-grounding,让动作"看到"指令指代的目标 → 验证动作是否真的改对(不能只看 attention 图) 不改 π0.5 权重、不重训、不加动作梯度、training-free 关键:对 OOD 物没有现成指令信号可"放大",必须从外部"注入"

分阶段路线(2026-06-29 重写,由简到复杂)

P0 ✓ 探针:已完成。familiarity-bias 证伪,grounding 断裂坐实
P0.5 ★命门 写回因果验证:注入 attention 能否改变 action(最高优先级)
P1-A object grounding 注入:检测目标→注入→降 wrong-object rate
P0-B/P1-B spatial grounding(第二阶段,object 跑通后)
P4 松灵双臂真机验证

期望效果

维度预期
第 1 类指令指 OOD 新物体场景:注入后正确抓取目标物的成功率 / 降低 wrong-object rate 显著改善
第 3 类方位指令("放左边")执行正确率从接近 0 提升到可用水平(第二阶段,可能用 action-target bias)
对比竞品在 ARRO mask 不了、VLS/OmniGuide 动作空间几何引导不解决的"指令-grounding 断裂"上胜出
成本不重训 VLA,本机 3090 可验证,复用开源检测器 + 冻结 π0.5

预计可发表会议

会议概率前提
CoRL 2027P0.5 写回因果通过 + P1 注入降 wrong-object + P4 真机,且统一框架覆盖第1+3类
RSS 2027同上,且故事讲好(grounding 断裂诊断 + training-free 注入修复)
ICRA 2027中高仿真+简单真机验证即可
RA-LP0 诊断 + 一个注入方法 + 真机验证

下一道 go/no-go:P0.5 写回因果验证——注入 attention 后 action 是否对注入方向有可重复、可解释、非随机的变化。不过则转 feature steering / visual prompt / action-target bias / 轻量 adapter。

四、我们的方案与所有竞品的区别

竞品操作层我们的差异
DynaGuide / VLS / OmniGuide动作空间梯度它们在动作空间加几何/能量 reward;我们在 VLA 内部注意力层注入指令 grounding,正交且更轻
DWYS/SEAL行为层(重采样+验证)它们靠 forward rollout 验证 CoT 忠实度(纯仿真);我们不需 rollout,直接在 attention 层源头修复 grounding
LA4VLA训练时(去视觉预训练)同病不同药:它训练时重构数据+重训、且不管目标选择;我们推理时注入、不重训,正补它放弃的物体/空间 grounding
ARRO像素层 maskARRO mask 任务无关像素;我们注入任务核心目标的 grounding
Goal-VLA / VERA替代 VLA我们保留冻结 VLA 学习先验,轻量注入不替代
SuSIE / GHIL-Glue目标层我们不生成子目标,直接在 VLA 内部注入 grounding(不需训低层策略)
NLP Activation SteeringLLM 内部首次从 NLP 迁移到 VLA/机器人,修复物理 OOD 的指令 grounding 而非 safety 对齐
一句话核心 claim(2026-06-29 重写):VLA 在 OOD 部署场景的失败,根因不是"不认得新物体"、也不是"注意力被熟悉物体劫持"(后者已被 P0 四重证据证伪),而是指令-视觉 grounding 只在训练分布内的指代上有效——一旦指令含 OOD 语义成分(新物体/新颜色/新指代/新方位),指令无法在 attention 层把视觉注意力路由到对应目标,注意力退化为近均匀。我们首次在推理时用外部检测/分割把"指令指代目标"定位到 patch,并在冻结 VLA 内部注意力层 training-free 地注入该先验,修复断裂的指令-grounding。

五、IBVS 思想的保留(方向 B 查证后的转化)

背景:用户有 IBVS 经验,提出"学一个通用的图像误差→运动映射攻行为 OOD"。查证发现 VERA(MIT 14B) 已做了"视频 rollout + Jacobian IDM 反解动作"的合体,正面撞车。但 IBVS 思想可以轻量用在注意力层——
传统 IBVS:δ运动 = J⁺ · (特征_目标 - 特征_当前) → 特征误差驱动运动 用户变体:δ_attention = f(表示_目标物体 - 表示_VLA当前关注) → 表示误差驱动注意力修正 差异:VERA 用 Jacobian 在动作空间反解;我们用误差信号在注意力空间做修正 保留 IBVS 的"误差驱动"核心思想,但作用层从运动→注意力

这是 P3 阶段的探索内容(非必须),主方案 P0-P2 不依赖它。