Unlocking Spatiotemporal Dynamics for Lightweight VLA Models at Minimal Overhead · GigaAI / 北大 / 清华 / Moxin · arXiv 2512.00903 (2025)
大 VLM 撑的 VLA 又慢又占显存;换小 VLM 又丢时空推理。SwiftVLA 让轻量模型"训练时补 4D 的课、推理时轻装上阵":用一个冻结的 4D 视觉几何 Transformer 从纯 RGB 增量提取带时间的几何特征,用 mask-and-reconstruct 把 4D 知识蒸馏进 0.45B 小模型,推理时把整条 4D 分支删掉几乎无损——在 Jetson Orin 上比 π0 快 18×、省显存 12×。
| 项 | 内容 |
|---|---|
| 单位 | GigaAI / 北京大学 / 清华大学 / Moxin(湖州) / X-Humanoid |
| 核心思想 | 训练期注入 4D 时空 + mask-and-reconstruct 蒸馏,推理期丢弃 4D 分支 |
| 骨干 | SmolVLM-0.5B(SmolVLA 骨干),全模型 ~450M(其中 ~100M action expert) |
| 三大机制 | ① 冻结 4D 几何 Transformer + FIFO 时序缓存 ② Fusion Tokens + 未来轨迹监督 ③ mask-and-reconstruct |
| 关键结果 | RoboTwin 2.0 SR 0.53(π0 0.47/SmolVLA 0.29,+82.76%) · LIBERO 94.7(π0 94.1) · 真机 0.80(π0 0.61) |
| 边缘效率 | Jetson Orin:0.167s / 1398MB / SR 0.76 vs π0:2.966s / 16236MB / SR 0.48 |
| 动作头 | 条件扩散(噪声预测, Eq.8),非 Flow Matching / 非明确 DiT |
VLA 用大 VLM 把语言+视觉直接映射到动作,但基础 VLM 参数巨大 → 高延迟、高显存,边缘设备扛不住实时控制。换小 VLM 又会丢失时空推理能力——论文 Fig. 1 里 SmolVLM-0.5B 连"最左边的碗是什么颜色"都答错(答 white,实际 pale blue),导致定位不准、抓取失败。
| 方案 | 代表 | 痛点 |
|---|---|---|
| 纯 2D 轻量(Fig.2a) | SmolVLA | 压缩 VLM/限 token/跳层,快但时空推理弱、SR 低 |
| 直接融合(Fig.2b) | 3D-VLA / SpatialVLA / Evo-0 | 3D 特征直接注入 VLM,需更大 VLM 才能对齐,且缺时序 |
| 解耦分支(Fig.2c) | PointVLA / GeoVLA | 独立空间分支处理点云,参数开销大,不适合紧凑模型,忽视时序 |
| 时序增强 | 4D-VLA | 历史相似度关键帧采样,多帧采样增加推理开销 |
冻结的 4D 视觉几何 Transformer 从纯 2D 图像增量导出时序增强的 4D 特征——不需要深度相机/LiDAR。每视角观测先编码 Fe=Encoder(o),再送入时空解码器交替做空间注意力与时序注意力;时序阶段当前特征通过 cross-attention 与 temporal cache 交互:
缓存采 FIFO 只保留最近 K 帧。进 VLM 的:F2D=三视角全用,F4D=只用 front 视角;left/right 的 4D 只用于更新缓存(省训练成本)。
其中 L2D/L4D 是被掩码特征的重建损失(Eq.7),Laction=扩散噪声预测(Eq.8),Ltraj=末端未来轨迹 L2 监督(Eq.6)。各 λ 具体数值论文未公开。
冻结的预训练 4D 视觉几何 Transformer(论文引 [86],正文提到 Evo-0 用 VGGT 类模型) + FIFO temporal cache。关键价值:4D 线索直接从标准 RGB 增量提取,零额外传感器。缓存长度 K 训练时用随机 K∈{3,4,5,6} 效果最好(暴露于可变时序视野增强适应性)。
小模型难以自行把 2D/4D 融进连贯的 3D 意识潜空间。作者引入一组可学习 token Qf,通过 VLM 内部 cross-attention 与多模态序列(2D/4D 特征、语言、状态)交互,产出统一表征 Zf(Eq.1)。关键:Fusion Tokens 的输出被机械臂末端未来轨迹显式监督:
用"接下来手要走的轨迹"当老师,使融合表征与时空语义对齐——是一种任务相关、动作感知的对齐信号。
训练时以一定概率随机对 2D 或 4D 特征施加掩码,此时 VLA 需基于剩余模态预测动作,同时重建被掩码的特征:
这迫使模型学到全面的、几何感知的 4D 表征,并把 4D 知识蒸馏进权重——即使推理时没有显式 4D 输入,也能隐式重建/推理 4D 结构。
| Benchmark | SwiftVLA(0.45B) | π0(3.3B) | SmolVLA | 备注 |
|---|---|---|---|---|
| RoboTwin 2.0 平均 SR | 0.53(with 4D 0.55) | 0.47 | 0.29 | 比 SmolVLA +82.76%;~15% π0 参数 |
| LIBERO 平均 | 94.7(with 4D 95.1) | 94.1 | — | 媲美 3B π0/GR00T-N1(93.9),近 7B OpenVLA-OFT(97.1) |
| 真机平均 SR | 0.80(with 4D 0.82) | 0.61 | 0.34 | Clean 0.86 / Throw 0.80 / Stack 0.74 |
| Fold the Cloth(附录) | 0.60(with 4D 0.65) | 0.45 | 0.05 | 可变形物体+长程凸显 4D 优势 |
| 模型 | 推理时间 | 显存 | SR |
|---|---|---|---|
| SwiftVLA | 0.167 s | 1398.4 MB | 0.76 |
| π0 | 2.966 s | 16236.2 MB | 0.48 |
| SmolVLA | 0.166 s | 1397.5 MB | 0.30 |
比 π0 快约 18×、省显存约 12×;延迟与 SmolVLA 几乎相同(同骨干),但 SR 高得多(0.76 vs 0.30)——证明性能来自训练策略而非算力堆叠。
两篇都是 2025-2026 的轻量 VLA + 从观测注入几何信息的工作,骨干都是 0.5B 级小 VLM,却走了两条哲学不同的路。
| 维度 | 共同做法 |
|---|---|
| 轻量骨干 | 都用 0.5B 级小 VLM(SwiftVLA=SmolVLM-0.5B;OASIS=Qwen2.5-0.5B) |
| 零额外传感器注入几何 | 都靠冻结的大预训练模型从 RGB 提几何(SwiftVLA=4D 几何 Transformer;OASIS=Depth Anything 3 度量深度),不用深度相机/LiDAR |
| 未来末端轨迹监督 | 两篇都用"机械臂未来 EE 轨迹"作为关键辅助监督去塑造中间表示——这是最惊人的共性 |
| 辅助监督→路由进解码 | 都把被监督的中间隐状态送进动作解码器(SwiftVLA 的 {h_V}、OASIS 的 h_traj) |
| 动作分块 | 都预测 action chunk |
| 免大规模机器人预训练 | 都强调不需要大规模机器人预训练/空间标注;都在 LIBERO + 真机评测 |
| 非 DiT/FM 动作头 | SwiftVLA=条件扩散噪声预测;OASIS=ACT 风格 ℓ1 回归——都不是 Flow Matching |
| 维度 | SwiftVLA | OASIS |
|---|---|---|
| 核心目标 | 效率:推理时丢掉昂贵模态 | 几何对齐:让中间表示对齐动作空间 |
| 辅助模态命运 | 推理时丢弃 4D 分支(mask-and-reconstruct 蒸馏) | 推理时保留深度 + SE(3) 轨迹分支 |
| 中间表示性质 | 融合的 2D/4D token(仍在观测空间,但蒸馏了 4D 知识) | SE(3) 位姿监督的隐状态(显式对齐动作空间) |
| 轨迹监督形式 | 未来 EE 轨迹(L2,监督 Fusion Tokens 做跨模态对齐) | 相机系 SE(3) 轨迹(ℓ1,axis-angle,显式几何,作解码器条件) |
| 核心创新 | mask-and-reconstruct 训练期蒸馏 | 把中间表示对齐到动作空间的 SE(3) 设计原则 |
| 动作头 | 条件扩散(噪声预测) | query-based ACT 风格 ℓ1 回归 |
| 主打卖点 | Jetson Orin 18× 快 / 12× 省显存 | OOD 泛化 90.8% + 数据效率(10 条示教) |
从两篇论文里能直接"偷"到自己工作的模块化技巧:
| Trick | 来源 | 怎么复用 |
|---|---|---|
| 冻结大模型当特征源 | 两篇 | 用现成 4D/深度/几何大模型,参数高效地注入空间先验,不训练它 |
| 未来 EE 轨迹监督中间表示 | 两篇 | 用"接下来手要走的轨迹"塑造隐状态,比重建像素更任务相关 |
| mask-and-reconstruct 蒸馏 | SwiftVLA | 训练喂昂贵模态并要求重建,推理丢弃——省部署成本 |
| 相机系预测规避外参 | OASIS | 把中间量放传感器自身坐标系,省 camera-to-world 标定学习 |
| axis-angle + Rodrigues | OASIS | 回归 SO(3)/SE(3) 时天然落流形,免正交化/事后修正 |
| FIFO 缓存 + 随机缓存长度训练 | SwiftVLA | 时序建模鲁棒性,尤其适合高频触觉信号 |
| 把监督隐状态路由进解码器 | OASIS(AuxTraj 消融) | 辅助分支光并行没用,必须把被监督的隐状态喂进解码器才有增益 |
OASIS 的 SE(3) 轨迹对齐推理时要保留深度+轨迹分支(1.73B 总参)。把 SwiftVLA 的 mask-and-reconstruct 套上去:训练时用 SE(3) 轨迹 + 度量深度对齐中间表示,并要求重建它们;推理时丢掉深度分支和 SE(3) 预测器,只留被蒸馏的动作解码器。目标:拿到 OASIS 的几何精度 + SwiftVLA 的边缘效率。
训练期用高分辨率光学触觉(GelSight)作掩码-重建目标蒸馏进策略,推理期仅用低成本本体/视觉。关键风险(必须实测):4D 能推理时丢弃是因为几何隐含在 RGB 里可重建;但接触力/滑动/材质是视觉不可见的,直接照搬"推理丢触觉"很可能大幅掉点。这本身就是一个值得写的实证问题。
把 OASIS 的"SE(3) 轨迹对齐"换成"接触点 SE(3) 轨迹 / 法向力方向轨迹",监督视触觉策略隐状态并路由进解码器。用在 insertion/装配:把接触几何显式注入策略,可能比隐式学习更省数据。这条与 PACE 的 contact-rich 方向高度相关。
建立一个指标:辅助模态 X 能否被主模态重建/推断——决定它适合"训练用、推理丢"(如 4D)还是"必须保留"(如接触力)。这为 SwiftVLA 范式划定适用边界,是一篇干净的分析型论文。
两篇都用了未来 EE 轨迹。进一步:同时监督视觉 SE(3) 轨迹(何处) + 触觉接触事件时间轴(何时/如何接触),研究跨模态"接触时刻对齐"——接触瞬间正是纯视觉几何最不可靠、触觉最有信息的时刻。