Alignment Unlocks Scale for Robotic Manipulation Foundation Models · Qwen Team 2026
先对齐,再扩规模。 机器人操作数据天然异构(不同本体/坐标系/动作空间/频率/相机),直接堆数据只会互相冲突。Qwen-RobotManip 提出在表征、运动、行为三个维度统一对齐后,异构大规模数据才能相互增强而非干扰——从而像语言/多模态基础模型那样吃下规模、获得真正的 OOD 泛化。
| 项 | 内容 |
|---|---|
| 团队 | Qwen Team(阿里),团队署名 |
| 基座 | Qwen3.5-4B VLM + flow-matching DiT 动作专家(非基于 π0.5) |
| 数据规模 | ~38,100 小时操作数据 + 28M VL 样本,全部开源数据,无私有采集 |
| 核心创新 | 三重对齐(表征/运动/行为) + Human-to-Robot 合成 + OOD-first 评测 |
| 代表结果 | LIBERO-Plus 91.4 vs π0.5 84.4;RoboTwin-C2R Hard 69.4 vs π0.5 47.9;真机 ALOHA OOD 87.5% vs π0.5 37.5% / StarVLA 0% |
| 新提 benchmark | RoboTwin-IF(指令跟随)、RoboTwin-XE(零样本跨本体) |
| 开源 | 是 |
读完你能回答:为什么机器人数据不能像文本那样"堆就行"?为什么标准 benchmark 高分不算数?
| 模型/设置 | ID 表现 | OOD 表现 | 含义 |
|---|---|---|---|
| StarVLA | RoboTwin Easy 85.7% | C2R Hard 10.6% | 标准高分≠OOD泛化 |
| π0.5 | ID 强 | OOD 优于无预训练模型 | 预训练在OOD显价值 |
| Qwen-RobotManip | ID 强(LIBERO 99.2) | OOD 更强(C2R Hard 69.4) | 对齐+规模化放大OOD能力 |
结论:OOD-first evaluation 才应该是 foundation model 的主评测协议。
读完你能回答:representation/motion/behavior 三层对齐分别解决什么、怎么做。
| 对齐层 | 解决的异构问题 | 具体做法 |
|---|---|---|
| ① 表征对齐(representation) | 不同机器人关节数/动作字段拼接混乱 | 80 维 canonical state-action 模板,语义固定槽位 |
| ② 运动对齐(motion) | EEF 位姿记在不同 base/camera frame,数值不可比 | camera-frame delta EEF + CaPE 相机位置编码 |
| ③ 行为对齐(behavior) | 不同机器人执行风格/动力学不同 | structured embodiment prompt + in-context policy adaptation |
80 维 = 2 × 29维 per-arm block + 22 维 reserved
每个 29 维 arm block:
7 维 joint position(关节位置)
9 维 EEF pose(末端位姿)
1 维 gripper state(夹爪)
12 维 dexterous hand joints(灵巧手)
单臂 → 填一个 arm block; 双臂 → 填两个; 灵巧手 → 填 hand joints
不存在的维度置0,用 binary mask 从 loss 中排除
reserved 22 维 → 移动底盘等扩展自由度
光有 80 维模板还不够——不同数据集的 EEF pose 可能在不同坐标系记录。解法:把 EEF action 表达为相机坐标系下的 delta pose。
效果:RoboTwin-XE 零样本跨本体,camera-frame EEF 平均 23.9% vs joint control 14.5%;joint 空间几乎不能跨本体(<5%)。
读完你能回答:数据从哪来、human-to-robot 怎么合成、为什么要清洗。
| 数据类型 | 来源 | 规模 |
|---|---|---|
| 开源机器人数据 | OXE, AgiBotWorld-Beta, RoboMIND(2.0), Galaxea, RoboCOIN, DROID, RH20T, RDT-1B, InternData-A1 | 11,000+ 小时 |
| 第一视角人手视频 | EgoDex, VITRA, EgoVerse | 1,933 小时 |
| H2R 合成机器人演示 | 人手视频渲染到 15 种机器人形态 | 24,808 小时 |
| VL 数据 | VQA/grounding/OCR/ECoT/ego-video/2D trajectory | 28M 样本 |
全部开源数据,无任何私有采集——却达到 ~38,100 小时预训练语料。
动作对齐:
MANO 手部关键点 → 构造虚拟手指
拇指与index/middle加权中点 → gripper 位置
两者距离 → gripper width
抓取轴+腕到指尖方向 → gripper orientation
滤波: 位置/宽度 Savitzky-Golay, 旋转 Gaussian-weighted SLERP
视觉对齐:
SAM3 分割手臂 → ProPainter inpaint 删人手
→ 搜索机器人 base placement → MuJoCo IK 跟踪重定向轨迹
→ Depth Anything v3 场景深度 + 机器人渲染深度 → 遮挡合成
结果: 每段人手视频 → 多个机器人形态下的视觉-动作演示
状态/动作五步过滤:突变检测、state-action 趋势对齐、极值过滤、joint-EEF FK 一致性、base frame/EEF orientation 对齐。视频/语言三类检查:指令一致性、video-state 一致性、视频质量。
多视角图像 + 结构化prompt + 历史context
│
▼
Qwen3.5-4B VLM backbone
│ last-layer hidden states, D_vlm=2560
▼
Flow-Matching DiT Action Expert
│ N=10 blocks, D_act=768, 12 heads
│ state token + noisy action + query/context tokens
│ 偶数block attend视觉token, 奇数block attend语言token
▼
80维 canonical action chunk (binary mask只监督有效维度)
│
▼ 推理: 4步 Euler flow-matching + RTC异步执行
| 组件 | 配置 |
|---|---|
| VLM | Qwen3.5-4B,last-layer hidden D=2560 |
| DiT 动作专家 | 10 blocks,hidden 768,12 heads,偶数层看视觉/奇数层看语言 |
| Flow Matching | t~Beta(1,1.5),x_t=(1-t)ε+t·a,预测速度 a-ε,推理 4 Euler 步 |
| 协同训练 | 9:1 robot/VL 数据,L=L_FM+0.1·L_VLM,每 chunk 重复采样 8 次 |
| 架构选择 | last-layer cross-attention(消融胜过 layer-wise,且成本更低) |
读完你能回答:论文用哪些 OOD benchmark、各测什么、结果如何。
| 评测块 | Benchmark / 平台 | 任务与数据 | 为什么这样测 | 复现状态 |
|---|---|---|---|---|
| ID sanity check | LIBERO / RoboTwin Easy & Hard | 标准仿真任务,报告 ID success。 | 证明对齐和大规模预训练不会破坏常规 benchmark,但这不是论文核心。 | 未本地复现。 |
| 仿真 OOD | LIBERO-Plus / RoboTwin-C2R | 视角、初始状态、光照、背景、噪声、布局、clean-to-random 等扰动。 | 证明 ID 高分不够,只有 OOD 才能检验 foundation model 泛化;也是 Qwen-RobotManip 批评标准 benchmark 的核心证据。 | 未复现;页面基于论文表格。 |
| 语言指令跟随 | RoboTwin-IF | 同一视觉场景下不同语言要求不同动作。 | 测模型是否真的用语言控制动作,而不是只靠视觉捷径。 | 未复现。 |
| 跨本体 | RoboTwin-XE / CobotMagic ALOHA | zero-shot cross-embodiment;比较 joint、统一 EEF、camera-frame EEF。 | 检验 representation / motion alignment 是否解决不同机器人动作空间不一致。 | 未复现。 |
| 长程组合 | RoboCasa365 / EBench / RoboChallenge | 厨房长程组合、Isaac Sim 双臂移动平台、真实/综合挑战任务。 | 验证从“短桌面任务”扩展到更复杂、多阶段、移动/双臂场景。 | 未复现。 |
| 真机 | CobotMagic ALOHA / ARX / RoboChallenge | ID/OOD 真机任务,含接触/插入类失败案例。 | 证明仿真 OOD 结论能部分迁移到真实平台,同时暴露纯视觉无力觉的接触短板。 | 未复现;完整预训练和平台成本极高。 |
| Benchmark | 测什么 OOD | Qwen-RobotManip vs π0.5 |
|---|---|---|
| LIBERO-Plus | 7维扰动(视角/初态/光照/背景等) | 91.4 vs 84.4(π0 仅 53.6) |
| RoboTwin-C2R(Clean2Rand) | 干净训练→随机化测试(视觉域OOD) | Hard 69.4 vs 47.9(StarVLA 崩到 10.6) |
| RoboTwin-IF(新提出) | 指令跟随:同场景不同语言不同动作 | 72.2 vs 49.6(测语言退化) |
| RoboTwin-XE(新提出) | 零样本跨本体迁移 | camera-frame EEF 23.9% vs joint 14.5% |
| RoboCasa365 | 厨房长程组合(Composite-Unseen) | Total 35.9 vs 16.9;组合未见 14.9 vs RLDX-1 5.4 |
| EBench | Isaac Sim 双臂移动平台 | Overall 45.6 vs 27.1 |
| 平台/设置 | Qwen-RobotManip | π0.5 | StarVLA |
|---|---|---|---|
| CobotMagic ALOHA ID | 88.6% | 42.9% | 20.0% |
| CobotMagic ALOHA OOD | 87.5% | 37.5% | 0.0% |
| RoboChallenge Table30 Generalist | 45 / 59.83 | 17.67 / 31.27 | — |
Qwen-RobotManip = Qwen3.5-4B + flow-matching DiT + 三重对齐(80维canonical/camera-frame EEF/structured prompt) + 38,100h 全开源数据(含24,808h H2R合成) + OOD-first 评测,用"先对齐再扩规模"释放异构机器人数据的规模化能力。
| 阶段 | 可核对信息 | 资源量级推断 |
|---|---|---|
| 预训练(Pre-training) | ~38,100 小时操作数据 + 28M VL 样本,4B VLM + flow-matching DiT,异构大规模语料 | 🟠 这种数据规模的基础模型预训练通常需多机多卡集群(数十至上百张 A100/H100 级)、数天至数周。论文未给具体数字。 |
| SFT(下游适配) | 论文明确:从预训练 ckpt 初始化,比预训练用更少 GPU、更少步数 | 🟠 单节点 8 卡级即可完成下游 SFT(相对轻)。 |
| 评测 | LIBERO/LIBERO-Plus、RoboTwin(含 C2R Hard)、真机 ALOHA | 🟢 仿真 rollout + 真机部署,推理侧单卡即可(4B 级模型)。 |