VLA / 机器人操作 Benchmark 结果汇总

覆盖 202 篇论文 · 每个 benchmark 一张表、按论文分组 · 数值均为各论文自报

# Benchmark 结果汇总(按 benchmark 重组)

本文档由 8 份抽取文件(out_00 ~ out_07)按 benchmark 重新分组汇总。
通用声明:所有数值均为各论文自报(取自各自 `深度分析.md` / `中文翻译.md`),跨论文同名方法(如 π0、π0.5、OpenVLA-OFT)的数值可能不同,因为训练配置、评测协议、随机种子各异。缺失/占位/图估数值保持原标注(`—` 缺失、`~` 近似/图估、`(图估)`)。数值绝对忠实,未做任何修改或推算(除各批注明的"反推值",已保留原注)。
论文分组排序:每张统一大表内,论文按发表时间倒序(arXiv 号大者在前;无 arXiv 号者排最后)。同一论文多行方法共用一个论文名,后续行论文列留空。
按模型视图:从下方各 benchmark 表格自动抽取常见对比模型行;ckpt 来源列基于原表标注/方法名归纳,若原汇总未保留下载路径则明确标为未记录;协议列会单独标出训练域、测试域和分布关系,未能从当前汇总/深度分析确认的行标为“未确认”。
协议口径:Benchmark 名称不等于训练/测试协议。下面的速查只覆盖当前最容易误读的设置;模型视图会逐行补充更细的协议说明。
Benchmark / 设置训练域 / ckpt测试域分布关系证据口径
RoboTwin Clean / RandomizedClean/Randomized 列是测试环境列,不自动说明训练 split;ImageWAM/Motus 明确含 clean + randomized 训练数据,其他论文未逐行保存。Clean 和/或 Randomized test splitmixed / split evalImageWAM、Motus 深度分析记录训练数据;其余按当前汇总保守标注。
RoboTwin-Clean2RandClean 训练或 clean-domain policyRandomized Hard 测试OOD: Clean2RandQwen-RobotManip Table 5 / §2.4 标题。
RoboTwin Easy / Hard目标 benchmark 训练/后训练或各论文 baseline 设置;训练 split 未逐 baseline 保存。Easy / Hard ID benchmark splitID / IID-ishQwen-RobotManip 深度分析将 Table 3 标为 ID benchmark。
LIBERO-Plus无 “+” 行按 OOD 扰动评测阅读;带 “+ / 用 LIBERO-Plus 训练” 的行是目标域训练。Camera / Robot / Lang. / Light / Background / Noise / Layout 等扰动OOD or target-trainedMINT 深度分析明确区分无 LIBERO-Plus 训练和有 LIBERO-Plus 训练。
LIBERO-PRObase policy 冻结;π0.5-LeRobot ckpt 来自 huggingface.co/lerobot/pi05_libero_finetuned;VLS 本身 training-free。LIBERO 四套件的 Task / Position 扰动,每任务 20 episodesOOD perturbationVLS 深度分析 Table I 与代码仓库记录。
LIBERO reasoning / SEALLIBERO reasoning 标注扩展或 runtime steering 设置,按行内方法区分。ID、Compose、Lang/Visual OOD 列混合出现ID + OOD mixed§16 表头直接列出 ID / Compose / OOD 维度。
GenBench16 train tasks44 test tasks,L1-L4 四级泛化generalizationActiveVLA / §17 标注 16 train + 44 test。
提示:默认只过滤当前标签页;勾选"全局检索"后跨所有 benchmark 检索,命中的表会全部展开。切换标签或清空搜索即恢复。
LIBERO(标准四套件)
RoboTwin(2.0 及变体)
SimplerEnv
CALVIN
RoboCasa
RLBench
LIBERO-Plus
ManiSkill
COLOSSEUM
Meta-World
Push-T
LIBERO-10 / LIBERO-LONG
LIBERO-90
LIBERO-Object
LIBERO-PRO
LIBERO(reasoning/OOD 变体,SEAL)
GenBench
DexMimicGen
真机实验(按论文/平台)
其他 / 自研 benchmark
按模型
异常说明

1. LIBERO(标准四套件)

指标:Spatial / Object / Goal / Long 四套件成功率(%),Avg 为四套件平均。共 21 篇报告标准 LIBERO。数值均为各论文自报,跨论文同名方法数值可能不同。多篇论文只报聚合 Avg(分套件填 —)。粗体为该论文所提方法。
论文方法原表标注SpatialObjectGoalLongAvg
LA4VLA (2606.27295, Table 4)No pretrainbaseline92.85
VLA消融94.40
LA消融95.30
MixPT所提方法95.75
LA-VLA所提方法96.28
ImageWAM (2606.19531, Table 2)π0.5baseline96.9
Fast-WAMbaseline97.6
Motusbaseline97.7
LingBot-VAbaseline98.5
ImageWAM所提方法98.4
MaskWAM (2606.13515, Table 1)WorldVLAVLA87.696.283.460.081.8
GR00T-N1VLA94.497.693.090.693.9
π0VLA96.898.895.885.294.1
π0.5VLA98.698.298.092.496.8
MotusWAM96.899.896.697.697.7
FastWAMWAM98.2100.097.095.297.6
Ours (RGB-only)WAM 消融96.899.697.095.897.3
Ours (Mask-only)WAM 消融97.299.897.496.097.6
Ours (MaskWAM)所提方法98.8100.098.296.498.4
Qwen-VLA (2605.30280, 正文表)最佳 SpecialistABot-M0/StarVLA-OFT98.6
Qwen-VLA-Instruct所提(通用)97.9
OASIS (2605.25829, Table 1)SpatialVLA空间特征/预训练88.289.978.655.578.1
WorldVLA未来视觉状态85.689.082.659.079.1
ThinkAct2D 监督特征/预训练88.391.487.170.984.4
π0多模态特征/预训练96.898.895.885.294.1
QDepth-VLA空间特征/预训练97.696.695.290.094.9
UniVLA空间特征/预训练96.596.895.692.095.2
Unified-VLA未来视觉状态/预训练95.498.893.694.095.5
OASISSE(3)监督/无预训练99.098.897.495.297.6
StarVLA (2604.05014, 正文)π0+FASTbaseline85.5
GR00T-N1.5baseline86.5
OpenVLA-OFTbaseline(175K步)97.1
StarVLA-FAST本文变体95.4
StarVLA-π本文变体95.7
StarVLA-GR00T本文变体96.5
StarVLA-OFT本文变体97.898.696.293.896.6
FutureVLA (2603.10712, 正文)OpenVLA-OFTbaseline76.5
π0baseline94.2
GR00T-N1.5baseline93.9
UniVLAbaseline95.2
FutureVLA-OT所提(变体)98.2
FutureVLA-GT所提方法98.3
DiT4DiT (2603.10448, 正文)Qwen3DiT参数匹配基线98.098.896.093.696.6
CogVLAbaseline95.497.4
π0.5baseline92.496.9
OpenVLA-OFTbaseline94.5
GR00T-N1.5baseline94.1
DiT4DiT所提(SOTA)98.499.698.697.698.6
MINT (2603.08602, Table I)Diffusion Policy无预训练78.392.568.350.572.4
MDT无预训练78.587.573.564.876.1
WorldVLA无预训练87.696.283.460.081.8
SmolVLA无预训练93.094.091.077.088.8
MINT-30M无预训练(本文)98.699.297.493.297.1
LAPA有预训练73.874.658.855.465.7
OpenVLA有预训练84.788.479.253.776.5
π0-FAST有预训练96.496.888.660.285.5
π0有预训练90.086.095.073.086.0
UniVLA有预训练96.596.895.692.095.2
OpenVLA-OFT有预训练96.998.195.691.195.4
π0.5有预训练98.898.298.092.496.9
MINT-4B有预训练(本文)97.499.698.297.898.3
ForeAct (2602.12322, 仿真表)OpenVLAbaseline84.788.479.253.776.5
CoT-VLAbaseline87.591.687.669.083.9
π0baseline96.898.895.883.294.2
π0.5baseline97.398.896.994.296.8
CogVLAbaseline97.399.896.695.497.4
ForeAct (w/ π0.5)所提方法97.399.897.395.497.5
LAP (2602.10556, Table 3)LAP-3Blanguage-action96.8
LAP-3B + VQA Co.+VQA 共训97.2
mimic-video (2512.15692, Table 4.2)Diffusion Policyscratch78.192.568.579.7
Octofinetuned78.985.784.683.1
DiT Policyfinetuned84.296.385.488.6
OpenVLAfinetuned84.788.479.284.1
OpenVLA-OFTfinetuned96.298.496.296.9
pi0.5-style VLAscratch79.294.084.485.9
mimic-video所提(scratch)94.296.890.693.9
SwiftVLA (2512.00903, Table 3)GR00T-N1大 VLA93.9
π0大 VLA (3B)94.1
OpenVLA-OFT大 VLA (7B)97.1
SwiftVLA0.45B94.7
SwiftVLA (4D input)1.65B95.1
ContextVLA (2510.04246, Table 1)GROOT N1.51-frame76.6
ContextVLA8-frame79.0
DreamVLA (2507.04447, Table 2)DreamVLA所提方法97.594.089.589.592.6
Fast-WAM (2503.17543, Table 1)OpenVLAbaseline
π0baseline
Fast-WAM w/o video co-training消融82.6
Fast-WAM-Joint消融90.4
Fast-WAM-IDM消融90.6
Fast-WAM所提方法91.9
CosmosPolicy (无 arXiv, Table 1)OpenVLA-OFT次优基线~95
Cosmos Policy所提(SOTA)98.5
G0.5 (无 arXiv, Table 4)G0.5所提方法98.9
Qwen-RobotManip (无 arXiv, Table 3)π0baseline94.4
π0.5baseline97.6
StarVLAbaseline98.0
Abot-M0baseline98.6
Being-H0.7baseline99.2
Qwen-RobotManip-scratch本文(从零)98.2
Qwen-RobotManip本文99.1
Qwen-RobotManip-Context本文(context)99.2
World-VLA-Loop (无 arXiv)SFT baselinebaseline83.9
World-VLA-Loop (首轮RL)所提方法93.1
Xiaomi-Robotics-0 (无 arXiv)OpenVLAbaseline82.1
OpenVLA-OFTbaseline86.0
Xiaomi-Robotics-0所提方法90.8

异常/备注

- MINT 的 LIBERO 原表另有 L90(LIBERO-90)列:MINT-30M 97.4、π0.5 96.0、MINT-4B 98.7(未纳入标准五列)。

- LA4VLA 原抽取行含 "87.8(Spatial:No)→95.8(LA-VLA)" 的勘误式表述,Spatial 逐列不可靠,此处分套件统一填 —。

- World-VLA-Loop 另有"LIBERO 平均 87.5%"(设置不同)的速览值,与主表 93.1 口径不同。

- 同名方法跨论文数值差异明显,例如 OpenVLA-OFT 的 Avg 在不同论文中为 95.4 / 96.9 / 97.1;π0.5 为 96.8 / 96.9 / 97.6 等——均为各论文自报,未统一。

2. RoboTwin(2.0 及变体)

11 篇(Motus、SwiftVLA、Fast-WAM、GigaWorld-Policy、ImageWAM、MaskWAM、StarVLA、LingBot-VLA、G0.5、Qwen-RobotManip、Qwen-VLA)。RoboTwin 2.0 标准指标为 Clean / Randomized 环境下的成功率(SR,部分论文用 0–1 分数,部分用百分数,保留原样);另有 Easy/Hard、Clean2Rand、指令跟随(IF)等变体设置。数值均为各论文自报。
协议提醒:Clean / Randomized 是测试环境列,不自动等价于“clean 训练 / randomized 训练”。ImageWAM 与 Motus 的深度分析保留了 clean + randomized 训练数据;Qwen-RobotManip Table 3 属于 ID benchmark,Table 5 是 Clean2Rand,Table 8 是 IF。未保留训练 split 的行在模型视图中标为“未确认”。

2.1 RoboTwin 2.0(Clean / Randomized 成功率)

论文方法原表标注CleanRandomized
ImageWAM (2606.19531, Table 1)π0.5baseline79.75
Motusbaseline87.80
FastWAMbaseline91.83
LingBot-VAbaseline92.20
ImageWAM (FLUX.2 4B)所提方法93.2093.56
MaskWAM (2606.13515, Table 2, 6随机化任务Avg)π0VLA72.8
FastWAMWAM87.7
Ours (RGB-only)消融87.3
Ours (Mask-only)消融88.8
Ours (MaskWAM)所提方法92.2
StarVLA (2604.05014, 50任务)π0baseline65.958.4
X-VLAbaseline72.972.8
Lingbot-VLAbaseline88.686.7
StarVLA-GR00T本文变体88.088.5
StarVLA-π本文变体88.188.8
LingBot-VLA (2601.18692, Table 2)Ours w/o depth本文(无深度)82.7476.76
Ours w/ depth本文(深度蒸馏)88.5686.68
Motus (2512.13030, 4.1, 50任务)π0.5VLA42.9841.64
X-VLAVLA72.9072.44
Motus (Stage 1 only)消融77.0082.86
Motus (full)所提方法85.6686.48
备注:LingBot-VLA 另报 Process Score(Clean PS 86.90 / Random PS 85.54,w/o depth);MaskWAM 逐任务(Hammer/Bell/Card/Burger/Stand/Shoe)见 out_06 原表。

2.2 RoboTwin 2.0(仅报聚合 SR,无 Clean/Randomized 拆分)

论文方法原表标注SR
GigaWorld-Policy (2603.17240, 4.1, 仿真SR)π0.5baseline0.48
Motusbaseline0.88
GigaWorld-Policy所提方法0.86
SwiftVLA (2512.00903, Table 1, post-training)TinyVLA小 VLA0.07
SmolVLA小 VLA (0.5B)0.29
GO-1大 VLA0.46
π0大 VLA (3.3B)0.47
SwiftVLA0.45B0.53
SwiftVLA (4D input)1.65B0.55
Fast-WAM (2503.17543, Table 2)Fast-WAM w/o video co-training消融84.8
Fast-WAM-Joint消融80.5
Fast-WAM-IDM消融81.3
Fast-WAM所提方法91.5
G0.5 (无 arXiv, Table 4)G0.5所提方法93.3
备注:GigaWorld-Policy 正文另处提 π0.5 仿真 0.44,与速度卡 0.48 略有出入(本表采速度卡值)。SwiftVLA 边缘部署(Jetson Orin) SR:SmolVLA 0.30 / π0 0.48 / SwiftVLA 0.76(见 out_03 Table 4)。单位口径(0–1 分数 vs 百分数)沿用各论文原文。

2.3 RoboTwin(Easy / Hard 设置)

论文方法原表标注EasyHard
Qwen-VLA (2605.30280, 正文表)最佳 SpecialistABot-M0/StarVLA-OFT86.085.0
Qwen-VLA-Instruct本文(通用)86.187.2
Qwen-RobotManip (无 arXiv, Table 3)π0baseline65.958.4
π0.5baseline82.776.8
StarVLAbaseline85.787.3
Abot-M0baseline86.185.1
Being-H0.7baseline90.289.6
Qwen-RobotManip-scratch本文(从零)88.788.4
Qwen-RobotManip本文93.492.5
Qwen-RobotManip-Context本文(context)93.794.0

2.4 RoboTwin-Clean2Rand(Hard 设置,成功率%)

论文方法原表标注Hard
Qwen-RobotManip (无 arXiv, Table 5)StarVLAbaseline10.6
π0.5baseline47.9
Qwen-RobotManip (EEF)本文60.8
Qwen-RobotManip (joint)本文62.6
Qwen-RobotManip-Context (joint)本文69.4

2.5 RoboTwin-IF(指令跟随,平均成功率%)

论文方法原表标注Avg
Qwen-RobotManip (无 arXiv, Table 8)GR00T-N1.7baseline16.6
StarVLAbaseline29.4
π0.5baseline49.6
Qwen-RobotManip-Context本文72.0
Qwen-RobotManip本文72.2

3. SimplerEnv

11 篇。子环境:Google-Robot(Fractal,多用 Visual Matching / Variant Aggregation)、WidowX-Bridge(多任务平均成功率)、OOD。指标为成功率(%)。数值均为各论文自报,跨论文同名方法可能不同。

3.1 Google-Robot(Fractal)

论文方法原表标注Visual Matching (Avg %)Variant Aggregation
StarVLA (2604.05014)CogACTbaseline74.861.3
SpatialVLAbaseline75.170.7
StarVLA-OFT本文76.070.2
FutureVLA (2603.10712)OpenVLA-OFTbaseline47.5
π0baseline52.7
GR00T-N1.5baseline35.2
Villa-Xbaseline59.6
FutureVLA-OT所提(变体)77.6
FutureVLA-GT所提方法80.1
DeFI (无 arXiv, ICLR 2026)OpenVLAbaseline27.7
TraceVLAbaseline42.0
DeFI所提(SOTA)51.2
Xiaomi-Robotics-0 (无 arXiv)GR00T-N1baseline53.7
Xiaomi-Robotics-0所提方法68.5
DeFI 逐任务(Visual Matching):Pick Coke Can 54.2 / Move Near 60.7 / Open-Close Drawer 38.6(DeFI);TraceVLA 28.0/53.7/57.0;OpenVLA 16.3/46.2/35.6。

3.2 WidowX-Bridge

论文方法原表标注WidowX-Bridge Avg SR(%)
Qwen-VLA (2605.30280)最佳 Specialistbaseline64.6
Qwen-VLA-Instruct本文73.7
StarVLA (2604.05014)SpatialVLAbaseline42.7
CogACTbaseline51.3
GR00T N1.5baseline61.9
StarVLA-OFT本文变体64.6
StarVLA-GR00T本文变体65.3
FutureVLA (2603.10712)OpenVLA-OFTbaseline30.2
π0baseline20.9
GR00T-N1.5baseline61.9
UniVLAbaseline47.9
Villa-Xbaseline40.8
FutureVLA-OT所提(变体)63.6
FutureVLA-GT所提方法71.9
mimic-video (2512.15692)OpenVLAfinetuned14.6
Octofinetuned16.0
ThinkActpretrained43.8
FLOWERfinetuned45.0
pi0.5-style VLAscratch35.4
mimic-videoscratch46.9
mimic-video (τv-tuning)所提方法56.3
ContextVLA (2510.04246)GROOT N1.51-frame41.9
ContextVLA8-frame56.2
FSD / SeeingToDoing (2505.08548)RoboPoint零样本 baseline17.7
OpenVLA-OFT端到端 VLA41.8
FSD-13B本文(零样本)40.6
LAPA (2410.11758)Scratchbaseline0.7
LAPA (Human Videos)所提方法45.8
OpenVLA (2406.09246, BridgeData V2 17任务)RT-1-X35M18.5
Octo93M20.0
RT-2-X55B50.6
OpenVLA7B70.6
G0.5 (无 arXiv)G0.5所提方法(SimplerEnv-Bridge)87.3
mimic-video 逐任务(WidowX-Bridge):Put Carrot/Put Spoon/Stack Blocks/Eggplant,见 out_02 原表。OpenVLA 该表原文标注为"真机 out-of-the-box, SimplerEnv 风格多平台评估",同时报 Google Robot(12任务):RT-1-X 33.3 / Octo 26.7 / RT-2-X 78.3 / OpenVLA 85.0。

3.3 SimplerEnv-OOD

论文方法原表标注SR(%)
Qwen-VLA (2605.30280)π0.5baseline12.6
Qwen-VLA本文32.0

4. CALVIN

8 篇(含 ABC→D 7 篇、ABCD→D 1 篇)。指标:连续链式 1/2/3/4/5 条指令的成功率,Avg.Len 为平均完成任务链长度(满分5)。数值均为各论文自报;注意 SuSIE 原文用 0–1 分数,其余多数用百分数,均保留原样,故跨论文数值不可直接比较。

4.1 CALVIN(ABC→D,零样本泛化)

论文方法原表标注12345Avg.Len
OASIS (2605.25829, Table 2)SuSIE未来视觉状态/预训练87.069.049.038.026.02.69
3D Diffuser Actor†3D 特征(多视图RGB-D)93.880.366.253.341.23.35
ReconVLA空间特征/预训练95.687.676.969.364.13.95
Seer-Large未来视觉状态/预训练96.391.686.180.374.04.28
VPP未来视觉状态/预训练96.590.986.682.076.94.33
Unified-VLA未来视觉状态/预训练98.994.889.082.875.14.41
DreamVLA未来视觉状态/预训练98.294.689.583.478.14.44
OASISSE(3)监督/无预训练98.194.991.788.983.34.57
DreamVLA (2507.04447, Table 1)DreamVLA所提方法4.44
GHIL-Glue (2410.20018, Table I)LCBC Diffusion Policybaseline68.543.022.511.06.81.52
SuSIEbaseline89.875.057.541.829.82.94
GHIL-Glue (SuSIE)仅Aug De-sync95.284.069.556.046.23.51
GHIL-Glue (SuSIE)仅Subgoal Filtering88.575.556.243.032.52.96
GHIL-Glue (SuSIE)完整95.288.573.262.549.83.69
UniPibaseline56.828.312.03.51.51.02
GHIL-Glue (UniPi)仅Aug De-sync60.229.512.55.51.81.1
GHIL-Glue (UniPi)仅Subgoal Filtering69.540.015.86.54.21.36
GHIL-Glue (UniPi)完整75.244.819.711.25.51.56
DISCO (2406.09767, 表6.2)RT-153.322.29.43.81.30.90
RoboFlamingo82.461.946.633.123.52.48
SuSIE87.069.049.038.026.02.69
DeeR-VLA2.90
3D Diffuser Actor92.278.763.951.241.23.27
Vanilla inpt.92.978.664.951.441.93.30
DISCO所提方法94.782.971.058.849.43.57
SuSIE (2310.10639, 深度分析6.1, 0–1分数)AugLC语言条件基线0.690.430.220.090.05
UniPi (Ours 复现)论文复现的 UniPi0.560.160.080.080.04
SuSIE图像编辑subgoal+GCBC0.870.690.490.380.26
DeFI (无 arXiv, ICLR 2026)DeFI (多视角)所提(SOTA)97.994.290.787.081.24.51
VPP (多视角)基线96.590.986.682.076.94.33
Seer (多视角)基线96.391.686.180.374.04.28
π0.5 (多视角)基线94.887.478.271.764.33.97
DeFI (单视角)所提92.987.281.275.068.44.05
UP-VLA基线4.08
UniVLA基线3.80
CLOVER基线3.53
OpenVLA基线3.27
Xiaomi-Robotics-0 (无 arXiv)GR00T-N14.70
Xiaomi-Robotics-0所提方法4.78
备注:DreamVLA 消融(Fig.6/Table 5):Vanilla VLA Avg.Len 3.64、+Dynamic Region 4.32。SuSIE 只报 1–5 分步成功率(0–1),无 Avg.Len。

4.2 CALVIN(ABCD→D)

论文方法原表标注12345Avg.Len
MINT (2603.08602, Table I)RT-1baseline84.461.743.832.322.72.45
Robo-Flamingobaseline96.489.682.474.066.04.09
π0.5baseline94.289.382.778.570.34.15
RoboVLMsbaseline96.793.089.986.582.64.49
MINT-4B本文97.494.291.788.286.14.57
备注:CALVIN 的 D→D 设置在 8 份抽取中无论文报告。VLS(2602.03973) 的 CALVIN 未按 1–5 链长报告(仅报 MovableObjects 94 / ArticulatedParts 87 任务组成功率),归入 §16 附注/其他,不并入本节。

5. RoboCasa

7 篇(GR00T-N1、MimicDroid、UniT-Humanoid、CosmosPolicy、DIAL、DiT4DiT、HSAT-AT)。RoboCasa 有多种设置:Franka 20 任务 / 厨房 24 任务 / GR1 桌面 24 任务 / Few-Shot L1-L3 / ICL。指标为成功率(部分论文 0–1,部分百分数)。数值均为各论文自报,任务集与本体不同,不同小节间不可直接比较

5.1 RoboCasa(Franka 20 任务 / 厨房 24 任务,平均 SR)

论文方法原表标注Avg SR
CosmosPolicy (无 arXiv, Table 2, 24厨房任务)次优基线~60
Cosmos Policy所提(SOTA)67.1
GR00T-N1 (无 arXiv, Table 2, 20任务)Octobaseline28.8
OpenVLAbaseline31.2
π0baseline55.6
GR00T N1 (2B)所提方法61.6

5.2 RoboCasa-GR1(24 tabletop 任务,Full Data 平均 SR)

论文方法原表标注Avg SR
DiT4DiT (2603.10448)Qwen3DiT参数匹配基线36.2
GR00T-N1.6基线40.8
GR00T-N1.5基线41.8
DiT4DiT所提(SOTA)50.8
DIAL (无 arXiv)Diffusion Policy基线29.5
UWM基线40.9
FAST-Qwen3基线43.9
GR00T-N1.6基线47.6
pi0 (π-Qwen3)基线47.8
FLARE基线55.0
DIAL所提(SOTA)70.2
UniT-Humanoid (无 arXiv, Fig.9)GR00T baseline同架构无UniT47.8
FLARE未来潜在对齐 flow55.0
VLA-UniT所提(+UniT token)66.7
备注:三篇 GR1 结果的 baseline 数值差异大(DiT4DiT 报 GR00T-N1.5=41.8、自身 50.8;DIAL 报 pi0=47.8、自身 70.2;UniT-Humanoid 报 GR00T=47.8、自身 66.7),源于各自任务配置/数据量不同。UniT-Humanoid 分项:Pick&Place 67.3 / Articulated 64.7。

5.3 RoboCasa Few-Shot

MimicDroid (2509.09726, Table I, L1/L2/L3)

方法原表标注本体L1L2L3
MimicDroid w/o Visual Masking消融Abstract39
MimicDroid所提方法Abstract733927
MimicDroid所提方法GR1594426

DIAL (无 arXiv, Few-Shot 100 traj = 10% 数据, 平均 SR)

方法原表标注Avg SR
冻结VLM 无世界建模消融21.8
微调VLM 无世界建模消融30.6
DIAL-DINO (替换ViT)消融47.2
+SEER 拼接消融49.6
+FLARE 辅助loss消融51.9
DIAL完整58.3
DIAL +EgoDex 人类数据 (ID)跨体61.1

5.4 RoboCasa ICL / Zero-shot(HSAT-AT, 2504.15215)

设置方法原表标注Avg SR
ICL (7任务, Table 1)ICRT+MLPbaseline0.85
LfpVQ-VAEbaseline0.96
HSAT-AT所提方法0.99
Zero-shot (unseen, Table 5)LfpVQ-VAEbaseline0.84
HSAT-AT所提方法0.88

6. RLBench

4 篇。指标为平均成功率(%),任务数各异(18/8/12),已在原表标注注明。数值均为各论文自报。
论文方法原表标注Avg Success(%)
ActiveVLA (2601.08325, Table 1, 18任务)RVT / PerAct基线
3D Diffuser Actor基线
BridgeVLA基线84.0
RVT-2基线88.3
ActiveVLA所提(Avg Rank 1.22)91.8
Goal-VLA (2506.23919, 8任务, zero-shot)π0baseline0.0
SUSIEbaseline0.0
OpenVLAbaseline0.2
VoxPoserbaseline5.8
MolmoActbaseline11.3
MOKAbaseline26.0
Goal-VLA所提方法59.9
SAM2Act (2501.18564, Table 5.1, 18任务)PerActbaseline49.4
RVTbaseline62.9
SAM-Ebaseline77.6
RVT-2前 SOTA81.4
SAM2Act所提方法86.8
SynthICL (arXiv 2026.06, 12任务)ICRTbaseline66.1
IP (Instant Policy)baseline72.4
SynthICL (full)所提方法75.8
备注:SAM2Act Avg Rank 1.8(18任务中9个第一);ActiveVLA Avg Rank 1.22。SynthICL 的 "arXiv 2026.06" 非标准编号,排序按无号处理置末。

7. LIBERO-Plus

3 篇(ImageWAM、MINT、Qwen-RobotManip)。LIBERO-Plus 为 LIBERO 多维泛化扰动基准。各论文报告的扰动维度列不完全一致,统一以 Avg 汇总,逐维数值列于备注。数值均为各论文自报。
协议提醒:无 “+” 的行按 LIBERO-Plus OOD 扰动评测阅读;MINT 表中带 “+” 或原表标注“用 LIBERO-Plus 训练”的行是目标域训练,需要和无 “+” baseline 分开比较。ImageWAM / Qwen-RobotManip 的训练域细节若当前汇总未保存,模型视图会标为“未确认”。
论文方法原表标注CameraLightAvg
ImageWAM (2606.19531, Table 3)WorldVLAbaseline25.0
FastWAMbaseline16.451.5
π0-Fastbaseline61.6
OpenVLA-OFTbaseline69.6
ImageWAM (FLUX.2 4B)所提方法80.898.183.1
ImageWAM (FLUX.2 9B)所提方法85.2
MINT (2603.08602, Table II, 7维)OpenVLAbaseline0.88.116.3
UniVLAbaseline1.869.045.9
π0baseline13.885.056.1
π0-FASTbaseline65.173.262.5
OpenVLA-OFTbaseline56.488.771.4
π0.5baseline53.083.165.0
MINT-30M本文61.492.269.5
MINT-4B本文72.296.680.1
OpenVLA-OFT+用 LIBERO-Plus 训练92.894.980.7
π0.5+用 LIBERO-Plus 训练67.275.865.3
MINT-4B+用 LIBERO-Plus 训练95.695.184.1
Qwen-RobotManip (无 arXiv, Table 4)π0baseline53.6
π0.5baseline84.4
Qwen-RobotManip本文89.0
Qwen-RobotManip-Context本文91.4
备注:MINT LIBERO-Plus 7 维(Camera/Robot/Lang./Light/Back./Noise/Layout)逐维数值见 out_06 Table II(此处仅摘 Camera、Light 两列)。

8. ManiSkill

3 篇(LRM、HSAT-AT、ViTaS)。指标为成功率(部分 0–1,部分百分数),任务数各异。数值均为各论文自报。
论文方法原表标注Avg SR
LRM (2603.16065, 3.6, 长视野)Qwen3-VL-8B zero-shotbaseline56.88
LRM (Task Completion Reward)所提方法60.93
ViTaS (2602.11643, Table I, 12任务IL)ACT65.7
DP71.5
ViTaS所提方法91.4
ViTaS (2602.11643, Table III, 泛化)DP54.9
ACT67.8
ViTaS所提方法85.7
HSAT-AT (2504.15215, Table 2, 3任务)LfpVQ-VAEbaseline0.84
HSAT-AT所提方法0.89

9. COLOSSEUM

2 篇(SAM2Act、ActiveVLA)。两篇指标不同:ActiveVLA 报平均成功率(%);SAM2Act 报平均性能下降(%)(越接近 0 越鲁棒)。数值均为各论文自报。
论文方法原表标注指标值
ActiveVLA (2601.08325, Table 2, 14场景, Avg SR%)前 SOTA基线64.0
ActiveVLA所提(Avg Rank 1.3)65.9
SAM2Act (2501.18564, Table 5.2, 20任务, 性能下降%↓)RVT-2baseline-19.5
SAM-Ebaseline-19.1
SAM2Act所提方法-4.3 (std 3.6)
备注:ActiveVLA 分项 MO-SIZE 72.4 / Camera Pose 78.3。

10. Meta-World

2 篇(MINT、LA4VLA;含 "MetaWorld" 拼写)。指标为分难度成功率(%),Avg 为难度档均值。数值均为各论文自报。
论文方法原表标注EasyMediumHardVery HardAvg
LA4VLA (2606.27295, Table 4)No pretrain (Base)baseline69.73
VLA消融79.78
LA消融83.00
LA-VLA消融86.75
MixPT所提方法87.53
MINT (2603.08602, Table I)Diffusion Policybaseline23.110.71.96.110.5
TinyVLAbaseline77.621.511.415.831.6
π0baseline77.951.853.320.050.8
MINT-4B本文82.172.458.356.067.2

11. Push-T

2 篇(DCDP、DDP-WM)。DCDP 报动态仿真三设置成功率;DDP-WM 报 DINO-WM 框架下 MPC 成功率(单值)。数值均为各论文自报。
论文方法原表标注静态恒定扰动随机扰动
DCDP (2603.01953, Table I)Open-loop (H=8)开环基线88.458.252.8
Closed-loop (H=1)单步重推理84.676.161.6
Temporal Ensemble加权平均81.065.857.3
DCDP (H=8)所提方法92.577.671.9
DDP-WM (无 arXiv, Table 1, MPC SR 单值)DINO-WM密集 SOTA 基线91%
DDP-WM所提方法98%+
备注:DCDP 推理延迟(ms/step):Open-loop 7.05 / Closed-loop 53.60 / Temporal Ensemble 53.74 / DCDP 7.39(Table II)。DDP-WM 报 MPC 决策提速 ~9.2×。

12. LIBERO-10 / LIBERO-LONG

2 篇(UWM、Cosmos3),均为非标准四套件设置(LIBERO-10 / LONG 的具体子任务或快速适应)。数值均为各论文自报。

UWM (2504.02792, LIBERO-10/LONG 5 子任务, 3seed 均值)

方法原表标注Book-CaddySoup-CheeseBowl-DrawerMoka-MokaMug-Mug平均
DPDiffusion Policy0.73±0.100.88±0.020.77±0.020.65±0.030.53±0.050.71±0.12
PAD共享timestep扩散0.78±0.040.47±0.040.74±0.050.59±0.080.25±0.040.57±0.19
GR1masking token 生成0.77±0.030.65±0.050.62±0.030.46±0.040.38±0.050.58±0.14
UWM所提方法0.91±0.070.93±0.010.80±0.020.68±0.020.65±0.010.79±0.11

Cosmos3 (2606.02800, LIBERO(-10) 快速适应, SR%)

方法原表标注成功率
Cosmos3 MT-init (2000 iter)所提97.4
Cosmos3 MT-init (500 iter)消融24.6
Cosmos3 PT-init (500 iter)消融0.0

13. LIBERO-90

1 篇(KI-VLA,无 arXiv)。LIBERO-90 单策略聚合成功率(0–1)。
方法原表标注Avg (LIBERO-90 聚合)
OpenVLA-OFT自回归离散动作基线~0.50
HybridVLA混合离散+连续~0.50
π₀-FAST自回归VLA+FAST0.73
KI-VLA (Ours)知识隔离+co-train0.815
备注:四子集逐项数字文档为占位,无法提取。

14. LIBERO-Object

1 篇(ICLR / Visual Reasoning ICL,2603.07530)。Object 套件的 4 环境 ICL 变体,平均成功率(%)。
方法原表标注Avg
ICRTbaseline44.44
TO (仅推理用推理)消融54.00
TD (Teacher Dropout)消融54.44
ICLR (Ours Dropout)所提方法70.89

15. LIBERO-PRO

1 篇(VLS,2602.03973)。LIBERO 的 OOD 扰动变体,报 Task 扰动 / Position 扰动 / Overall 平均(%)。
协议提醒:这里不是“LIBERO-PRO 训练后在 LIBERO-PRO 测试”。VLS 使用冻结 base policy 做 training-free 推理时 steering;π0.5-LeRobot ckpt 来源为 huggingface.co/lerobot/pi05_libero_finetuned。测试为 LIBERO 四套件上的 Task / Position 扰动,每任务 20 episodes。
方法原表标注Task扰动 AvgPosition扰动 AvgOverall Avg
OpenVLA0.000.000.00
π00.000.000.00
π0.50.7520.7510.75
π0.5 (LeRobot)23.1324.2523.69
π0.5 (LeRobot) + VLS所提方法38.5035.1336.81

16. LIBERO(reasoning/OOD 变体,SEAL)

1 篇(DWYS / SEAL,2510.16281v2)。使用 LIBERO 的 reasoning 标注扩展与自建 OOD/Compose 变体,非标准 Spatial/Object/Goal/Long 四分类,按原表设置列出,SR%。
协议提醒:本节同时包含 ID、Compose 和 LIBERO-10 OOD 维度,不能把整节统一看成 IID 或 OOD;模型视图会保留列名并按行/小节标注分布关系。

ID & Compose (Fig. 2a)

方法原表标注10-R(ID)10-Compose100-Basket-R(ID)Basket-Compose100-R(ID)100-Compose
π0vanilla VLA901485118516
π0-V-GPSruntime steering921889138716
π0-reasonreasoning VLA9686238938
SEAL所提方法9694269753

LIBERO-10 OOD 鲁棒性 (Fig. 4)

方法原表标注IDLang-RephraseLang-Object-PropertyVisual-SceneVisual-Viewpoint
π0vanilla VLA8573818428
π0-V-GPSruntime steering8771818324
π0-reasonreasoning VLA89869191
SEAL所提方法9795919845
附:VLS(2602.03973) 的 CALVIN 变体(任务组 MovableObjects 94 / ArticulatedParts 87,非 1–5 链长)亦为非标准设置,详见 §20。

17. GenBench

1 篇(ActiveVLA,2601.08325)。4 级泛化(16 train + 44 test),SR%。
协议提醒:L1-L4 是泛化等级,不是同一个 IID 测试集;Avg 混合了不同泛化难度。
方法原表标注L1L2L3L4Avg
3D-LOTUS基线90.0
ActiveVLA所提方法93.492.446.345.153.1
备注:ActiveVLA L1 数值由 "比 3D-LOTUS +3.4pp" 反推(原注)。

18. DexMimicGen

1 篇(GR00T-N1,无 arXiv)。灵巧手 10 任务平均,SR%。
方法原表标注Avg SR
GR00T N1 (2B)所提方法72.8

19. 真机实验(按论文/平台)

各论文真机平台与任务各异,不合并,每篇一小块。数值均为各论文自报,成功率单位/形式(%、x/N、0–1)保留原文。近似/图估值保留 `~`/`(图估)` 标注。粗体为所提方法。

ACT (2304.13705) — ALOHA 双臂 ViperX(成功率%)

方法原表标注Slide ZiplocSlot BatteryOpen CupThread VelcroPrep TapePut On Shoe平均
ACT每任务50演示9210010096726487

SuSIE (2310.10639) — WidowX 250 / BridgeData V2(成功率)

方法原表标注Scene AScene B(未见)Scene C
LCBC语言条件 BC0.20
RT-2-X55B VLA(18×数据)0.000.75
SuSIE1/18 数据0.870.500.88

UniPi (2302.00111) — WidowX / BridgeData V2(视频质量+成功率)

方法原表标注CLIP↑FID↓FVD↓Success↑
UniPi (No Pretrain)无预训练24.4317.75288.0272.6
UniPi (Pretrain)14M 视频文本预训练24.8318.45244.6677.1

SayCan (2204.01691) — Everyday Robots 移动操作臂(规划/执行 SR%)

方法原表标注Mock PlanMock ExecReal PlanReal Exec
No VF仅 LLM 打分67
Generative生成式 LLM+USE74
BC NL端到端 BC0
SayCanLLM×价值函数84748160

DiffusionPolicy (2303.04137) — UR5 单臂 / Franka 双臂(20 trials/任务)

方法任务成功率副指标(vs人类)
IBCPush-T0%
LSTM-GMMPush-T20%
Diffusion PolicyPush-T95%IoU 0.80 vs 0.84
Diffusion PolicyMug Flip90%
Diffusion PolicySauce Pour79%覆盖率0.74 vs 0.79
Diffusion PolicySauce Spread100%覆盖率0.77 vs 0.79
Diffusion PolicyEgg Beater(双臂)55%
Diffusion PolicyMat Unrolling(双臂)75%
Diffusion PolicyShirt Folding(双臂)75%

DISCO (2406.09767) — Franka 抓取(20 trials/物体)

方法单物体-Seen单物体-Unseen多物体-Seen多物体-Unseen
GoalDiff0.100.000.050.00
Vanilla inpt.0.550.150.300.05
DISCO0.850.650.650.25

GHIL-Glue (2410.20018) — Bridge V2 / WidowX250 zero-shot(x/30)

方法Sushi On TowelRed Bell Pepper in BowlOpen DrawerSushi in Bowl
OpenVLA (7B)22/3014/3023/3015/30
SuSIE19/3012/3019/3015/30
GHIL-Glue (SuSIE)28/3016/3022/3018/30

HATO (2404.16823) — 2×UR5e + 2×Psyonic Ability Hand(10 trials)

方法原表标注HandoverStackingPouringServing
Visuotactile DPSuccess10/1010/109/105/10
Visuotactile DPPickup10/1010/1010/1010/10

(模态/相机消融见 out_01 Table II–IV:w/o Vision 在稀有初始化 0/10;仅第三视角 0/10 等。)

MimicTouch (2310.16917) — peg-in-hole(25 trials)

方法原表标注成功率ActionMSE
NN-based (本文)人手触觉演示40% (10/25)0.21
MULSA人手触觉演示16% (4/25)1.53
NN-basedSpaceMouse遥操作12%
人手触觉+RL (本文)3h 残差RL微调96% (24/25)
SpaceMouse+RL3h32%
Hand-guided+RL3h60%

OpenVLA (2406.09246) — Franka-Tabletop(微调/量化对比)

方法原表标注成功率训练参数VRAM
Full FT全量微调69.77.2B163.3 GB
Last layer only仅最后层30.3465K51.4 GB
Frozen vision冻结视觉47.06.8B156.2 GB
Sandwich62.1914.2M64.0 GB
LoRA r=3268.297.6M59.7 GB
bfloat16量化对比71.315 GB
int4量化71.97.0 GB

MS-Bot (2408.01366) — 倒豆误差(g,越小越好) / 键槽装配(表1)

方法倒豆·初始90倒豆·初始120倒豆·目标40倒豆·目标60装配成功率
Concat4.80±1.148.72±2.398.40±2.216.54±2.145/10
Du et al. [63]4.32±1.227.79±2.118.54±2.046.26±2.015/10
MULSA [11]3.05±1.016.42±1.987.12±1.664.19±1.246/10
MS-Bot1.60±1.105.58±1.796.48±1.551.80±0.958/10

ViSk (2410.17246) — xArm 7(得分/10, 每配置30次)

任务Vision-only(最佳)ViSk(最佳)
Plug Insertion3.66.6
USB Insertion2.35.6
Card Swiping3.37.0
Book Retrieval3.35.3

Vid2Robot (2403.12943) — Google Robot(整体 SR)

方法Robot promptsHuman prompts
BC-Z32.9%14.5%
Vid2Robot54.2%34.5%

ViTaL (2024, 无 arXiv) — Franka + GelSight(USB Plugging / Cube Stacking,文中散述)

方法原表标注成功率
Vision-only(无预训练) ACTUSB20%
Vision-only+预训练 ACTUSB45%
Vision+Tactile+预训练 ACTUSB95%
Vision+Tactile+预训练 DPUSB95%
Vision-only+预训练 ACTCube Stacking30%

3D-ViTac (2410.24091) — 双臂遥操作(长horizon 完成率,Table 1)

方法Egg CookingFruit PrepHex KeySandwich
PC w/ Tactile Points (Ours)0.850.800.950.85

(3 基线文档中为定性,填 —。)

AdapTac (2505.13982) — Flexiv Rizon 4 + Leap Hand(Table I)

方法原表标注Open BoxReorientationFlipAvg
RISEvision only90%90%40%73%
3DTacDex-Pconcat30%60%30%40%
FoARthreshold20%90%40%50%
AdapTac (Ours)100%90%90%93%

AnyPlace (2502.04531) — 单臂 eye-in-hand RGBD(物体放置)

方法Insert vialHang ringStack battery
NSM0%60%0%
RPDiff0%60%0%
AnyPlace80%80%80%

ConRFT (2502.05450) — 单臂 + Octo-small VLA(8任务平均)

方法原表标注平均成功率
SFT监督微调基线39.4%
Cal-ConRFT (仅离线)39.4%
ConRFToffline+online96.3%

DreamVLA (2507.04447) — Franka Panda(Table 3, pick/place/drawer)

方法Pick AvgPlace AvgDrawer AvgTask Avg
Diffusion Policy60.045.037.550.8
Octo-Base55.045.035.045.0
OpenVLA45.025.035.035.0
DreamVLA82.580.067.576.7

ContextVLA (2510.04246) — Franka Research 3 / Realman RM-65B(Table 4)

任务单帧 baselineContextVLA
PnP Twice (full success)2565
CoverNStack (partial)6080

DexNDM (2510.08556) — LEAP Hand in-hand rotation(Palm-Down,Rot,rad)

方法RegularSmallIrregular
Direct Transfer9.844.714.41
DexNDM11.365.246.35

DualActor (2509.13774) — bolt 三阶段(3 tasks avg,Table I)

方法原表标注Avg Success(%)
HiL-CorRFT [12]单任务 RL 微调12
HG-DAgger [18]BC 修正22
DSRL [20]latent RL 精修40
DualActorours (101min 在线)100

Motus (2512.13030) — AC-One 单臂(11任务) / Agilex-Aloha-2 双臂(6任务)(部分成功率)

方法单臂 部分SR双臂 部分SR
π0.540.6048.60
Motus w/o Pretrain67.4349
Motus80.4859.30

mimic-video (2512.15692) — 双臂灵巧手 Franka×2 + 16-DoF hand

方法PackingPackage handover
DiT-Block Policy11.050.0
DiT-Block Policy [+wrist cams]42.674.1
mimic-video72.093.0

LAPA (2410.11758) — Franka Emika Panda(3任务 Avg SR)

方法原表标注Avg SR
Scratchbaseline21.2
OpenVLA (Open-X)baseline43.9
LAPA (Open-X)所提50.1
ACTION VLA (Bridge)baseline32.6
OpenVLA (Bridge)baseline30.8
LAPA (Bridge)所提36.8
LAPA (Human Videos)所提34.0

ForceVLA (2505.22159) — Flexiv Rizon 7-DOF(5 contact-rich 任务)

方法Insert USBInsert PlugPump BottleWipe Board-1Wipe Board-2Peel CucumberAverage
pi0-base w/o F4525672552037.3
pi0-base w/ F4530642553340.2
pi0-fast w/o F2525604503131.0
pi0-fast w/ F0094502714.2
ForceVLA100809383104060.5

(泛化实验见 out_02 4.2:ForceVLA Average 63.78。)

OmniVTLA (无 arXiv) — UR5 + 夹爪 / DexH13 灵巧手(pick-and-place SR)

方法原表标注UR5+夹爪 SRUR5+DexH13 SRDP backbone SR
π0 (VLA)baseline75.093.8
VTLA-Pre消融84.4
VTLA-SA消融87.5
DP (视觉)baseline59.4
DP + 触觉所提78.1
OmniVTLA所提96.9100

pi0.5 (2504.16054) — 双臂移动操作臂(未见家庭多阶段家务,近似值)

方法items in drawerdishes in sinklaundry basketmake bed
π0.5~70~65~55~40
baseline 逐任务数值文档未给(原注)。

FACTR (2502.17432) — Franka Panda(4 contact-rich,未见物体泛化)

方法Box LiftPivotFruitDough平均
ACT (Vision-Only)19/6021/504/150/1021.3%
ACT (Vision+Force)35/6038/5011/157/1061.2%
FACTR55/6038/5014/158/1087.5%

FBI (2508.14441) — Shadow Hand 灵巧手内操作(Table II)

方法In-hand ReorientationIn-hand PushAverage
DP310.025.0
ManiCM25.010.0
FBI (Vision-Only)45.030.0
FBI (Visuotactile)45.020.035.0

FoAR (2411.13753) — Rokae Rizon(contact-rich ASR)

方法WipingWiping(General)Peeling
ACT0.275
Diffusion Policy0.400
DiffuseBot0.5000.500
RISE (force-token)0.5750.4000.487
RISE (force-concat)0.4250.4000.523
FoAR (3D-cls)0.4750.200
FoAR0.8750.8500.756

ICRT (无 arXiv, ICRA 2025) — Franka Panda(Pick-and-Place distractor 泛化)

方法1 distractor2 distractors3 distractorsAverage
Goal Condition33.39.720.0
Octo30.013.35.7
OpenVLA11.733.373.3
ICRT60.053.379.375.2

LVP (2512.15840) — Franka + G1(逐任务成功次数/试验数)

方法Pick ObjectsPick A into BOpen DrawerPress Button
OpenVLA0/100/100/100/10
pi03/101/101/100/10
LVP5/103/102/104/10

MimicDroid (2509.09726) — GR1 人形双臂 few-shot(320k 帧)

方法L1L2
MimicDroid (128 帧)3521
MimicDroid (320k 帧)5945

pi0.6 / RECAP (无 arXiv) — Café/Box/Laundry(Figure 图读数,正文无精确表)

方法关键读数
RECAP (π₀.6)Laundry T-shirt ~60%→~90%;Box assembly ~50%→~90%;Espresso 连续运行15h
π₀ 预训练 / offline RL 基线正文无精确数字。

FAST (2501.09747) — 多真机任务(Figure 6/9/11)

方法关键数值
Naive binning高频任务(Table Bussing 20Hz, T-Shirt Folding 50Hz) 0% 成功率
π₀-FAST匹配 diffusion π₀,训练省 5× GPU hours;DROID 首个 zero-shot(无精确成功率)

HiRobot (无 arXiv) — Bimanual ARX, Table Bussing(Instruction Accuracy)

方法原表标注IA
GPT-4o(高层)+flat VLA未微调通用VLM~62%
Flat VLA with synthetic data~62%
Hi Robot without synthetic data分层无合成~79%
Hi Robot (full)层级+合成数据93%

HumanToRobotVLA (无 arXiv) — 桌面操作(4项泛化平均,图读数)

方法平均成功率(4基准)Eggs 排蛋
robot-only~35%57%
co-training (human+robot)~71%平均多放4个蛋

KI-VLA (无 arXiv) — static single-arm + mobile manipulator(图占位,无精确数)

方法数值
KI-VLA (Ours)items in drawer 性能与语言跟随均超所有 baseline(无精确数字)

RTC (无 arXiv, NeurIPS 2025) — 双臂6-DoF(吞吐 tasks/min)+ Kinetix 仿真(solve rate,图读数)

方法+0ms+200msKinetix Solve Rate
Synchronous~0.75~0.55
TE停机~0.45
Naive async~0.50
BID~0.60
RTC~0.85~0.80~0.70

RDP (2503.02881) — Flexiv Rizon 4(整体 All 分数)

方法PeelingWipingLifting
DP0.44
DP + tactile emb0.48
DP + tactile img0.48
RDP (GelSight)0.710.950.93
RDP (MCTac)0.630.94
RDP (force)0.590.650.90

RDT-1B (2410.07864) — ALOHA 双臂(成功率%,零/少样本)

方法Wash Cup(seen/u1/u2)Pour WaterHandover(5-shot)Fold Shorts(1-shot)Robot Dog
ACT0/0/00–12.50032
OpenVLA0/0/00–12.5
Octo0/0/00–12.5
RDT-1B50/75/5062.5/100/62.5406848

SAM2Act (2501.18564) — Franka Emika Panda(成功试次 ID/OOD,Table 5.4)

任务RVT-2 (ID/OOD)SAM2Act (ID/OOD)
Turn on lamp0/06/6
Push buttons4/19/9
Stack cubes8/38/3
Push same button4/27/6
总计16/6 (43%)30/24 (75%)

SaTA (2510.14647) — RealMan + Sharpa Wave(SR/FC,Table I)

方法Card SlidingUSB-C MatingBulb InstallAvg (SR/FC)
Vision-Only50/100/045/3531.7/15.0
Tactile-Flat60/450/070/4043.3/28.3
Tactile-Global65/3010/065/4546.7/25.0
SaTA95/5535/30100/6076.7/48.3

SparshX (2506.14754) — Franka + Allegro + 4×Digit360(Peg Insertion, Fig.8)

方法成功率
Vision-only~0%
Sparsh-X (全模态)~90%

STS-IL (2311.01248) — Franka + STS(4门操作,消融相对提升)

配置平均成功率变化
+ Tactile Force Matching+62.5%
+ Learned Mode Switching+30.4%
+ STS 作为策略输入+42.5%
STS-IL (综合)+64.2%(最佳配置绝对值 ~85% 估读)

SwiftVLA (2512.00903) — AgileX PiPER 单臂(SR)

方法Clean the DeskThrow the BottleStack BowlsAvgFold the Cloth
SmolVLA0.340.05
π00.610.45
SwiftVLA0.860.800.740.800.60
SwiftVLA (4D)0.820.65

TacThru (2512.09851) — 改装 UMI + TacThru/GelSight(5任务成功率)

方法PickBottlePullTissueSortBoltHangScissorsInsertCapAvg
Wrist95%40%36%50%55%55.4%
GS-M95%50%55%60%55%66.3%
TT100%90%79%60%55%76.8%
TT-M100%90%83%80%75%85.5%

TactileAloha (无 arXiv, RA-L 2025) — ALOHA 双臂 + GelSight(子任务 SR%,Table I)

方法Zip Tie GZip Tie AZip Tie IVelcro GVelcro AVelcro F
Diffusion Policy60200703015
ACT80305904530
ACT with Normals75355854030
ACT with Tactile807525959585
Ours90903510010090

TactileVLA (2507.09160) — Franka Panda(USB/Charger 插入,Table 1)

方法USBCharger
π₀-base540
π₀-fast025
Tactile-VLA3590

TA-VLA (2509.07962) — Cobot Magic ALOHA(接触丰富/常规任务, x/20,Table 5)

方法接触丰富(x/20)常规(x/20)
ACT0 ~ 1212 ~ 16
RDT0 ~ 1012 ~ 17
π₀0 ~ 1614 ~ 17
π₀ + obs13 ~ 1913 ~ 18
π₀ + obj10 ~ 1914 ~ 17
π₀ + obs + obj15 ~ 1917 ~ 19
可确证:Charger Plugging π₀ 0/20 → 17/20;Door Handle Turning 0/20 → 15/20。

TiW (2507.15062) — XArm 850 + 柔性压阻触觉阵列(20 试验/任务)

任务Vision-Only完整方法(w/ Pretraining)
Test Tube Collection2585
Pencil Insertion4585
Fluid Transfer5590
Whiteboard Erasing5570

TLA (2503.08548) — GelStereo 2.0 + 夹爪(peg 插入,Table III/IV)

方法总成功率(%)总平均步数
BC313.68
DP403.83
SP-TLA883.76
MP-TLA903.56

UniSkill (2505.08787) — Franka Panda 桌面(5任务)

方法Franka promptHuman prompt
GCBC6061
XSkill110
UniSkill8381

(厨房基准 Franka/Human/Anubis prompt:GCBC 33/33/33;UniSkill 87/54/48。)

UniT (2408.06481) — ALOHA 双臂模仿学习(成功次数,Table V)

方法Chicken Legs HangingChips GraspingAllen Key Insertion
Vision-Only9/158/1515/30
Visual-Tactile (from Scratch)17/30
UniT (Visual-Tactile)13/1514/1523/30

UWM (2504.02792) — DROID / Franka Panda(成功率,a→b = pretrain→co-train,ID/OOD)

方法Stack-BowlsBlock-CabinetPaper-TowelHang-TowelRice-Cooker
Diffusion Policy0.48/0.360.60/0.260.52/0.480.64/0.280.35/—
PAD0.08→0.20/0.08→0.120.00→0.00/0.00→0.000.42→0.42/0.34→0.440.52→0.54/0.30→0.380.00/0.00
GR10.66→0.62/0.48→0.380.66→0.74/0.44→0.640.60→0.46/0.60→0.460.66→0.66/0.48→0.440.40/0.25
UWM0.86→0.92/0.76→0.840.76→0.84/0.60→0.720.78→0.86/0.78→0.840.82→0.86/0.64→0.760.60/0.65

ViTacFormer (2506.15953) — Realman 双臂 + SharpaWave(短horizon,次/10,Table 1)

方法Peg InsertionCap TwistVase WipeBook Flip
DP2/100/103/101/10
ACT4/104/103/102/10
HATO3/101/104/103/10
ACTw/T6/106/104/104/10
ViTacFormer10/1010/109/109/10

(长horizon 做汉堡 11阶段 HNS:w/o Touch 0.61;ViTacFormer 0.88。)

ViTaLPrecise / ViTaL (2506.13762) — xArm 7 + AnySkin(In-domain,次/10,Table 1)

方法Plug SocketUSB InsertCard SwipeKey LockPick Bread
BAKU4/104/101/105/1010/10
ViSK7/103/104/105/1010/10
RLPD3/100/102/101/1010/10
ViTaL-BC7/104/105/105/1010/10
ViTaL9/109/1010/109/1010/10

ViTaMIn (2504.06156) — Rokae xMate ER3PRO + AllTact(5任务,20 trials,Table II)

任务Vision-onlyw/o Pre-trainingOurs (Full)
Orange Placement0.650.90
Test Tube Reorientation0.400.700.70
Dynamic Peg Insertion0.100.450.85
Scissor Hanging0.100.450.70
Knife Pulling (双臂)0.600.80

V-JEPA2 (2506.09085) — Franka Emika Panda 零样本(Avg)

方法Grasp ReachGrasp CupGrasp BoxReach w/ ObjPick-&-Place
Octo100%13%0%13%/70%13%/10%
V-JEPA2-AC100%63%73%23%/80%63%

VTInsertion (无 arXiv, RA-L 2025) — Kinova Gen3 + OpenHand + AllSight(11物体,成功率范围)

方法成功率范围
Teacher~92.4% (仿真, 上界)
Visual-PCL55–80%
Visuotactile80–95%(训练物体) / 75–90%(新物体)

VTLA (2505.09577) — UR3 + GelStereo 2.0 Sim2Real 零样本(peg-in-hole,20 trials)

设置成功率平均步数
VTLA (方形 1.6mm)100%1.60
VTLA (方形 1.0mm)100%1.95
VTLA (方形 0.6mm)95%4.31
VTLA (三角 0.6mm)95%3.94
VTLA (五边 0.6mm)100%1.85
VTLA (OOD 五边 0.6mm)100%5.20
VLA (无触觉, 三角0.6mm)90%4.06
TLA (无视觉, 三角0.6mm)30%2.00

VT-Refine (无 arXiv, RSS 2025 WS) — 双 Franka + 3D-ViTac(plug-socket 装配)

方法TabletopBimanual
Vision-Only (Pre-Train)0.20/0.35
Vision-Only + Fine-Tune0.65
Visuo-Tactile (Pre-Train)0.40/0.50
Visuo-Tactile + Fine-Tune0.800.75

VT-TermRL (无 arXiv, Frontiers 2025) — Franka + XENSE G1-WS(PLC 终端装配,100 随机位姿)

方法成功率训练时间示范数
RLPD+VT (Ours)100/10055 min30
RLPD w/o demo32/100265 min0
BC9/100105 min150
TD30/100285 min0

AdaVTF (2604.01414) — Franka Panda + 关节力矩(3接触任务,Table I)

方法Egg BoilerBottleConnector平均
Vision-only8/207/2012/2030.9%
Feature Concat3/209/1012/2053.3%
Torque Gating14/205/1015/20<1%
Auxiliary Goals8/201/107/2028.6%
MoE5/201/1011/2024.0%
MoE w/o torque enc18/201/1011/2054.0%
Ours6/208/1019/2082%
原表"平均"列为作者加权平均,Torque Gating 的 <1% 保留原文标注。

AHEAD (2606.02486) — UFactory xArm 7(5动态任务,Table 4)

方法传送带(静→移)传送带(移→静)球拍打球停滚球接抛射物
AHEAD30/3029/3023/3030/3019/30
所有 baseline0/30

ARRO (无 arXiv, RA-L 2026) — FR3 域偏移评测(成功/相对性能,Table I/Fig.6-7)

方法/设置成功率
real-to-real vanilla (DP)90%
real-to-real vanilla (Octo)50%
real-to-real vanilla (OpenVLA)40%
real-to-real vanilla (π0)100%
real-to-sim vanilla (OpenVLA)0%
real-to-sim ARRO (OpenVLA)55%
real-to-sim masking (π0)94%
π0 语言引导 vanilla / Masked / ARRO30% / 70% / 90%

AT-VLA (2605.07308) — AgBot Genie1 双臂(4接触任务,Table 1)

方法Unzip BagStampAVG(contact)
GO-10.200.130.22
τ0.50.200.200.13
VTLA0.000.130.13
RDP0.400.40
AT-VLA0.330.460.50

(非接触任务 Pick&Place/Open Drawer:GO-1 与 AT-VLA 均 0.93/0.87。)

CRAFT (2602.12532) — leader-follower 双臂(Table I/II)

方法Wipe WhiteboardShaft-to-Hole平均/相对
π0-base13.5%基线
π0-base + CRAFT66.7%+35.36pp
RDT8.5%22.66%
RDT + CRAFT38.1%48.32%
泛化: 基线 VLA → +CRAFT22.50% → 88.75%

DECO (2602.05513) — Unitree H1-2 双臂灵巧手(4场景,Table 1)

方法全任务平均接触密集任务平均
ACT57.25%19.38%
DP51.25%28.13%
DPt56.75%33.13%
DECO (无触觉)72.25%53.13%
DECO_p (+触觉adapter)82.50%73.13%

DIAL (无 arXiv) — IRON-R01-1.11 人形(跨体学习)

方法ID SROOD SR
GR00T-Qwen2.517.5~0
GR00T-Qwen2.5 +FLARE50.0
DIAL 去人类数据55.026.7
DIAL77.558.3

DeFI (无 arXiv) — Franka Panda(8 tasks,成功率%)

方法PlaceOpenCloseCutStack BowlStack CubeStack BottlePourAvg
DeFI9075100808070807581.3
DP704070504535403548.2
OpenVLA504065403035454543.8

DiT4DiT (2603.10448) — Unitree G1 人形(7任务,成功率%)

方法Arrange FlowerStack CupMove SpoonDrawerBox Packing
DiT4DiT7560409050
GR00T-N1.5252515
Qwen3DiT0<10<1000

DiffusionVS (2606.19397) — AUBO-i5 视觉伺服(30 trials)

方法SR(%)TE(cm)RE(°)
Regression0
Diffusion (Ours)93.36.173.76

DreamTac (2606.08737) — Franka Panda + Xeno Photon(6接触任务平均)

方法平均成功率
π115.4%
Common Policy31.6%
ForceVLA68.7%
Dream-Tac83.3%

DreamTacVLA (无 arXiv) — Dobot X-Trainer 双臂 + GelSight(100 trials/task,Table 1)

方法Peg-in-HoleUSB InsertGear AssemblyTool StabilizationAvg
ACT35.2
Diffusion Policy35.5
π₀45.7
No HSA, Dream-Only75.4
HSA-Only, No Dream60.8
DreamTacVLA95.0±0.285.7±0.681.1±0.474.6±0.595.0

(IsaacSim 数字孪生 Table 4:DreamTacVLA 98.6/97.9/95.2/94.7。)

DreamZero (无 arXiv) — AgiBot G1 / DROID-Franka(Task Progress %,Fig.8/9)

方法Seen TasksUnseen TasksDROID TP / SR
GR00T N1.6 / π0.5 (scratch)27.4<1
pretrained VLA27.416.3
DreamZero (WAM)62.239.549 / 22.5

(跨具身:Robot-to-robot 54.3、Human-to-robot 55.4。)

EDIL (无 arXiv, IEEE TII) — 2×RealMan 6-DOF 双臂(SR%)

方法AirPods AllAirPods AvgiWatch AlliWatch Avg
ACT1638.41642.4
InterACT2850.42047.2
EDIL5265.64064.8

Ego-Pi (2506.03071) — Galaxea R1 Pro 双臂灵巧手(SR%)

方法番茄分拣装箱包装
纯机器人数据402530
简单 co-train927276
+ Subtask928590
Ego-Pi (+ Skeleton)969096

EgoScale (无 arXiv) — Galaxea R1Pro 22-DoF 灵巧手(Task Completion)

方法平均完成率
无预训练 (from-scratch)~0.30
EgoScale (20K h)~0.71

(one-shot:Fold Shirt 0.85、Unscrew Bottle 0.92;跨具身 Unitree G1:Pen in Bin 0.88、Dish in Rack 0.50。)

FAVLA (无 arXiv, ICML 2026) — Moto 单臂 + 6轴力传感器(SR%,Table 1)

方法USB InsertionGear AssemblyBoard WipingAvg
π₀43.7
ForceVLA66.7
FAVLA85807580.5
π₀≈43.7、ForceVLA≈66.7 为反推值(原注)。

FG-CLTP (无 arXiv) — Insta Y1 + 双 DM-Tac M(SR%,Table IV)

方法Tube InsertionWipe BoardHandwriting
ACT45.965.045.9
DP75.065.050.0
3D-TLA (FG-CLTP)85.975.960.0

ForceVLA2 (2603.15169) — Flexiv Rizon 4s + 6D力传感器(SR%,Table 1)

方法Press bottleClean vaseClean boardRetrieve plateAssemble gearsAvg
π035.020.035.00.00.018.0
π0.545.030.045.015.020.031.0
ACP25.030.025.00.00.016.0
π0 w/ F30.025.020.010.00.017.0
ForceVLA70.025.055.015.010.035.0
ForceVLA280.075.070.035.070.066.0

ForeAct (2602.12322) — Galaxea R1 Lite(11任务平均 SR%)

方法π0 backboneπ0.5 backbone
π0 / π0.546.770.3
VLM + π057.1
ForeAct87.488.2

G0.5 (无 arXiv) — R1-Lite / R1-Pro(6设定平均)

方法Avg SRProcess Score
GR00T-N1.724.468.9
π0.553.3105.2
G0.576.7129.2

(G0.5 另报 BEHAVIOR-1K 31.4 / DROID 零样本 82.5,见 §20。)

GigaBrain-0.5M* (2602.12099) — RoboChallenge(30任务,20台真机,SR%)

方法Avg
π0.542.67
GigaBrain-0.1 (中间版)51.67

(内部评估 Juice Prep:GigaBrain-0 90 → GigaBrain-0.5 100。)

GigaWorld-Policy (2603.17240) — AgileX PiPER(4任务真机 SR)

方法真机 SR
Cosmos-Policy0.58
GigaBrain-00.68
π0.50.69
Motus0.76
GigaWorld-Policy0.83

Goal-VLA (2506.23919) — UFACTORY xArm 7(4任务 SR%)

方法Tomato PlacementTable SweepingWeighing DuckBottle Stand-UpAvg
OpenVLA00000
MOKA501030022.5
MolmoAct50060027.5
Goal-VLA9040704060.0

HapTile (2606.04825) — UR5e + Robotiq 2F-85 + 定制触觉(模态消融 SR%,Table 2)

方法原表标注Turning bottleWiping whiteboardPouring liquidPeg insertion
Diffusion PolicyV-only80804040
Diffusion PolicyV+T808090
Diffusion PolicyV+TM9050
Diffusion PolicyV+T+TM6050060
π0V-only000
π0V+T650
π0V+TM100
数据集论文,多处配置未测试填 —,按原表登记。

HTD (2604.13015) — 全身人形 + 双灵巧手触觉(5任务,Table II/Fig 6)

方法Insert-T
ACT (Visual+Proprio+Touch)50.0
HTD93.3

HumanEgo (2605.24934) — Trossen WidowX AI 双臂(4任务 SR%)

方法Serve BreadDownstack CupsWater FlowersAdjust Table平均
EgoZero5.00.010.00.03.8
SPOT45.035.047.545.043.1
ACT (Robot Teleop 30min)62.545.045.052.551.2
HumanEgo-1582.575.075.067.575.0
HumanEgo-3095.087.595.092.592.5

ICLR (2603.07530) — Franka Research 3(SR%,Table II)

方法Pick-and-PlacePoking
ICRT48.3325
ICLR (Ours Dropout)56.6770

InSight (2606.24884) — UFactory xArm(25 trials,主结果)

方法Twist Cap OpenPour BeansTwist-then-Pour(14 prim)
π0.5 (base)00
CaP-X32164
InSight929680

LA4VLA (2606.27295) — xArm6(3语言条件任务,20 trials,Table 5)

方法Press ButtonPlace BookPlace DrinkAvg
No pretrain60.015.040.038.3
VLA50.040.055.048.3
LA85.065.095.081.7
MixPT75.085.090.083.3

LingBot-VLA (2601.18692) — GM-100(100任务×3平台,SR/PS %,Table 1)

方法Agibot G1 SRAgileX SRGalaxea R1Pro SRAvg SRAvg PS
WALL-OSS2.992.266.894.0510.35
GR00T N1.65.233.2014.297.5915.99
Ours w/o depth12.8215.5014.9515.7433.69
Ours w/ depth30.4736.3032.4635.41

OASIS (2605.25829) — Franka Research 3 + Kinova Gen3(SR%,Table 4)

方法GoalSpatialLongAvg
ACT58.345.018.340.5
Seer-Large73.355.246.758.4
RDT81.766.760.069.5
π0.595.078.371.681.6
OASIS98.685.883.389.2

OmniVTA (无 arXiv) — xArm7 视触觉(6类70+任务,O+G 平均 SR%,Table III)

方法Avg SR (O+G)
ACT65.3
KineDex64.0
ForceMimic64.8
DP+tactile73.8
OmniVTA83.5

PACE (无 arXiv, CoRL 2026 投稿) — Realman RM75 插入(成功数/30,Table 1a)

方法Key2-pin3-pinUSBEthAvg(%)
Vision-only ACT4/304/302/301/304/3010.0
Vision-only DP5/306/304/303/305/3015.3
ACT + Tactile Cross-Attn10/3015/3011/309/3014/3039.3
ACT + Tactile Concat13/3017/3015/3013/3014/3048.0
PACE27/3028/3028/3027/3025/3090.7

Qwen-RobotManip (无 arXiv) — CobotMagic ALOHA(ID 成功数/5,Table 10)

方法table-cleanupthree-bowl-stackingmelon-in-bowltowel-foldingblock-in-draweryellow-disc-insertionthree-block-stackingAvg(%)
π0.54/55/52/54/50/50/50/542.9
StarVLA0/54/50/53/50/50/50/520.0
Qwen-RobotManip5/55/55/54/55/52/55/588.6

(OOD Table 11:π0.5 37.5、StarVLA 0.0、Qwen-RobotManip 87.5;RoboChallenge Table30-v1 Table 14:Qwen-RobotManip 成功率45 / process 59.83。)

Qwen-VLA (2605.30280) — ALOHA(平均 SR%)

方法In-domain AvgOOD Avg
GR00T N1.628.6
π0.571.641.5
Qwen-VLA83.676.9

REMAC (2601.20130) — Franka Research 3(DROID grasp-and-place 完成进度)

方法Grasp-EasyGrasp-MediumGrasp-Hard
Synchronous0.8050.7180.670
RTC0.8230.8480.753
REMAC0.9030.9430.812

ReTac-ACT (无 arXiv) — Realman RM75-6F(NIST ATB M1 轴孔装配,SR%)

方法0.1mm 间隙Level 2
DP0
pi00
ACT15
ReTac-ACT80100

RISE-WM (2602.11075) — AgiBot 双臂(3任务 成功率/评分,Table I)

方法Brick SortingBackpackBox Closing
π0.535.00 / 8.2830.00 / 4.2535.00 / 7.50
+ε-Dagger15.00 / 6.1930.00 / 7.0040.00 / 7.50
+PPO10.00 / 7.6835.00 / 5.8810.00 / 4.75
+DSRL10.00 / 6.6510.00 / 3.5010.00 / 4.75
RECAP50.00 / 9.0040.00 / 6.1360.00 / 8.13
RISE (Ours)85.00 / 9.7885.00 / 9.5095.00 / 9.88

SeeingToDoing / FSD (2505.08548) — xArm 6(8任务平均 SR%)

方法Avg
最强 baseline~42
FSD72

SelectivePerception (2602.15543) — 6-DoF 单臂多模态(3任务 SR%)

方法Task1(电池)Task2(线缆)Task3(阀门)Avg
Base Policy (仅RGB)10.0
w/ Multimodal (无路由器)30.69
w/ Router (本文)90.090.070.083.33

SynthICL (arXiv 2026.06) — Franka Research 3(16任务平均 SR%)

方法Avg
ICRT55
IP (Instant Policy)57
SynthICL (full)77

TacFiLM (2603.14604) — Franka Panda + DIGIT(ID 任务 SR%)

方法Circle-Peg 3mmCircle-Peg 2mmUSB Cable
OpenVLA-OFT73.3353.3350
TactileConcat86.6753.3366.67
TacFiLM93.3363.3383.33

(OOD:Square-Peg 2mm TacFiLM 100、Pentagon-Peg 93.33、HDMI 80。)

TacForeSight (2606.11184) — xArm7 + Robotiq + 双指Xene触觉 + F/T(5类接触任务,平均完成率%,Table I)

方法平均完成率
DP30
DP+Tactile+Force38
KineDex35
FoaR50
RDP65
TacForeSight79.0

TacVLA (2603.12665v1) — Franka Panda + 15×8 触觉阵列(SR%,Table II)

方法Disassembly AvgIn-Box Picking
3D Diffusion Policy + Tactile11.255
Diffusion Policy + Tactile48.750
Finetuned Pi0.563.7510
TacVLA83.7570

TacVLA2 (2603.12665v2) — Franka Panda(同论文 v2,SR%,Table II)

方法拆卸平均装箱
3D Diffusion Policy + Tactile5
Diffusion Policy + Tactile45
Finetuned Pi0.563.7510
TacVLA83.7570

TaF-VLA (2601.20321) — Franka FR3 + VBTS/GelSight + ATI Axia80(8任务平均 SR%,Table I)

方法平均成功率
ACT26.7
DP29.5
pi0.537.1
FreeTacMan42.8
DP + TaF-Adapter44.7
ACT + TaF-Adapter47.6
TaF-VLA64.8

τ₀-WM (2605, 未标全ID) — AGIBOT-G01/ARX/dual-arm Franka(Test-Time Computation 消融,成功率)

方法Time→BoxPin→BoxAvg
w/o TTC0.550.500.43
+ CFG0.250.150.30
+ ACG0.400.150.38
+ RCS0.650.350.50
+ RCS + LAR0.760.500.60
主对比表为条形图估读,τ₀-WM 标注为"最优"无精确数字,主结果填 —(原注)。

TouchGuide (无 arXiv) — Bi-Arx5 双臂 + Flexiv Rizon4(5任务平均 SR%,Table I)

方法DP3 base 平均π0.5 base 平均
Diffusion Policy (base)16.335.9
DP w/ Tactile Observation19.2
TouchGuide (Force)35.3
TouchGuide (Tactile Img.)36.258.0

T-Rex (2606.17055) — Dexmate Vega-1 双臂 + Sharpa Wave 22-DoF×2(12任务平均 SR%,Table 1)

方法Avg
ViTacFormer3
RDP6
π0.5 + tactile6
Tactile-VLA15
π0.517
EgoScale35
T-Rex65

UniDex (2603.22264) — Franka + Inspire/Wuji/Oymotion 灵巧手(5工具使用任务,SR%)

方法Average Task ProgressFinal Success Rate
DP29.022.0
DP335.030.0
pi_038.035.0
UniDex-VLA (No Pretrain)32.523.0
UniDex-VLA81.076.0

UniVTAC (无 arXiv) — Franka/Taoxy + GelSight/ViTa sim-to-real(纯仿真训练直迁,SR%,Table IV)

方法Insert USBInsert TubeBottle Upright
ACT + UniVTAC Encoder85.055.060.0

VERA (2605.27817) — Franka Panda(Fig.6,SR%)

方法Push/Pick(Basic)Occlusion(Hidden Button)Location-basedSemantic-based
π0.530000
DreamZero90000
VERA608060

(仿真闭环 Table 1 见 §20。)

ViTaL-Steering (2606.14981) — Franka + GelSight Mini(3任务整体 SR%,图估)

方法WipingInsertionPipetteAvg
Base Policy~40~35~25~33
Visual Lookahead(16步)~60~55~45~53
Tactile Sampling~50~40~35~42
Tactile Guidance~55~45~40~47
Naive Combination~60~50~40~50
ViTaL (Ours)~85~75~70~77

ViTaS (2602.11643) — Galaxea R1 双臂 + 3D-ViTac(3任务 SR%,Table IV)

方法Dual Arm CleanTable Pick Place(TPP-1)Fridge Pick Place
DP207276
ViTaS909490

VLA-Touch (无 arXiv, RA-L 2026) — Franka Panda + GelSight Mini(完整任务 SR%,Table I)

方法Full CupFull WipeFull Peel
RDT3046.230
RDT+Tactile343134
RDT+Residual Controller4438.644
VLA-Touch (Interpolant)466446
原表 Full Cup/Full Peel 数值疑似转录重复,保留原样。

VLAW (2602.12063) — Franka/DROID(5任务成功率,Table 2)

方法StackingWipingOpen BookScoopingDrawingMean
Base model (π0.5)0.620.460.560.440.220.460
DSRL0.700.400.500.600.300.500
Filtered BC-10.800.420.720.640.460.608
Filtered BC-20.880.760.820.740.560.752
Ours-10.800.800.800.720.600.744
Ours-20.920.860.860.920.780.868

VLS (2602.03973) — Franka 单臂(Fig.5,SR%)

方法In-Distribution物体OOD(mug替换)
baseline500
VLS6940

VTAM (2603.23481) — xArm6 + GelSight Mini(主实验 SR%,Table 1)

方法Chip Pick-and-PlaceCucumber PeelingWhiteboard Wiping
Genie Envisioner (GE)002.5
π₀.₅ (Vision-Only)1000
π₀.₅ + Naive Tactile500
VTAM908595

VTWM (2602.06001) — Franka + Digit 360(新任务迁移,20 demos,SR%)

方法plate-in-rack
V-WM (纯视觉世界模型)28
VT-WM78

World-Gymnast (2602.02454) — WidowX/Bridge AutoEval(SR%)

方法Open DrawerClose DrawerEggplant→SinkEggplant→Basket平均
SFT (OpenVLA-OFT)34743240~45
SIMPLER RL5862472~49
World-Gymnast58621078~52

(WorldGym held-out:SFT 58 → World-Gymnast 74,变体 79/81/81。)

World-VLA-Loop (无 arXiv) — Franka(RL/闭环迭代)

方法真机成功率
SFT baseline13.3%
World-VLA-Loop (两轮迭代)首轮RL基础上再 +13.5%

Xiaomi-Robotics-0 (无 arXiv) — 自有人形双臂(成功率/吞吐)

方法Lego Disassembly(LA+LM %)Towel Folding(件/min)
π₀.₅97.00.9
Xiaomi-Robotics-099.71.2

20. 其他 / 自研 benchmark

一次性 / 自研 / 触觉表征专用基准,每篇一小块,按原名保留。数值均为各论文自报。

IndustReal(IsaacGym 紧配合插入)— MBCtrl-RL-Insertion (2505.11858, Table I, Easy)

方法0mm1mm5mm
IndustReal92.48±2.87~89崩溃
本文 (PF+Residual RL+Curr)10098.44±0.8790.25±2.22

CGP 仿真(Unreal Engine FEM, Allegro V5, 5任务平均)— CGP (2503.08587, Table II)

方法Avg 成功率
Visuomotor DP53.2%
Visuotactile DP58.9%
CGP (Ours)74.9%

ContactWorld(Isaac Gym+TacSL, 12接触任务)— ContactWorld (2606.13877, Table 1)

方法/表征平均成功率
Wrist-view20.7%
Front-view22.0%
PointCloud32.1%
PointCloud + TacFF36.1%

VERA 仿真闭环(Table 1, Success/Task Progress %)— VERA (2605.27817)

方法Allegro-SimPanda-Sim(MimicGen)PushT-Sim
UniPi*0.0/0.00.0/0.074.4/84.8
J-IDM (VERA)70.0/70.094.0/94.092.5/95.5

RoboLab-120(120语言条件任务)— Cosmos3 (2606.02800, Table 19)

方法Specific SR
DreamZero25.2%
π0.528.1%
Cosmos3-Super39.7%

BEHAVIOR-1K / DROID 零样本 — G0.5 (无 arXiv, Table 4)

方法BEHAVIOR-1KDROID(零样本)
π0.526.3
挑战赛冠军(4 ckpt)26.1
G0.531.482.5

TLA 仿真(Isaac Gym, Single-Peg, GCR%)— TLA (2503.08548, Table I)

方法GCR(%)L1 x(mm)L1 y(mm)L1 rz(deg)
BC10.40.8030.3020.205
DP8.50.3700.3820.568
SP-TLA12.50.0790.1220.173

(Multi-Peg Table II:MP-TLA ID GCR 18.4,OOD 无退化。)

VTLA 仿真(Isaac Gym TacFlex peg-in-hole, GCR)— VTLA (2505.09577)

方法ID-GCROOD-GCR
VTLA47.5%31.2%
VLA46.1%29.5%
TLA15.3%
DP7.8%

UniVTAC 仿真(触觉专用, Franka+GelSight-Mini, 6任务)— FTP-1 (2606.13102, Table 1)

方法AvgAvg w/o Lift
ViTaL36.3334.5
UniVTAC-ACT43.0039.5
π0.549.1631.5
Tactile-VLA41.8334.75
FTP-π0.5 (无预训练)45.1642.0
FTP-166.6659.5

Sparsh-X 自研物理属性基准(材质-数量估计, Fig.5)— SparshX (2506.14754)

方法准确率
E2E84.9%
Sparsh-X87.5%

UniT 触觉位姿估计(USB Plug, MAE↓, Table I)— UniT (2408.06481)

方法MAE↓
BYOL0.171
MAE (ViT-Base)0.137
UniT0.128

AnyTouch2 触觉分类(Object Bench, 准确率%)— AnyTouch2 (2602.09617)

方法TAG(材质)Cloth(纺织)
AnyTouch 180.8236.84
AnyTouch 276.9742.31

DISCO 多任务仿真环境(Diffusion Policy 环境, Seen, 50 trials)— DISCO (2406.09767, 表6.1)

方法Push-TPush-blockKitchen-SingleKitchen-MultiMugBottleHam.Fork
No cond.0.540.500.120.030.470.310.400.48
LangDiff0.981.001.000.310.910.840.780.96
GoalDiff0.961.001.000.270.880.950.700.93
Vanilla inpt.0.821.000.710.350.900.880.850.96
DISCO0.871.000.710.420.920.920.970.97

UniPi Language-Table 变体(任务完成率%)— UniPi (2302.00111, Table 1)

方法Seen PlaceSeen RelationNovel PlaceNovel Relation
State + Transformer BC19.48.211.93.7
Image + Transformer BC9.411.99.77.3
Image + TT17.412.813.29.1
Diffuser9.011.212.59.6
UniPi90.153.240.146.3
其他仅登记(数值为图估/相对/世界模型指标,无标准操作成功率表):DreamDojo(FVD/策略评估 Pearson r=0.995)、EgoWM(SCS 结构一致性)、Cosmos3 前向动力学 PSNR、UniT-Humanoid 世界模型(PSNR/SSIM/LPIPS/FVD/EPE,见 out_03)、AnyTouch2 TouchHD 力预测(RMSE)、FG-CLTP 离线接触分类(F1 97.5)。VLS 的 CALVIN 任务组(MovableObjects 94 / ArticulatedParts 87)见 §16 附注。

按模型分类

这里按常见对比模型重排已有 benchmark 表格。每个模型 tab 内列出“哪些论文/benchmark 比较了该模型、结果是什么、ckpt/权重来源如何标注、训练域/测试域和 IID/OOD 关系是什么”。为避免误导,未在当前汇总中出现明确下载路径或训练步数的行,会在 ckpt 来源列写明“当前汇总未记录”;未能确认训练/测试协议的行,会在协议列写明“未确认”。

附:处理中发现的异常与说明

1. 同名 benchmark 列不一致

- RoboTwin:主流用 Clean/Randomized(Motus/ImageWAM/StarVLA/LingBot 等),但 SwiftVLA/Fast-WAM/G0.5 只报单一聚合 SR,Qwen 系列用 Easy/Hard,另有 Clean2Rand、IF 变体——已拆为 §2.1–2.5 五个子表。

- SimplerEnv Google-Robot:StarVLA 用 Visual Matching / Variant Aggregation 双列,其余多只报 Visual Matching Avg 或直接给 Avg——已在表内区分列并加备注。

- COLOSSEUM:ActiveVLA 报 Avg SR(%),SAM2Act 报"性能下降(%)",指标方向相反,已分行注明。

- LIBERO 多篇只报聚合 Avg(分套件填 —);MINT 原表另含 L90 列(非标准五列,已移入备注)。

- CALVIN:SuSIE 用 0–1 分数、其余用百分数;DreamVLA 仅报 Avg.Len;VLS 用任务组而非 1–5 链长。

2. 明显重复 / 转录问题

- VLA-Touch Table I 的 Full Cup / Full Peel 数值疑似转录重复,按原表保留。

- TacVLA 与 TacVLA2 为同一论文 v1/v2,触觉阵列描述不同(15×8 vs 15×5),核心平均一致,已分别列出。

- AdaVTF 的 Torque Gating 平均列标注 "<1%" 与逐任务不自洽,保留原文。

- MBCtrl-RL-Insertion 原文 Easy/Hard 归属自相矛盾,按其第 4d 节取 Easy(原注)。

3. arXiv 缺失 / 编号异常

- 大量 2025–2026 技术报告/项目页论文无 arXiv 号(CosmosPolicy、G0.5、Qwen-RobotManip、DIAL、KI-VLA、HiRobot、World-VLA-Loop、Xiaomi-Robotics-0、OmniVTA、UniVTAC、DDP-WM 等),排序时统一置于各表末尾。

- SynthICL 标注为 "arXiv 2026.06"、τ₀-WM 标注 "2605(未标全ID)"、LRM 标注 "2603.16065"、AdaVTF "2604.01414"、AHEAD "2606.02486"、AnyTouch2 "2602.09617"、Cosmos3 "2606.02800"、ContactWorld "2606.13877" 等为 2026 年(含疑似占位/未来)编号,一律按原文保留、按数字大小排序。

4. 反推值:FAVLA(π₀≈43.7、ForceVLA≈66.7)、FutureVLA(π0≈43.3)、ActiveVLA(GenBench L1、RLBench 部分)等由"相对提升"反推,均在对应位置保留原注。

5. 图估 / 近似值:pi0.6、HiRobot、HumanToRobotVLA、RTC、STS-IL、ViTaL-Steering、τ₀-WM、World-Gymnast、pi0.5 等的部分或全部数值来自条形图/图注估读,保留 `~`/`(图估)` 标注,未臆造精确值。