Study Hub

项目分析 · 代码精读 · 架构对比 | 随时随地学习

🧭 推荐学习路线

第一阶段 · 入门(建立全局观)
第二阶段 · 核心原理(懂扩散数学)
第三阶段 · 前沿(读最新工作)

💡 卡在术语随时回 starVLA 页"新手入门"tab 查词典;每页底部有自测题检验掌握。

VLA / 具身智能
VLA

StarVLA 架构交互式学习

主流 VLA 四种 Action Head (FAST/OFT/GR00T/PI) 的模块化设计、数据流、方法对比。含自测 Quiz。

starVLA 仓库 · 7 个 tab · 交互式
VLA

OpenPI & StarVLA 代码精读课

π₀ 双 Gemma 架构 vs StarVLA DiT 架构的逐行代码精读,总分总形式,含对比总结。

openpi + starVLA · 代码级 · Flow Matching
World Model

DynaGuide 仓库分析

DynaGuide 项目的代码结构分析与学习笔记。

DynaGuide 仓库
World Model

DynaGuide 用自有数据部署指南

已采集真机数据如何用 DynaGuide 部署:训练 vs 梯度引导的区别、扩散策略与动态模型分别用什么数据、Phase 0-4 详细规划。

DynaGuide 仓库 · 2026-06-30
VLA 实战

VLA 训练与部署实战

损失函数/微调策略/协同训练&KI/动作表示&tokenization/推理加速/实时控制&RTC/server-client部署。含8题自测。

实战 · 8 tab · 含自测
VLA

VLS 全解析 · 训练-free 推理时引导

Vision-Language Steering 解决 VLA 的 OOD 问题:背景·创新·代码·部署·评测结果一站式。含真实评测图表与可播放 rollout 视频。

vls 仓库 · 7 章节 · 含视频
扩散 / 生成模型
Diffusion

Diffusion Policy 学习课

从原理到代码逐行精读:DDPM 去噪、条件化、Receding Horizon、FiLM 注入。含 10 题自测。

dp 仓库 · 7 tab · 含自测
Diffusion

DP · DiT · Flow Matching 三剑客

三者原理、公式、代码逐行精读,关系与衍生脉络。含自测。

原理+代码 · 关系图谱 · 含自测
VLM / 多模态模型
VLM

VLA 推理时引导 · OOD 全景对比 · 课题规划

VLA 部署 OOD 四类分析、10+ 篇竞品数据流对比、推荐课题(注意力引导)方案与预期效果。

VLMGuide · 2026-06-26
论文精读 / 世界模型
汇总

📊 Benchmark 结果总表(202 篇)

覆盖 202 篇论文,按 benchmark 分组的全量测试结果:LIBERO/LIBERO-Plus/CALVIN/RoboTwin/SimplerEnv/RoboCasa/RLBench/ManiSkill 等 20+ 榜单,每表按论文分组、逐方法列出成功率,支持标签切换与表内筛选。数值均各论文自报。

数据汇总 · 21 tab · 172 表 · PDF核对
World Model

MaskWAM — 统一 Mask 提示与预测的 WAM

HKUST/腾讯/清华 2026。mask 既当首帧空间提示(输入)又当未来预测目标(输出),用未来 mask 做语义正则化、用首帧 mask 消除语言歧义。LIBERO 98.4、RoboTwin 92.2、真机语言歧义 84.9(超最强 baseline 33.2)。含代码印证与7题自测。

论文精读 · 9 tab · PDF+代码核对
World Model

ImageWAM — 图像编辑即世界动作模型

SJTU/EIT/腾讯 2026。用图像编辑模型替代视频生成当 WAM backbone,推理只取去噪 KV cache 不解码图,FLOPs 降至 1/6、延迟 1/4 仍追平视频 WAM。含代码印证与8题自测。

论文精读 · 9 tab · 源码核对
World Model

DiT4DiT — Video DiT hidden feature 指导动作

Mondo/HKUST 2026。不是生成未来视频再执行,而是用 Video DiT 去噪中间 hidden 条件化 Action DiT;LIBERO 98.6%、RoboCasa-GR1 50.8%,并关联 ImageWAM/DynaGuide/VLMGuide。

论文精读 · 11 tab · PDF+源码核对
VLA

Qwen-RobotManip — 对齐释放规模化

Qwen Team 2026。三重对齐(表征/运动/行为) + Human-to-Robot 合成 + OOD-first 评测,用 38,100h 开源数据实现真泛化。含8题自测。

论文精读 · 8 tab · 含自测
World Model

Bridge-WA — Where/How World Changes

Bai et al. 2026。把大未来变化 teacher 蒸馏成 future tokens、change map、motion-flow map,并分层注入 WorldBridge action transformer;覆盖 VLABench、RoboTwin2.0、LIBERO-Plus 和 Dobot 真机。

论文精读 · 6 tab · PDF核对
横向对比

VLA Guidance / World-Change 六篇对比

横向比较 Bridge-WA、ProgressVLA、TraceVLA、VP-VLA、SwiftVLA、OASIS:它们分别占据哪些 idea 空间、用哪些 Benchmark、对 2D-RPF/CAPE 造成哪些碰撞风险,以及最终如何差异化。

综合对比 · 6 tab · 选题判断
VLA · 中间表示

VLA 中间表示全景

群览 LAP、LA4VLA、Qwen-RobotManip、VP-VLA、TraceVLA、ProgressVLA、MaskWAM、DiT4DiT、OASIS、PoseVLA 等工作:哪些中间表示在连接 VLM 语义和 action 生成。

综合总览 · 6 tab · 课题定位
VLA · Progress

ProgressVLA — 进度引导扩散策略

Yan et al. 2026。用 DINOv2 progress estimator + action-conditioned world model,把任务进度梯度注入 diffusion policy 采样;含 CALVIN、LIBERO、真机实验和对 RPF/CAPE 的碰撞分析。

论文精读 · 6 tab · PDF核对
VLA · 2D Trace

TraceVLA — Visual Trace Prompting

ICLR 2025。用 CoTracker 从历史帧生成 2D visual trace,再和原图一起输入 OpenVLA;证明视觉轨迹提示比多帧拼接更有效。含 SimplerEnv、WidowX 真机、LIBERO 和消融。

论文精读 · 6 tab · PDF核对
VLA · Visual Prompt

VP-VLA — Visual Prompting Interface

2026。System-2 Qwen3VL 负责任务分解和 SAM3 视觉提示,System-1 QwenOFT 负责控制,并用 grounding loss 学会跟随 crosshair/bbox;重点覆盖 RoboCasa、SimplerEnv 和真实 OOD 指令跟随。

论文精读 · 6 tab · PDF核对
VLA · Pose Anchor

PosA-VLA — Pose-Conditioned Anchor Attention

Li et al. 2025。把末端执行器 pose 投影到 head/wrist camera 的 2D 图像平面,生成 task/end-effector anchor 监督 VLA 注意力;真实抓取 Avg 55.3、长程盒子任务 61.1、训练仅 20 GPU hours。

论文精读 · 8 tab · PDF核对
VLA · Pose Pretrain

PoseVLA — Universal Pose Pretraining

Lin et al. 2026。用相机系 3D pose tokens 统一非机器人 3D 数据和机器人轨迹数据,PaliGemma + flow matching action expert;RoboTwin w/o depth 79.5、LIBERO 96.0、真机 81.25%。

论文精读 · 9 tab · PDF+官方代码核对
VLA · 效率

SwiftVLA — 训练时学4D,推理时丢4D

GigaAI/北大 2025。冻结4D几何Transformer从RGB增量提时空特征,mask-and-reconstruct把4D知识蒸馏进0.45B小模型,推理丢弃4D分支;Jetson Orin 比π0快18×省显存12×。含与OASIS对比、可复用trick与创新方向。

论文精读 · 8 tab · PDF核对
VLA · 几何

OASIS — SE(3)轨迹对齐动作空间

西安交大 2026。预测相机系SE(3)末端轨迹,用位姿监督隐状态把中间表示对齐到动作空间,为动作解码提供几何归纳偏置;LIBERO 97.6%、真机89.2%、OOD 90.8%。含与SwiftVLA对比、可复用trick与创新方向。

论文精读 · 8 tab · PDF核对
VLA

LAP — Language-Action Pre-Training

把 action chunk 转成自然语言动作,使 VLA 动作监督对齐 VLM 语言分布;详解原理、数据、OpenPI代码、训练、部署、LIBERO和真机跨本体实验。

论文精读 · 12 tab · PDF+官方代码核对
VLA

LA4VLA — Learning to Act without Seeing

从 DROID 构造 LA-33K,去视觉学习 language-conditioned action priors;系统比较 LA/VLA/LA-VLA/MixPT,并分析真机和视觉扰动鲁棒性。

论文精读 · 12 tab · PDF核对 · 代码状态标注
OOD

机器人操作 OOD 论文图谱

综合 Qwen-RobotManip、Goal-VLA、VLS、OmniGuide、LA4VLA、VERA 等工作,区分新物体 OOD 与方位/空间 OOD,并补充各论文数据集和任务设计逻辑。

综合问题 · 7 tab · 含数据集设计
VLA

π0.7 — 可操控的通用机器人基础模型

Physical Intelligence 2026。多模态上下文条件化(子任务/子目标/元数据) + BAGEL世界模型 + 从RL专家蒸馏,实现开箱即用组合泛化与跨本体迁移。

论文精读 · 6 tab
World Model

VERA — 把视频模型变成机器人策略

MIT CSAIL 2026。action-free 视频世界模型梦想未来 + Jacobian IDM 用图像雅可比场反解动作,神经版 IBVS,零样本跨本体。

论文精读 · 6 tab
World Model

世界模型全景 — 机器人操作方向

基于 30+ 篇论文:显式vs隐式预测、视触觉四象限、开环/闭环、MPC+CEM 规划范式总表、选题结论。

综述整理 · 7 tab
VLA

DWYS/SEAL — 运行时推理-动作对齐验证

NVIDIA/CMU 2026。Embodied CoT Faithfulness Gap:推理VLA言行不一→Best-of-N采样+VLM Verifier运行时引导,行为组合+15%、OOD+17%,无需重训练。含代码印证与6题自测。

论文精读 · 9 tab · 源码核对
VLA

VLA 论文 Base Code 调研(2024-2026)

横向对比 OpenVLA/π0.5/OASIS/GR00T 等主流 VLA 论文的技术选型。OpenVLA 是 test-time adaptation 工作的首选 base;π0.5 KV-cache 限制了 injection;OASIS 自研架构最优雅。含选型建议与 5 题自测。

调研整理 · 5 tab · 2026-07
快速添加新页面
模板

+ 新增学习页面

编辑 ~/study-hub/index.html,复制一个 card 块,修改 href/标题/描述即可。