Robot Learning
100 篇精读
机器人学习 100 篇:从运动基元到视觉语言动作
机器人学习研究怎样从示范、交互和已有数据中形成可执行的行为。算法不仅要预测正确,还必须在有延迟、有接触、有执行误差的物理系统里持续工作。
每篇文章怎么读
- 机器人设定:观测、动作、接触和重置条件先固定下来。
- 学习信号:示范、奖励、离线数据还是模型想象,来源不同结论不能混用。
- 方法机制:沿数据、模型、动作和反馈追踪一次执行。
- 公式与伪代码:看清更新的是轨迹、策略还是世界模型。
- 实验证据:仿真、真机、数据来源和评价协议要分开读。
- 边界:迁移、实时性和长任务失败往往来自未声明的系统条件。
- 自测:解释一个核心机制,再处理一个反例。
全系列架构
运动表示、奖励推断、深度控制、世界模型和 VLA 面对的瓶颈不同,也经常组合在同一系统中。这张图是问题分解,不是互斥分类。
flowchart TD
A[机器人行为学习] --> B[动作与技能表示]
A --> C[学习信号]
A --> D[预测与规划]
A --> E[数据与部署]
B --> B1[DMP / ProMP:低维连续技能]
B --> B2[IBC / Diffusion Policy:多峰动作]
B --> B3[ACT / FAST:时间结构与动作压缩]
C --> C1[行为克隆 / DAgger:示范]
C --> C2[IRL / GAIL:推断偏好]
C --> C3[DDPG / SAC / TD3:交互回报]
C --> C4[CQL / IQL:固定数据中的改进]
D --> D1[PILCO / PETS:概率动力学]
D --> D2[Dreamer / TD-MPC:潜在模型]
D --> D3[视觉预见 / UniPi:视频预测]
E --> E1[域随机化 / RMA / ASAP:仿真迁移]
E --> E2[Open X / DROID:多样数据]
E --> E3[RT-2 / OpenVLA / pi0:VLA]
E3 --> F[实时闭环 / 长任务 / 跨环境泛化]
D2 --> F
B3 --> F
100 篇目录
最小阅读路线
可先读 DMP、DAgger、DDPG/SAC、Diffusion Policy 与 OpenVLA,分别建立动作表示、模仿纠偏、连续控制、生成动作和视觉语言动作这条主线,再进入仿真迁移、离线学习或真机强化学习。