返回 Articles
Robot Learning 100 篇精读

机器人学习 100 篇:从运动基元到视觉语言动作

机器人学习研究怎样从示范、交互和已有数据中形成可执行的行为。算法不仅要预测正确,还必须在有延迟、有接触、有执行误差的物理系统里持续工作。

每篇文章怎么读

  1. 机器人设定:观测、动作、接触和重置条件先固定下来。
  2. 学习信号:示范、奖励、离线数据还是模型想象,来源不同结论不能混用。
  3. 方法机制:沿数据、模型、动作和反馈追踪一次执行。
  4. 公式与伪代码:看清更新的是轨迹、策略还是世界模型。
  5. 实验证据:仿真、真机、数据来源和评价协议要分开读。
  6. 边界:迁移、实时性和长任务失败往往来自未声明的系统条件。
  7. 自测:解释一个核心机制,再处理一个反例。

全系列架构

运动表示、奖励推断、深度控制、世界模型和 VLA 面对的瓶颈不同,也经常组合在同一系统中。这张图是问题分解,不是互斥分类。

flowchart TD A[机器人行为学习] --> B[动作与技能表示] A --> C[学习信号] A --> D[预测与规划] A --> E[数据与部署] B --> B1[DMP / ProMP:低维连续技能] B --> B2[IBC / Diffusion Policy:多峰动作] B --> B3[ACT / FAST:时间结构与动作压缩] C --> C1[行为克隆 / DAgger:示范] C --> C2[IRL / GAIL:推断偏好] C --> C3[DDPG / SAC / TD3:交互回报] C --> C4[CQL / IQL:固定数据中的改进] D --> D1[PILCO / PETS:概率动力学] D --> D2[Dreamer / TD-MPC:潜在模型] D --> D3[视觉预见 / UniPi:视频预测] E --> E1[域随机化 / RMA / ASAP:仿真迁移] E --> E2[Open X / DROID:多样数据] E --> E3[RT-2 / OpenVLA / pi0:VLA] E3 --> F[实时闭环 / 长任务 / 跨环境泛化] D2 --> F B3 --> F

100 篇目录

最小阅读路线

可先读 DMP、DAgger、DDPG/SAC、Diffusion Policy 与 OpenVLA,分别建立动作表示、模仿纠偏、连续控制、生成动作和视觉语言动作这条主线,再进入仿真迁移、离线学习或真机强化学习。