Home
/
机器人学习
/
发展时间线总览
# 机器人学习发展时间线:从示范运动到通用动作模型 [100 篇精读目录](README.md) · [系列总结](101-系列总结.md) 机器人学习并非一条不断用大模型替换小模型的直线。运动基元解决行为怎样表示,逆强化学习研究目标怎样获得,深度强化学习探索怎样改进动作,世界模型学习怎样预测后果,VLA 则把语言、视觉与控制连接起来。它们面对的瓶颈不同,也经常组合在同一系统中。 ## 一、先看一张技术地图 ```mermaid flowchart TD A[机器人行为学习] --> B[动作与技能表示] A --> C[学习信号] A --> D[预测与规划] A --> E[数据与部署] B --> B1[DMP / ProMP:低维连续技能] B --> B2[IBC / Diffusion Policy:多峰动作] B --> B3[ACT / FAST:时间结构与动作压缩] C --> C1[行为克隆 / DAgger:示范] C --> C2[IRL / GAIL:推断偏好] C --> C3[DDPG / SAC / TD3:交互回报] C --> C4[CQL / IQL:固定数据中的改进] D --> D1[PILCO / PETS:概率动力学] D --> D2[Dreamer / TD-MPC:潜在模型] D --> D3[视觉预见 / UniPi:视频预测] E --> E1[域随机化 / RMA / ASAP:仿真迁移] E --> E2[Open X / DROID:多样数据] E --> E3[RT-2 / OpenVLA / pi0:VLA] E3 --> F[实时闭环 / 长任务 / 跨环境泛化] D2 --> F B3 --> F ``` 这张图是问题分解,不是互斥分类。一个扩散策略可以通过示范训练,也可以通过强化学习微调;VLA 可以输出离散动作 token,也可以连接连续动作专家;世界模型既可以在线规划,也可以生成策略训练数据。 ## 二、2002—2013:先找到适合机器人的学习对象 | 阶段 | 代表论文 | 原来的瓶颈 | 关键改变 | |---|---|---|---| | 2002 | [DMP](001-dmp.md) | 回放轨迹难以适应速度、目标和扰动 | 用带吸引子结构的微分方程表示运动 | | 2004—2008 | [学徒学习](002-apprenticeship.md)、[最大熵逆强化学习](003-maxent-irl.md) | 能演示行为,却难写出奖励权重 | 从特征统计或轨迹概率推断目标 | | 2008—2010 | [PoWER](004-power.md)、[PI²](005-pi2.md) | 真机试错昂贵,逐时刻随机动作低效 | 在结构化运动参数上探索与重加权 | | 2011 | [DAgger](006-dagger.md) | 训练看专家状态,执行进入自身错误状态 | 在学习者访问状态上请求专家纠正 | | 2011 | [PILCO](007-pilco.md) | 少量交互不足以训练高维价值网络 | 用高斯过程传播模型不确定性 | | 2013 | [ProMP](008-promp.md)、[GPS](009-gps.md) | 单条动作难组合,局部优化难变成快速策略 | 轨迹分布与引导式策略搜索 | 这个阶段的核心不是增加参数,而是选对学习空间。学习几十个运动参数,与从像素直接输出每个关节动作,面临的探索与稳定性问题完全不同。结构化先验降低学习难度,同时也规定了能够表达哪些行为。 ## 三、2015—2018:视觉控制与深度强化学习结合 [视觉运动策略](010-visuomotor.md)展示了局部控制优化与视觉策略学习的连接。[DDPG](011-ddpg.md)、[SAC](025-sac.md)和[TD3](026-td3.md)提供连续动作优化工具,但它们在物理机器人上的适用性,还取决于重置、奖励、动作限制和交互预算。 抓取提供了较清晰的成败信号,使[手眼协调](014-hand-eye.md)、[Dex-Net 2.0](020-dexnet2.md)和[QT-Opt](030-qt-opt.md)能够分别研究大规模真实尝试、合成几何标签和闭环 Q 学习。三者获得数据的方式不同,不能把性能差异全归给神经网络结构。 [HER](022-her.md)改变训练目标标签以复用失败经验;[DAPG](023-dapg.md)借助示范缩小探索范围;[DART](021-dart.md)通过带噪示范覆盖恢复行为。它们共同说明:有用数据不只来自“更多成功样本”,还来自正确安排失败、偏差和纠正。 ## 四、2016—2021:仿真为什么能够帮助真机,又为什么会失效 | 路线 | 代表论文 | 转移的主要对象 | 关键边界 | |---|---|---|---| | 视觉变化 | [域随机化](018-domain-randomization.md) | 图像表征与定位 | 外观随机化不等于动力学覆盖 | | 动力学变化 | [动力学随机化](024-dynamics-randomization.md) | 控制策略 | 随机化范围必须包含有意义的真实变化 | | 灵巧操作 | [灵巧手](031-dexterous.md)、[机械手魔方](035-rubiks.md) | 接触密集的手内控制 | 传感、物体跟踪与动作协议仍是系统条件 | | 执行器建模 | [ANYmal](032-anymal.md) | 学习策略与真实电机响应 | 延迟和驱动器误差会改变闭环行为 | | 快速适应 | [RMA](042-rma.md) | 根据近期历史调整控制 | 适应潜变量不能自动识别所有未知因素 | 仿真迁移有两个不同问题:训练分布是否覆盖真实变化,以及执行时能否识别当前处于哪种变化。随机化主要扩展前者,在线适应主要处理后者。它们都不能替代对真实失败模式的观测。 ## 五、2019—2022:从单任务成绩走向数据、模型和评价协议 [Meta-World](036-metaworld.md)、[RLBench](034-rlbench.md)与[CALVIN](048-calvin.md)将多任务、视觉操作和语言长任务的评价明确化。[robomimic](043-robomimic.md)强调示范来源、数据质量、时序建模与观察方式本身就是研究变量。 离线强化学习中的[CQL](038-cql.md)与[IQL](047-iql.md)处理固定数据外的价值外推;[AWAC](039-awac.md)研究如何从离线数据起步后继续在线改进。使用已有数据可以减少新交互,但无法让完全缺失的接触经验凭空出现。 模型路线则从[PETS](029-pets.md)的概率动力学规划,走到[Dreamer](037-dreamer.md)的潜在想象、[TD-MPC](049-tdmpc.md)的规划与长期价值结合,再到[DayDreamer](054-daydreamer.md)的真实机器人学习。应分别问清:模型预测什么、策略怎样用它、误差在多长时间内累积。 ## 六、2021—2024:动作开始拥有生成模型与语言条件 [Transporter](040-transporter.md)和[CLIPort](046-clipport.md)利用空间结构;[PerAct](055-peract.md)把语言目标与三维动作定位结合。[SayCan](051-saycan.md)则把语言模型的任务相关性与技能可执行性结合,语言计划不再仅靠文字上合理。 在动作表示上,[IBC](044-ibc.md)用能量表达多峰行为,[Diffuser](053-diffuser.md)生成完整轨迹,[Diffusion Policy](061-diffusion-policy.md)生成短动作序列,[ACT](062-act.md)通过动作分块减少逐步预测误差。它们对执行频率与反馈时机作出了不同选择。 [PaLM-E](060-palm-e.md)、[RT-1](057-rt1.md)与[RT-2](065-rt2.md)的联系,也需要拆开看:把感知输入语言模型、在机器人数据上学习动作序列、把视觉语言预训练知识转移到动作输出,是三个相关但不同的问题。 ## 七、2023—2025:扩大的是机器人数据,也包括动作接口 [Open X](068-openx.md)、[BridgeData V2](066-bridgev2.md)和[DROID](078-droid.md)拓展跨场景与跨本体数据。数据量之外,还要关注操作员、相机、动作归一化和采样频率。不同机器人都叫“移动 1 个单位”,并不代表同样的物理动作。 [Octo](080-octo.md)、[OpenVLA](082-openvla.md)、[π0](087-pi0.md)和[GR00T N1](092-groot.md)代表不同通用策略设计。[FAST](089-fast.md)关注动作序列的压缩表示;[OpenVLA-OFT](091-openvla-oft.md)关注动作头、微调和速度;[SmolVLA](095-smolvla.md)把模型规模与异步执行一起讨论。机器人基础模型的能力要通过闭环任务检验,语言能力或离线预测损失不能替代真实完成率。 数据扩展还可以来自[MimicGen](071-mimicgen.md)和[DexMimicGen](088-dexmimicgen.md)的示范重组,而[HIL-SERL](086-hil-serl.md)与[VLA-RL](094-vla-rl.md)重新强调交互反馈。示范学习和强化学习在这一阶段更像前后相接的训练环节,而非只能二选一的路线。 ## 八、2026:实时、推理与模型使用方式成为新的研究对象 | 论文 | 研究切入点 | 阅读时要区分的问题 | |---|---|---| | [Xiaomi-Robotics-0](096-xiaomi0.md) | VLA 的实时执行 | 模型推理速度与整体闭环延迟 | | [MBDPO](097-mbdpo.md) | 世界模型中的扩散策略优化 | 搜索分布、策略分布与价值估计是否一致 | | [连续推理](098-continuous-reasoning.md) | 连续潜在思想与分块动作接口 | 教师解码检验的可复用性、闭环任务成功与表示边界 | | [WorldSample](099-worldsample.md) | 用合成经验辅助真机 RL | 减少真机步数与减少总训练成本 | | [CoRE-VLA](100-core-vla.md) | 条件专家路由 | 增大容量与实际激活计算的关系 | 近期论文提供具体方法和实验样例,不代表机器人通用性、实时性或可靠性问题已经解决。完整书目和各项实验条件见对应精读。 ## 九、贯穿阅读的五个问题 1. **学习对象是什么?** 是动力学、奖励、价值、动作分布,还是数据表示? 2. **信息从哪里来?** 示范、真实交互、仿真、视频和语言标签各承担什么角色? 3. **动作何时执行?** 一步闭环、动作分块、滚动规划与异步推理如何安排? 4. **错误怎样传播?** 观察误差、价值高估、模型偏差和动作延迟分别进入哪里? 5. **泛化改变了什么?** 新物体、新布局、新任务、新本体与新动力学不能混称一个指标。 建议先沿 DMP → DAgger → PILCO → 视觉运动策略 → DDPG/SAC → HER → QT-Opt → RMA → robomimic → Diffusion Policy/ACT → RT-1/RT-2 → Open X → OpenVLA/π0 → 实时与世界模型专题推进,再回到各专题补齐理论与实验背景。