Home
/
机器人学习
/
系列总结
# 系列总结|从学习动作到让机器人可靠行动 [系列首页](README.md) · [发展时间线](00-发展时间线总览.md) · [上一篇](100-core-vla.md) 机器人学习的发展,可以理解为不断重新安排“哪些知识写进结构,哪些知识从数据学习,哪些错误留给闭环反馈纠正”。运动基元把稳定性写进动力系统;深度强化学习把动作优劣交给价值函数;模仿学习利用人的行为;世界模型预测尚未执行的后果;VLA 借助语言与视觉预训练扩大任务接口。后一条路线没有使前一条消失,它们在同一台机器人上经常共存。 真正值得带走的,不是模型名称排行榜,而是分析任何新方法时都能追踪的链条:观测是否充分,监督来自哪里,动作如何表示,预测何时执行,错误如何被发现,反馈是否真的改善了物理任务。 ## 一、用六条主线串起论文 | 主线 | 代表阅读 | 解决的核心矛盾 | 留下的问题 | |---|---|---|---| | 结构化运动与策略搜索 | [DMP](001-dmp.md)、[PoWER](004-power.md)、[PI²](005-pi2.md)、[ProMP](008-promp.md) | 少量数据与可靠运动结构 | 表示能否覆盖接触切换与复杂感知 | | 从示范学习行为与目标 | [学徒学习](002-apprenticeship.md)、[最大熵IRL](003-maxent-irl.md)、[DAgger](006-dagger.md)、[GAIL](015-gail.md)、[DART](021-dart.md) | 人会做任务,但难写奖励或覆盖所有状态 | 专家查询成本、奖励不可辨识和分布偏移 | | 连续控制与真实交互 | [DDPG](011-ddpg.md)、[SAC](025-sac.md)、[TD3](026-td3.md)、[QT-Opt](030-qt-opt.md)、[HIL-SERL](086-hil-serl.md) | 高维动作、昂贵交互与不稳定估值 | 复位、干预、奖励与计算仍是成本 | | 模型、规划与适应 | [PILCO](007-pilco.md)、[PETS](029-pets.md)、[Dreamer](037-dreamer.md)、[TD-MPC2](070-tdmpc2.md)、[WorldSample](099-worldsample.md) | 用预测减少真机试错 | 预测指标不等于控制收益,外推可能被策略利用 | | 跨环境与跨本体迁移 | [动力学随机化](024-dynamics-randomization.md)、[RMA](042-rma.md)、[ASAP](090-asap.md)、[Open X-Embodiment](068-openx.md) | 仿真、真实与不同身体之间的差异 | 训练分布、动作语义和系统辨识边界 | | 生成动作与通用接口 | [Diffusion Policy](061-diffusion-policy.md)、[ACT](062-act.md)、[RT-2](065-rt2.md)、[OpenVLA](082-openvla.md)、[π0.5](093-pi05.md)、[CoRE-VLA](100-core-vla.md) | 多模态动作、长任务、语言与可变传感器 | 实时闭环、任务覆盖与失败恢复 | 这六条线共享一些问题,却使用不同工具。生成式动作策略可以只做模仿,也可以经强化学习继续优化;世界模型可以用于规划、想象训练或合成数据;Actor–Critic 是策略与价值学习的组织方式,不是某种机器人本体。区分这些维度,才能理解混合系统。 ~~~mermaid flowchart TD D[示范与真实交互] --> R[运动与动作表示] D --> W[状态或视频世界模型] D --> V[价值与奖励学习] P[视觉语言预训练] --> R R --> A[策略输出动作或动作块] W --> A V --> A A --> C[控制接口与执行时序] C --> E[物理环境] E --> O[新观测与成败反馈] O --> D O --> C S[传感器与本体约束] --> C S --> R ~~~ 图中最容易被忽略的是控制接口。相同网络输出,如果一个系统每秒重新观察几十次,另一个系统执行一秒动作后才重新观察,遇到被推动的物体会表现不同。网络损失只是整条链中的一环。 ## 二、如何比较不同年代的方法 早期论文常在低维状态、小规模任务和手工结构上验证核心机制;近期系统可能使用大规模视频语言预训练、多本体数据和复杂生成器。两者不适合直接用一个最终成功率排名。更有意义的比较,是看某个原始困难如何被转移。 | 比较维度 | 需要明确的问题 | 容易误读之处 | |---|---|---| | 数据 | 成功示范、失败、纠正、仿真、互联网各占什么 | 相同示范条数不代表相同信息量 | | 动作 | 关节位置、速度、末端增量、力矩还是动作块 | 同为7维也可能语义与频率不同 | | 反馈 | 在线奖励、离线监督、生成视频标签还是人工评分 | 没有真机在线更新也可能叫“交互模型” | | 先验 | 控制结构、动力学、视觉语言模型、对象位姿 | “从头训练动作头”不代表没有预训练 | | 成本 | 真机步数、分钟、GPU时间、人工与复位 | 样本效率不等于总成本效率 | | 泛化 | 新初始位置、对象实例、任务、场景、本体、模态 | 改颜色成功不等于学会新技能 | | 统计 | 回合数、训练种子、任务平均和方差 | 多次评估不是多次独立训练 | | 成功 | 阶段得分、完整成功、连续吞吐量 | 得分80不必对应80%完整完成 | [OpenVLA-OFT](091-openvla-oft.md)与[SmolVLA](095-smolvla.md)说明执行频率和异步调度可以显著改变系统效率;[FAST](089-fast.md)说明训练表示更有效并不自动使推理更快;[GR00T N1](092-groot.md)和[π0](087-pi0.md)提醒我们,多阶段训练和数据组合也是方法的一部分。读新论文时,应将模型结构与完整系统一并还原。 ## 三、三个贯穿全系列的自构实验 以下都是**教学实验方案,尚未运行**。它们不是任何论文已报告结果,也不预设必须出现某种排名。可以先在可复现模拟环境完成,确认对照成立后,再决定是否迁移真机。 ### 实验一:为什么一步预测准确,闭环模仿仍会失败? **关联阅读:**[DAgger](006-dagger.md)、[DART](021-dart.md)、[RoboMimic](043-robomimic.md)、[Diffusion Policy](061-diffusion-policy.md)、[ACT](062-act.md)。 选一个有两条绕障路径的平面到达或推物任务。专家可稳定完成,并能对偏离轨迹的状态提供动作。先固定一批示范,训练行为克隆;再做等专家标注预算的三种数据方案:原始示范重复采样、示范附近加入受控扰动、当前策略访问状态上的专家纠正。分别配相同容量的单步动作头;确认数据效应后,再比较动作块策略。 核心假设是:闭环失败主要来自策略诱发状态与示范状态的分布偏差,单纯降低示范分布上的损失不足以解决。需要控制总专家查询数,而不只控制示范轨迹数;一条长轨迹包含更多标注点。 | 项目 | 设计 | |---|---| | 自变量 | 数据采集方式、扰动幅度、任务时长;后续单独研究动作块长度 | | 固定项 | 初始示范、模型容量、更新次数、专家标注总量、评估起点 | | 指标 | 留出动作误差、完整成功率、首次离开示范覆盖区域时间、恢复率 | | 统计 | 建议5个独立训练种子;每条件100个配对评估起点 | | 泛化 | 小扰动与大扰动分开;障碍位置变化与任务目标变化分开 | | 失败记录 | 撞障、停滞、错误分支、无法恢复,不只记录平均回报 | ~~~text 固定专家预算B与初始示范D 对每种数据方案: 从同一D初始化策略 在预算内按方案收集额外专家标签 以相同优化预算训练 对相同测试起点和扰动执行闭环 同时记录动作预测误差、状态偏离和任务成败 最后按训练种子汇总,而非把所有回合当独立训练样本 ~~~ **怎样解释可能结果?** 如果 DAgger 式纠正降低失败但留出动作误差变化小,说明闭环数据分布比普通监督指标更关键。如果扰动示范同样有效,可能当前任务只需要局部覆盖,不必付出在线专家查询成本。如果动作块更平滑却恢复更差,应检查观察间隔,而不是立即归因于生成模型学不好。 这项实验也可能反驳原假设:如果专家动作本身歧义很大,主要问题可能是多模态平均;如果观测漏掉速度,主要问题可能是部分可观测。加入状态覆盖并不能弥补错误任务定义。 ### 实验二:预测更像真实世界,是否真的控制得更好? **关联阅读:**[PILCO](007-pilco.md)、[PETS](029-pets.md)、[MBPO](033-mbpo.md)、[TD-MPC2](070-tdmpc2.md)、[MBDPO](097-mbdpo.md)、[WorldSample](099-worldsample.md)。 选择一个推物或插入模拟环境,同时保存完整状态、图像和接触事件,但明确区分哪些信息供策略使用、哪些只用于离线评估。构建两类误差:视觉外观变化但动力学基本不变;视觉变化小但摩擦或接触动力学改变。训练相同架构的世界模型,控制真实数据量,再比较短滚动规划、长滚动规划,以及短合成经验辅助策略训练。 核心假设是:与任务有关的转移误差和奖励误差,比总体像素重建误差更能预测闭环成败;滚动加长可能增加规划信息,也可能放大误差。 | 项目 | 设计 | |---|---| | 自变量 | 模型数据覆盖、动力学变化、滚动长度、合成比例 | | 关键对照 | 真动力学规划上界;同数据无模型策略;冻结模型与持续更新模型 | | 固定项 | 真实交互预算、候选动作数、策略网络;同时单独报告墙钟 | | 模型指标 | 单步与多步位置误差、接触事件误判、奖励误差、图像指标 | | 控制指标 | 成功、碰撞、恢复、真实步数、规划延迟、总训练时间 | | 数据切分 | 留出同分布轨迹与反事实动作测试分开;不混用训练片段 | “真实模型”只在模拟中作为诊断对照,不供学习策略偷偷使用。若使用特权物体状态,应让所有需要该输入的对照公平获得,或者另设明确的特权上界。 ~~~text 固定真实采集数据,训练各世界模型 在同分布留出片段上计算预测指标 在模拟器执行新动作,收集反事实转移测试集 对每个滚动长度与合成比例: 用同一世界模型训练或规划 独立执行真实模拟环境闭环 记录预测指标与闭环指标之间的相关性及异常案例 ~~~ **怎样解释可能结果?** 若图像更清晰但插入成功更低,检查接触和奖励预测;若短滚动优于长滚动,可能是复合误差,也可能是搜索预算被摊薄,应增加计算匹配对照;若低熵策略仍被合成数据带偏,就能直接检验“策略确定性可代表模型可靠性”的边界。 不要只画预测误差与成功率的相关图就声称因果。可以固定模型结构,仅改变接触覆盖数据,再看误差与控制是否共同改善。对世界模型而言,“很好看”和“能帮助行动”需要分别证据。 ### 实验三:VLA 泛化来自语义,还是来自执行时序与数据覆盖? **关联阅读:**[RT-2](065-rt2.md)、[π0](087-pi0.md)、[OpenVLA-OFT](091-openvla-oft.md)、[π0.5](093-pi05.md)、[SmolVLA](095-smolvla.md)、[连续推理](098-continuous-reasoning.md)、[CoRE-VLA](100-core-vla.md)。 在同一个视觉语言操作基准上,选定一套可运行策略和固定微调数据,构造四类独立测试变化:指令同义改写、新对象外观、新空间布局、执行中目标移动。先固定模型权重,仅改变控制调度;再固定调度,改变语言条件或预训练初始化。这样避免把所有变化同时加入而无法解释失败。 | 项目 | 设计 | |---|---| | 时序变量 | 动作块长度、每次实际执行步数、观测频率、模拟推理延迟 | | 语义对照 | 正确指令、同义改写、错误指令;保持任务与场景配对 | | 数据对照 | 同下游数据的预训练/非机器人预训练模型;参数与训练预算分别说明 | | 模态变化 | 可选扩展为深度移除、深度冻结、深度噪声,三者分开 | | 指标 | 完整成功、阶段得分、指令遵从、扰动恢复、动作延迟、每分钟完成数 | | 统计 | 多训练种子;相同起点配对;报告每类泛化而非一个总均值 | 设置模拟延迟时,需要注明它是否包括图像采集与通信,且用时间戳避免重复或过期动作。动作命令频率与模型推理频率不是一回事:控制器可以高频插值旧动作,模型仍然很久才看一次新图像。 ~~~text 冻结策略,逐一扫描动作块执行长度与推理延迟 在四类配对测试中评估闭环,不重新训练 选择一种固定调度,再比较语言条件与预训练对照 单独测试缺失、冻结和带噪辅助传感器 分别输出能力、响应时间与吞吐量曲线 ~~~ **怎样解释可能结果?** 如果静态场景成功不变、目标移动时下降,瓶颈可能在反馈时序;若正确与错误语言成绩相近,策略可能主要依赖视觉常见动作;若同义改写稳定但新目标关系失败,语义泛化仍有限。吞吐量提升同时成功率下降,则需要按实际应用成本取舍,不能仅选一个更漂亮的指标。 ## 四、阅读中需要保留的三类具体疑点 疑点不是用来否定一篇论文,而是提示复现时哪些条件必须重新检查。以下选择三个能代表普遍阅读方法的实例,细节及原文链接保留在对应文章。 **第一处:样本效率倍率是否与给出的数据时长一致?** [在线动力学适应](027-dynamics-embedding.md)采用的修订正文§6.2同时出现较长训练数据、较短真实采集时间和“1000×”表述;这些时长之比不能直接得到该倍率,附录窗口参数也有不同口径。需要确认倍率到底以样本、任务集合还是其他训练成本为分母。§6.3另有低数据预算比较,不能把§6.2的口径疑点扩展成否定所有实验。 **第二处:流匹配的时间方向是否统一?** [π0](087-pi0.md)、[π0.5](093-pi05.md)等篇区分了正文插值、训练目标和积分方向。把数据到噪声的速度与噪声到数据的正时间积分混用,会得到错误实现;但有些代码以负时间步反向积分,符号不同可以完全等价。应检查起点、终点和导数三者,不只看一个正负号。文中教学公式明确自身约定;这不能替代对指定版本源码的运行验证。 **第三处:时间节省与交互节省有没有写反?** [WorldSample](099-worldsample.md)表1的平均真实步数和分钟数,对应约59%与23%的不同降幅,正文部分描述混用了名字。正文解读按表重新计算,并保留“收敛或等墙钟停止”的评价条件。纠正百分比名称不改变表中成功率观察,也不自动证明其全系统计算成本下降同样比例。 这些例子对应三个一般原则:先确认分母,先确认数学约定,先确认指标单位。遇到不一致时,把能证实的结论与待核实的机制分开,避免两种极端——照抄宣传语,或者因一个表达错误宣布全部结果无效。 ## 五、阅读范围与证据边界 本系列以论文原文为主要依据,正文中的“阅读范围”说明所采用版本,以及核对到的方法、实验、附录或代码范围。部分旧论文使用正式出版版本,部分新论文采用带版本号的预印本;编号顺序依首次公开时间组织,不意味着所有正文都只读首版。2026年的条目用于观察当前研究问题,长期影响不能由发布时间判断。 本系列没有独立重跑这些论文的机器人实验。教学伪代码重构算法逻辑,省略的工程环节不能默认为不存在;自构例子帮助解释概念,均不充当论文实测结果。某项预算尚未确认时,文中写明核实范围,不据此断言作者没有提供。 不同来源的证据强度应这样使用: | 证据 | 可以支持 | 仍需补充 | |---|---|---| | 公式与定理 | 在假设下的方法性质 | 假设是否适合真实机器人 | | 主实验表与学习曲线 | 报告条件下的表现 | 随机性、预算、评估选择影响 | | 消融 | 某个设置中组件的边际作用 | 跨任务重复及交互作用 | | 原始代码 | 某版本实际计算路径 | 完整配置、数据与运行结果 | | 视频案例 | 特定动作确实发生过 | 成功率、失败分布与选择偏差 | | 自构推导与例子 | 理解机制、发现可检验问题 | 独立实验证据 | 机器人实验尤其需要识别隐形输入:手工复位、遥操作纠正、标定、对象位姿、阶段状态机、奖励分类器、低层控制器。它们未必削弱工作价值,但会改变“模型学会了什么”的准确说法。最好的阅读成果,是能画出完整数据与反馈路径,并说明删除其中一个组件会发生什么。 ## 六、把理解变成下一步行动 阅读完成后,可以任选一篇,在不看原文的情况下做三件事:讲清一个真实失败触发条件;写出从观测到动作与更新的流程;设计一个可能推翻自己解释的对照。若只能复述模型名字、参数规模和平均成功率,理解还停在外层。 学习路线可以按目标回环:做模仿数据回到 DAgger、RoboMimic 和 ACT;做真机强化学习回到 SAC、SERL 和 HIL-SERL;做模型控制回到 PILCO、PETS 和 TD-MPC;做通用策略回到 RT-1、Open X-Embodiment、OpenVLA,再检查近期 VLA 的数据、时序与泛化条件。旧论文往往提供定义清楚的原问题,新论文则展示这些问题如何在更大系统里重新出现。 ## 七、三个综合问题及答案 **问题1:机器人学习是否终将统一为更大的VLA,其他方法就不再重要?** 答案:通用接口可以扩大覆盖,但没有消除动力学、控制延迟、奖励与状态分布问题。VLA 的动作头可以使用扩散或流匹配,部署可以依赖低层控制,继续学习可以使用强化学习或世界模型。统一的是接口的一部分,物理闭环仍由多个层次共同完成。 **问题2:一篇论文的最终成功率更高,怎样判断它真正改进了什么?** 答案:先把数据、先验、动作接口、计算预算和评估起点对齐,再看同设置消融。若不能完全对齐,应将结论限定为“完整系统在这些条件下更好”,不要把收益全部归给一个新模块。还应同时检查阶段得分、失败任务和成本。 **问题3:为什么最值得做的复现,有时是一个很小的反例实验?** 答案:大型系统复现成本高,而且多个变化可能掩盖机制。固定模型后改变一个延迟、一个分布偏移或一个接触条件,能够更直接检验核心假设。小实验不能证明广泛有效,却能有效识别解释的适用边界,并指导下一轮更有价值的实验。