Home
/
强化学习
/
发展时间线总览
# 强化学习发展时间线总览:从早期基础到 2026 年 [返回 60 篇精读目录](README.md) · [阅读系列收尾](61-系列收尾.md) 强化学习的发展始终围绕一个问题:如何从有限的反馈中,学会获得更高的长期回报。价值估计、策略优化与环境建模提供了三类互相连接的工具;深度网络、离线数据和语言模型又不断改变它们的使用场景。 从 Bellman 方程到 Q-learning,从 DQN、PPO 到世界模型与推理强化学习,这条时间线关注每个阶段的瓶颈、代表方法,以及新方法继承了什么、改变了什么。 ## 先看整条时间线 ```mermaid flowchart TD A["1950s—1980s:理论与早期学习控制
动态规划、Bellman 方程、早期 Actor–Critic"] B["1988—1999:经典强化学习成形
TD、Q-learning、SARSA、REINFORCE、Dyna、Options"] C["2000—2012:函数逼近与数据利用
批量学习、策略搜索、样本效率"] D["2013—2016:深度强化学习突破
DQN、TRPO、DDPG、GAE、A3C、AlphaGo"] E["2017—2018:稳定性与规模化
PPO、Rainbow、TD3、SAC、IMPALA、AlphaZero"] F["2019—2021:世界模型与离线学习
MuZero、Dreamer、CQL、IQL、Decision Transformer"] G["2022—2024:语言模型对齐与通用控制
InstructGPT、DPO、DreamerV3、TD-MPC2、GRPO"] H["2025:推理强化学习与世界模型扩展
DeepSeek-R1、DAPO、Dr. GRPO、Dreamer 4"] I["2026:近期研究
世界模型与策略联合优化
真实机器人、长任务信用分配、测试时学习"] A --> B --> C --> D --> E --> F --> G --> H --> I ``` 图中箭头表示时间推进,**不表示后一代全面替代前一代**。例如 SAC、PPO、Q-learning 的思想仍然存在于后来的系统里。 有三个概念需要先摆正: | 概念 | 准确理解 | |---|---| | **Q 值** | 一个量:在状态 \(s\) 下执行动作 \(a\),随后按某种策略行动,预计能获得多少累计回报。它本身不是算法。 | | **Actor–Critic** | 一种架构:Actor 学“怎么行动”,Critic 学“行动或状态有多好”,再帮助 Actor 更新。它不是 DQN 之后才出现的。 | | **PPO 与 DPO** | PPO 是策略梯度方法,通常使用 Actor–Critic 实现;DPO 指直接偏好优化,原始方法通过偏好数据直接训练策略,不走传统在线 RL 采样更新流程。 | PPO 与 DPO 的分类依据分别见原始论文:[PPO](https://arxiv.org/abs/1707.06347)、[DPO](https://arxiv.org/abs/2305.18290)。 --- ## 1950s—1999:建立“从奖励中学习”的基本方法 这一阶段形成了之后几十年不断复用的核心概念:价值、策略、TD 误差、模型、信用分配。 | 时间 | 代表工作 | 当时的问题 | 核心想法与历史位置 | |---|---|---|---| | 1950s | Bellman:动态规划、MDP | 连续做很多次决策,怎样考虑长期收益? | 把长期决策递归分解成“当前奖励+未来价值”,构成价值迭代、策略迭代及后续 RL 的数学基础。 | | 1983 | Barto、Sutton、Anderson:早期学习控制 | 没有正确动作标签,如何学会控制倒立摆? | 将行动选择与评价机制分开,是早期 **Actor–Critic** 的重要代表。[作者论文目录](https://people.cs.umass.edu/~barto/pubs-Barto.html) | | 1988 | Sutton:**TD Learning** | 必须等到任务结束,才能更新对局面的判断吗? | 用下一时刻的价值估计修正当前估计,即“自举”;成为 Q-learning 和许多 Critic 更新的基础。[原论文](https://doi.org/10.1007/BF00115009) | | 1989/1992 | Watkins;Watkins & Dayan:**Q-learning** | 不知道环境转移规律,如何学最优动作? | 从交互样本更新动作价值,用下一状态的最大 Q 值构造目标;1992 年论文给出相应条件下的收敛证明。[原论文](https://doi.org/10.1007/BF00992698) | | 1990 | Sutton:**Dyna** | 真实交互昂贵,能否利用已有经验多练习? | 同时学习环境模型,并用模型生成的经验辅助价值或策略学习,将学习与规划结合。[原论文](https://doi.org/10.1016/B978-1-55860-141-3.50030-4) | | 1992 | Williams:**REINFORCE** | 能否直接学习动作概率,而不是先学 Q 再选动作? | 用采样回报构造策略梯度,提高高回报动作的概率;方法直接,但梯度方差较大。[原论文](https://doi.org/10.1007/BF00992696) | | 1994 | Rummery & Niranjan:**SARSA 的早期形式** | 如何评价包含探索行为在内的当前策略? | 用实际采样到的下一动作更新 Q,而不是取最大 Q;代表 on-policy TD 控制。[原报告](https://citeseerx.ist.psu.edu/document?doi=5eb4a564d2c116a614b9d35aa1f320bb396ced97&repid=rep1&type=pdf) | | 1999 | Sutton 等:**Policy Gradient Theorem** | 策略由函数或神经网络表示时,如何有理论依据地优化? | 建立函数逼近下的策略梯度理论,支撑现代策略优化与 Actor–Critic。[原论文](https://proceedings.neurips.cc/paper_files/paper/1999/hash/464d828b85b0bed98e80ade0a5c43b0f-Abstract.html) | | 1999 | Sutton、Precup、Singh:**Options** | 长任务只按单步动作学习,规划跨度太大。 | 将持续多步的行为表示为技能或选项,奠定层次强化学习的基础。[原论文](https://www.sciencedirect.com/science/article/pii/S0004370299000521) | 这里最值得理解的是 Q-learning 的更新: \[ Q(s,a)\leftarrow Q(s,a)+ \alpha\left[r+\gamma\max_{a'}Q(s',a')-Q(s,a)\right] \] 意思是:**把当前判断,往“实际收到的奖励+下一步最好的预期收益”靠近一点。** 而策略梯度走另一条路:**直接调整行动概率,让能带来较高回报的行为更容易发生。** --- ## 2000—2012:从小表格走向函数逼近 这段时间不是空白期。研究重心逐渐转向: - **状态太多,存不下 Q 表**:用线性模型、核方法、树模型、神经网络近似价值或策略。 - **样本太贵**:批量复用历史转移数据,而不只交互一步更新一步。 - **策略更新不稳定**:研究自然梯度、策略搜索和更可靠的价值估计。 - **任务太长**:继续发展层次学习、技能与时间抽象。 这也是理解 DQN 的必要背景:**DQN 的贡献不是第一次想到“神经网络+强化学习”,而是在高维视觉任务上,把深度价值学习做到了有突破性的实际效果。** --- ## 2013—2016:深度强化学习突破,三条主线同时发展 | 时间 | 代表论文/算法 | 主要解决什么问题 | 改进了什么 | |---|---|---|---| | 2013 | **DQN 初版**:Playing Atari with Deep Reinforcement Learning | 游戏画面无法放进传统 Q 表。 | 用卷积网络直接从像素预测各动作的 Q 值,结合经验回放学习。[论文](https://arxiv.org/abs/1312.5602) | | 2014 | **DPG**:Deterministic Policy Gradient Algorithms | 连续动作下,很难枚举所有动作找最大 Q。 | 学一个直接输出连续动作的策略,通过 Q 对动作的梯度改善策略。[论文](https://proceedings.mlr.press/v32/silver14) | | 2015 | **DQN Nature 版** | 深度网络、自举目标及相关样本组合容易不稳定。 | 经验回放与目标网络成为关键设计,在 Atari 上展示端到端学习能力。[论文](https://www.nature.com/articles/nature14236) | | 2015 | **TRPO** | 策略梯度一步更新太大,性能可能崩掉。 | 用信赖域思想约束策略变化,追求更稳定的更新。[论文](https://arxiv.org/abs/1502.05477) | | 2015 | **GAE** | 优势估计噪声大;估计越短又可能偏差越大。 | 混合不同步长的 TD 信息,调节偏差与方差;后来常与 PPO 搭配。[论文](https://arxiv.org/abs/1506.02438) | | 2015/2016 | **DDPG** | DQN 很难直接处理机器人力矩等连续动作。 | 将 DPG、深度网络、经验回放和目标网络结合,形成 off-policy Actor–Critic。[论文](https://arxiv.org/abs/1509.02971) | | 2015/2016 | **Double DQN** | 对带噪声的 Q 取最大值,容易高估动作价值。 | 分离“选动作”和“评价动作”,缓解过估计。[论文](https://arxiv.org/abs/1509.06461) | | 2015/2016 | **Prioritized Experience Replay** | 均匀回放没有区分经验的学习价值。 | 更频繁地重放高优先级经验,并修正采样偏差,提高数据利用率。[论文](https://arxiv.org/abs/1511.05952) | | 2015/2016 | **Dueling DQN** | 许多状态下,不需要逐个动作重新学习整个局面的价值。 | 分开表示状态价值和动作优势,再组合成 Q。[论文](https://arxiv.org/abs/1511.06581) | | 2016 | **A3C** | 深度 RL 训练慢、单路交互样本相关性强。 | 多个工作进程异步采样与更新,推广深度 Actor–Critic。[论文](https://arxiv.org/abs/1602.01783) | | 2016 | **AlphaGo** | 围棋搜索空间巨大,纯搜索与纯价值估计都不够。 | 将监督学习、强化学习、策略网络、价值网络与蒙特卡洛树搜索结合。[论文](https://www.nature.com/articles/nature16961) | ### 这一时期形成的分支关系 ```mermaid flowchart TD Q["Q-learning
学习动作价值"] --> DQN["DQN
神经网络表示 Q"] DQN --> DD["Double DQN
减少高估"] DQN --> DU["Dueling DQN
价值与优势分解"] DQN --> PER["优先经验回放
改善数据利用"] PG["REINFORCE/策略梯度"] --> TR["TRPO 2015"] TR --> PPO["PPO 2017"] AC["Actor–Critic
策略与价值协同学习"] --> A3C["A3C 2016"] AC --> DDPG["DDPG 2015"] DPG["DPG 2014"] --> DDPG DDPG --> TD3["TD3 2018"] AC --> SAC["SAC 2018"] AC -.->|"常见实现架构"| PPO GAE["GAE 2015
优势估计"] -.->|"常用组件"| PPO ``` **注意:Dueling DQN 的两个分支不是 Actor 和 Critic。**它们共同组成一个 Q 网络,仍属于价值方法。 --- ## 2017—2018:让算法更稳定、更高效、更能扩展 | 时间 | 代表论文/算法 | 原来的瓶颈 | 主要改进 | |---|---|---|---| | 2017 | **PPO** | TRPO 实现和优化过程相对复杂。 | 用裁剪目标等设计抑制过大的策略更新,允许对同批采样进行多轮小批量优化。[论文](https://arxiv.org/abs/1707.06347) | | 2017 | **Deep RL from Human Preferences** | 复杂任务很难手工写出好奖励。 | 让人比较行为片段,学习奖励模型,再用 RL 优化行为;是现代 RLHF 的重要前身。[论文](https://arxiv.org/abs/1706.03741) | | 2017 | **MADDPG** | 多智能体同时学习,使每个智能体看到的环境不断变化。 | 集中式 Critic 利用更多联合信息,执行时各智能体独立行动。[论文](https://arxiv.org/abs/1706.02275) | | 2017 | **C51/Distributional RL** | 一个平均 Q 值丢掉了回报分布的信息。 | 学习累计回报的概率分布,而不只是均值。[论文](https://arxiv.org/abs/1707.06887) | | 2017 | **NoisyNet** | 简单随机动作探索不够灵活。 | 在网络参数中加入可学习噪声,改变探索行为。[论文](https://arxiv.org/abs/1706.10295) | | 2017/2018 | **Rainbow** | DQN 的各种改进分散,组合收益不清楚。 | 集成 Double、Dueling、优先回放、多步回报、分布式价值表示和 NoisyNet,并做消融。[论文](https://arxiv.org/abs/1710.02298) | | 2017/2018 | **AlphaZero** | 能否减少对人类棋谱和领域专用训练流程的依赖? | 在已知规则下,通过自我博弈、策略价值网络和搜索学习棋类任务。[论文](https://arxiv.org/abs/1712.01815) | | 2017/2018 | **QR-DQN** | 如何更灵活地估计回报分布? | 用分位数回归表示分布。[论文](https://arxiv.org/abs/1710.10044) | | 2018 | **TD3** | DDPG 的价值误差被策略利用,训练容易不稳定。 | 双 Critic 取较小值、延迟策略更新、目标策略平滑。[论文](https://arxiv.org/abs/1802.09477) | | 2018 | **SAC** | 连续控制需要兼顾探索、稳定性和样本效率。 | 最大化奖励与策略熵,采用随机策略和 off-policy Actor–Critic。[论文](https://arxiv.org/abs/1801.01290) | | 2018 | **IMPALA** | 大规模分布式采样带来策略滞后。 | 分离采样与学习,用 V-trace 修正相应的 off-policy 偏差。[论文](https://arxiv.org/abs/1802.01561) | | 2018 | **QMIX** | 团队总奖励如何用于学习各智能体的行动价值? | 用单调混合网络组合个体 Q 值,服务合作式多智能体学习。[论文](https://arxiv.org/abs/1803.11485) | | 2018 | **IQN** | 有限个固定分位点限制回报分布表示。 | 用隐式分位数函数学习更灵活的回报分布。[论文](https://arxiv.org/abs/1806.06923) | | 2018 | **RND** | 稀疏奖励环境里,智能体可能一直找不到有用反馈。 | 将预测随机目标网络的误差作为内在奖励,鼓励探索新状态。[论文](https://arxiv.org/abs/1810.12894) | 这里的 **Distributional RL 是“回报分布建模”**;IMPALA 的 distributed 是“分布式计算”,两者不是同一件事。 这一阶段可以记住三组核心对应: - **DQN → Double/Dueling/Rainbow**:把价值学习做得更好。 - **REINFORCE → TRPO → PPO**:把策略更新做得更稳定。 - **DDPG → TD3;最大熵 Actor–Critic → SAC**:把连续动作控制做得更可靠。 --- ## 2019—2021:减少真实交互,利用模型与离线数据 | 时间 | 代表论文/算法 | 原来的瓶颈 | 主要改进 | |---|---|---|---| | 2018/2019 | **BCQ** | 固定数据中没出现过的动作,Q 估计容易不可靠。 | 限制策略选择接近数据支持范围的动作,缓解离线学习中的外推误差。[论文](https://arxiv.org/abs/1812.02900) | | 2019/2020 | **MuZero** | AlphaZero 依赖已知的环境规则来搜索。 | 学习供规划使用的潜在动态模型,预测奖励、价值和策略,不要求重建完整观测。[论文](https://arxiv.org/abs/1911.08265) | | 2019/2020 | **Dreamer** | 从像素出发的真实交互成本高。 | 学习潜在世界模型,在“想象轨迹”中训练行为,提升样本利用效率。[论文](https://arxiv.org/abs/1912.01603) | | 2020 | **CQL** | 离线 RL 会过度相信数据分布外动作的高 Q。 | 对价值学习加入保守约束,减少不受数据支持的高估。[论文](https://arxiv.org/abs/2006.04779) | | 2021 | **Decision Transformer** | 能否换一种方式利用离线轨迹? | 将状态、动作、目标回报组织成序列,用 Transformer 预测动作;不依赖传统 TD 更新。[论文](https://arxiv.org/abs/2106.01345) | | 2021/2022 | **IQL** | 如何在离线学习时避免查询未知动作价值? | 使用期望分位回归等设计学习价值,再通过优势加权方式提取策略。[论文](https://arxiv.org/abs/2110.06169) | | 2021/2022 | **MAPPO** | 合作式多智能体任务是否一定需要非常复杂的专用算法? | 系统研究 PPO 在集中训练、分散执行设定下的有效性及关键实现选择。[论文](https://arxiv.org/abs/2103.01955) | 这个阶段要区分两组经常混淆的概念: | 维度 | 区别 | |---|---| | **Model-free/Model-based** | 是否利用环境动态模型进行学习或规划;这里的“模型”不是泛指神经网络。 | | **Off-policy/Offline** | Off-policy 可以一边采新数据一边复用旧数据;Offline 通常只使用固定数据,不能靠新交互及时修正错误。 | 因此,**SAC 是 off-policy,但不意味着原版 SAC 就适合直接用于固定离线数据。** --- ## 2022—2024:语言模型对齐,以及更通用的世界模型 | 时间 | 代表论文/算法 | 问题 | 主要改进 | |---|---|---|---| | 2022 | **InstructGPT** | 预测下一个词的能力,不等于遵循人类意图。 | 将监督微调、人类偏好奖励模型与 PPO 结合,形成有代表性的语言模型 RLHF 流程。[论文](https://arxiv.org/abs/2203.02155) | | 2023 | **DreamerV3** | 世界模型方法往往需要针对不同任务反复调参。 | 通过统一且更稳健的训练设计,扩展到多种视觉和控制任务。[论文](https://arxiv.org/abs/2301.04104) | | 2023 | **DPO** | 奖励模型+在线采样+RL 更新的对齐流程复杂。 | 从 KL 正则化的奖励优化问题推导偏好损失,直接优化策略,原始训练不需要显式奖励模型和在线 RL 回路。[论文](https://arxiv.org/abs/2305.18290) | | 2023/2024 | **TD-MPC2** | 世界模型控制如何扩展到更多任务与更大模型? | 扩展潜在空间模型预测控制,强调多任务学习、规模化和训练稳健性。[论文](https://arxiv.org/abs/2310.16828) | | 2024 | **DeepSeekMath/GRPO** | 大模型 PPO 训练额外的价值模型成本高。 | 对同一问题采样一组回答,以组内奖励构造相对优势,省去独立价值模型。[论文](https://arxiv.org/abs/2402.03300) | | 2024 | **SimPO** | 偏好优化能否进一步简化? | 用长度归一化的序列对数概率构造隐式奖励,并引入奖励间隔,训练不需要参考模型。[论文](https://arxiv.org/abs/2405.14734) | ### PPO、DPO 与 Actor–Critic 的关系 ```mermaid flowchart TD P["策略学习"] --> PG["策略梯度"] PG --> RE["REINFORCE"] PG --> TR["TRPO"] TR --> PP["PPO"] AC["Actor–Critic 架构"] -.->|"通常用于实现"| PP H["人类或 AI 偏好数据"] --> RM["学习奖励模型"] RM --> RLHF["使用 PPO 等方法优化策略"] PP --> RLHF H --> DPO["DPO 2023
直接偏好优化"] DPO --> VAR["偏好优化相关发展
如 SimPO 2024"] PP -.->|"借鉴裁剪策略优化"| GR["GRPO 2024
组内相对优势,无独立 Critic"] R["规则奖励/验证器/奖励模型"] --> GR GR --> R1["DeepSeek-R1 2025"] GR --> DA["DAPO/Dr. GRPO 2025"] ``` 虚线表示架构使用或思想关联,不表示完全等价。 特别注意: - **没有 Critic,不等于没有奖励。**GRPO 仍需要奖励信号。 - **RLHF 是训练范式,PPO 是可使用的优化算法。** - **RLVR 是奖励来源设定**——例如答案校验、代码测试——不是某一种固定优化器。 - **DPO 不是 DQN 的后继,也不是 PPO 的简单升级版。** --- ## 2025:强化学习推动推理,同时开始审视训练偏差 | 时间 | 代表论文/系统 | 核心问题 | 主要进展 | |---|---|---|---| | 2025.01 | **DeepSeek-R1/R1-Zero** | 在已有预训练能力上,大规模 RL 能怎样增强推理? | R1-Zero 探索不经过前置 SFT 的 RL 训练;R1 加入冷启动数据和多阶段流程,改善推理表现及可用性。[论文](https://arxiv.org/abs/2501.12948) | | 2025.03 | **DAPO** | 长推理 RL 存在熵下降、样本有效性、长度与训练稳定性问题。 | 提出 Clip-Higher、动态采样、token 级损失和超长奖励处理,公开规模化训练方案。[论文](https://arxiv.org/abs/2503.14476) | | 2025.03 | **Dr. GRPO** | 推理提升究竟来自基础模型还是 RL?优化目标是否鼓励无效变长? | 分析基础模型影响及 GRPO 优化偏差,修改目标以改善 token 效率。[论文](https://arxiv.org/abs/2503.20783) | | 2025.09 | **Dreamer 4** | 如何从离线视频和数据中学习更准确、可扩展的世界模型,并在其中训练行为? | 使用可扩展世界模型开展想象训练;论文报告仅依靠离线数据训练,在 Minecraft 中完成获取钻石任务。[论文](https://arxiv.org/abs/2509.24527) | **“R1-Zero 没有前置 SFT”不等于“从零开始、不靠知识就学会推理”**。它仍然从已经预训练的模型出发。理解基础模型提供了什么,是这一时期的重要研究问题。 --- ## 2026:截至 9 月的近期研究样例 这些工作时间很近,下表说明的是它们提出的问题与方法;不能据此认定某条路线已经全面胜出。 | 首次公开时间 | 论文 | 想解决什么问题 | 方法与所处路线 | |---|---|---|---| | 2026.05.25 | **MBDPO**:Scaling World-Model Reinforcement Learning Through Diffusion Policy Optimization | 世界模型中的搜索与价值学习使用的策略不一致,影响策略改进。 | 用扩散策略表示,把搜索轨迹与策略优化联系起来;属于世界模型、生成式策略与 RL 的交叉。[论文](https://arxiv.org/abs/2605.26282) | | 2026.07.02 | **WorldSample** | 真机交互昂贵,合成经验又可能有幻觉并导致价值高估。 | 建立真实交互—世界模型增广—策略更新闭环,通过样本选择和调度控制合成数据使用。[论文](https://arxiv.org/abs/2607.02431) | | 2026.08.07 | **FACTOR** | 多轮 Agent 的最终奖励,如何分配到动作及动作内部的 token? | 将轨迹到动作、动作到 token 的信用分配分开处理,结合 TD 残差与细粒度分配。[论文](https://arxiv.org/abs/2608.07118) | | 2026.08.27 | **TTPO** | 测试时没有标准答案,如何继续改善策略? | 结合多数投票伪标签、在线策略自蒸馏与分组 RL,针对不同采样结果采用不同更新方式。[论文](https://arxiv.org/abs/2608.27448) | | 2026.09.03 | **DRACO** | 很多长任务没有程序化验证器;整个轨迹只有一个分数,难以指导几十步行动。 | 动态生成评分准则,把轨迹评价重新分配到相关步骤,形成 GRPO 的逐步优势信号。[论文](https://arxiv.org/abs/2609.04094) | **从这些工作可以看出的研究问题变化**是:关注点从“单个动作怎么选”,扩展到“长任务怎么归因、奖励从哪里来、模拟经验是否可靠、部署时能否继续学习”。这是一种基于上述论文的归纳,不是统一的行业排名。 --- ## 把整段历史折叠成一张技术架构图 这里的分支是阅读路径,彼此可以交叉;例如 Dreamer 同时包含世界模型和 Actor–Critic。 ```mermaid flowchart TD RL["强化学习及相关决策学习"] RL --> V["价值方法
学 V 或 Q,再据此决策"] V --> V1["TD → Q-learning/SARSA"] V1 --> V2["DQN → Double/Dueling/PER"] V2 --> V3["C51/QR-DQN/IQN/Rainbow"] V1 --> V4["离线价值学习
CQL/IQL"] RL --> P["策略方法
直接优化策略"] P --> P1["REINFORCE → 策略梯度理论"] P1 --> P2["TRPO → PPO"] P2 --> P3["GRPO → DAPO/Dr. GRPO"] P3 --> P4["推理与多轮 Agent RL"] RL --> AC["Actor–Critic
价值指导策略"] AC --> AC1["A3C/A2C"] AC --> AC2["DPG → DDPG → TD3"] AC --> AC3["SAC:最大熵学习"] AC -.->|"常见实现"| P2 RL --> M["模型与规划"] M --> M1["Dyna:真实与模拟经验"] M --> M2["AlphaGo/AlphaZero:已知规则搜索"] M2 --> M3["MuZero:学习规划模型"] M1 --> M4["Dreamer → V3 → 4"] M --> M5["TD-MPC2/2026 世界模型研究"] RL --> DATA["数据与反馈路线"] DATA --> O["Offline RL
BCQ/CQL/IQL"] DATA --> S["轨迹序列建模
Decision Transformer"] DATA --> H["偏好学习
RLHF/DPO/SimPO"] DATA --> R["可验证奖励
数学、代码、任务检查器"] RL --> CROSS["跨分支问题"] CROSS --> EX["探索:NoisyNet/RND"] CROSS --> HI["层次与技能:Options"] CROSS --> MA["多智能体:MADDPG/QMIX/MAPPO"] CROSS --> CR["长期信用分配
FACTOR/DRACO"] ``` ## 核心阅读路线 建立算法基础后,再进入离线学习、世界模型与语言模型专题,可以沿以下路线阅读: **Q-learning → REINFORCE → DQN → DPG/DDPG → GAE → TRPO → PPO → TD3/SAC → CQL/IQL → Dreamer/MuZero → InstructGPT → DPO → GRPO → DeepSeek-R1 → DAPO/Dr. GRPO → 2026 专题论文。** 其中最先吃透的五个问题是:**Q 在估计什么、策略如何更新、Critic 起什么作用、数据来自哪里、奖励如何产生。**带着这五个问题读,后面的大多数新算法都能放回这张图中。 ## 延伸阅读 [系列目录](README.md)提供各篇论文的背景、公式、伪代码与实验分析;[系列收尾](61-系列收尾.md)进一步比较算法,并给出教学实验和证据疑点。时间线按历史发展组织,核心阅读路线则兼顾先修关系。 ## 时间与选文口径 文献范围截至 2026 年 9 月 8 日。年份优先采用首次公开时间,必要时补充正式发表年份。所选论文覆盖主要技术路线;2026 年工作作为近期研究样例,其长期影响仍有待检验。