MyLog
返回 Articles
Reinforcement Learning 60 篇精读

强化学习 60 篇论文:从预测、控制到推理与 Agent

强化学习算法看似分支繁多,核心问题却彼此相连:价值如何估计,策略如何更新,经验从哪里来,奖励又如何分配到动作。本系列以 60 篇代表论文为线索,串联早期控制、深度价值学习、策略梯度、探索与模仿、多智能体、离线学习、世界模型和语言模型强化学习。

每篇文章怎么读

  1. 一分钟讲明白:问题、旧方法瓶颈、核心办法、最重要证据和一句话结论。
  2. 背景与问题定义:研究设定、任务意义、观测/动作/奖励/终止、假设。
  3. 方法到底改了什么:继承与新增组件、信息流、公式拆解、教学伪代码、实现陷阱。
  4. 实验如何验证:任务、数据、基线、预算、随机性与评价协议。
  5. 证据有多强:关键图表或定理能支持什么、不能证明什么。
  6. 贡献与局限:新意、代价、失败情形、理论前提与复现障碍。
  7. 建立理解:自构例子、前置概念、后续问题,最后用一张表收束。

全系列架构

这些维度不是互斥分类。PPO 常与 Critic、GAE 配合;SAC 是无模型 Actor–Critic;Dreamer 同时包含世界模型与 Actor–Critic。

flowchart TD RL[强化学习:序列决策] --> V[价值学习] RL --> P[策略梯度] RL --> M[模型学习与规划] RL --> X[其他研究维度] V --> TD[TD → Q-learning / SARSA → Double Q] TD --> DQN[DQN → Double DQN / PER / Dueling → C51 / Rainbow] P --> PG[REINFORCE → 策略梯度定理 → 自然梯度 → TRPO / PPO] P --> AC[Actor–Critic:策略与价值协作] AC --> CONT[DPG / DDPG → TD3 / SAC] AC --> ASYNC[A3C → IMPALA] M --> DYNA[Dyna → PETS / MBPO] M --> WM[Dreamer → DreamerV3] M --> SEARCH[AlphaGo → MuZero] X --> OFF[离线:LSPI → BCQ / BEAR / CQL / IQL / DT] X --> EXP[探索与技能:ICM / HER / RND / DIAYN / Options] X --> MULTI[多智能体:MADDPG / QMIX] X --> IM[模仿与偏好:GPS / GAIL / InstructGPT / DPO / IPO / KTO] PG --> LLM[语言模型 RL:GRPO → R1 → DAPO / Dr. GRPO] LLM --> NEW[2026:测试时适应与 Agent 信用分配]

60 天目录

最小阅读路线

按日期通读适合建立历史脉络。需要快速搭建最小基础时,可先走:

Q-learning → REINFORCE → DQN → DPG/DDPG → TRPO/GAE/PPO → TD3/SAC

再进入离线学习、世界模型或语言模型强化学习等专题。