Reinforcement Learning
60 篇精读
强化学习 60 篇论文:从预测、控制到推理与 Agent
强化学习算法看似分支繁多,核心问题却彼此相连:价值如何估计,策略如何更新,经验从哪里来,奖励又如何分配到动作。本系列以 60 篇代表论文为线索,串联早期控制、深度价值学习、策略梯度、探索与模仿、多智能体、离线学习、世界模型和语言模型强化学习。
每篇文章怎么读
- 一分钟讲明白:问题、旧方法瓶颈、核心办法、最重要证据和一句话结论。
- 背景与问题定义:研究设定、任务意义、观测/动作/奖励/终止、假设。
- 方法到底改了什么:继承与新增组件、信息流、公式拆解、教学伪代码、实现陷阱。
- 实验如何验证:任务、数据、基线、预算、随机性与评价协议。
- 证据有多强:关键图表或定理能支持什么、不能证明什么。
- 贡献与局限:新意、代价、失败情形、理论前提与复现障碍。
- 建立理解:自构例子、前置概念、后续问题,最后用一张表收束。
全系列架构
这些维度不是互斥分类。PPO 常与 Critic、GAE 配合;SAC 是无模型 Actor–Critic;Dreamer 同时包含世界模型与 Actor–Critic。
flowchart TD
RL[强化学习:序列决策] --> V[价值学习]
RL --> P[策略梯度]
RL --> M[模型学习与规划]
RL --> X[其他研究维度]
V --> TD[TD → Q-learning / SARSA → Double Q]
TD --> DQN[DQN → Double DQN / PER / Dueling → C51 / Rainbow]
P --> PG[REINFORCE → 策略梯度定理 → 自然梯度 → TRPO / PPO]
P --> AC[Actor–Critic:策略与价值协作]
AC --> CONT[DPG / DDPG → TD3 / SAC]
AC --> ASYNC[A3C → IMPALA]
M --> DYNA[Dyna → PETS / MBPO]
M --> WM[Dreamer → DreamerV3]
M --> SEARCH[AlphaGo → MuZero]
X --> OFF[离线:LSPI → BCQ / BEAR / CQL / IQL / DT]
X --> EXP[探索与技能:ICM / HER / RND / DIAYN / Options]
X --> MULTI[多智能体:MADDPG / QMIX]
X --> IM[模仿与偏好:GPS / GAIL / InstructGPT / DPO / IPO / KTO]
PG --> LLM[语言模型 RL:GRPO → R1 → DAPO / Dr. GRPO]
LLM --> NEW[2026:测试时适应与 Agent 信用分配]
60 天目录
最小阅读路线
按日期通读适合建立历史脉络。需要快速搭建最小基础时,可先走:
Q-learning → REINFORCE → DQN → DPG/DDPG → TRPO/GAE/PPO → TD3/SAC
再进入离线学习、世界模型或语言模型强化学习等专题。