Home
/
强化学习
/
系列收尾
# 系列收尾|把 60 篇论文连成可检验的理解 [返回系列首页](README.md) 理解一个算法,不仅要能写出更新公式,还要知道它依赖哪些信息、改善了什么指标,以及在什么条件下可能失败。把相近方法放在一起比较,再构造能够推翻直觉的实验,才能把零散论文连成可检验的认识。 ## 横向比较:相近算法的关键差异 | 对照 | 真正不同在哪里 | 容易混淆的地方 | |---|---|---| | Q-learning / REINFORCE | 前者更新动作价值;后者更新随机策略参数 | 有动作不等于有独立 Actor 网络 | | DQN / DDPG | 前者在离散动作中比较 Q;后者学习输出连续动作的 Actor | 深度网络只是表示方式,不决定算法类别 | | DPG / DDPG | 前者提供确定性策略梯度理论及算法;后者结合深度网络稳定化组件 | 不能把 DPG 理论直接当 DDPG 神经实现保证 | | GAE / PPO | 一个估计优势,一个定义策略更新机制 | GAE 不是 PPO 之前被替代的一代算法 | | TRPO / PPO | KL 约束近似优化与裁剪/惩罚替代目标 | PPO 裁剪不是硬 KL 保证 | | DDPG / TD3 | TD3 专门控制价值误差及其传播 | 双 Critic 不等于真实回报下界 | | TD3 / SAC | 前者确定策略;后者最大熵随机策略 | SAC 的熵进入目标和价值,不只加探索噪声 | | CQL / IQL | 保守价值正则与只查询数据动作的价值学习 | 二者都不能凭空补全缺失数据覆盖 | | Dreamer / MuZero | 主要在想象中训练 Actor,与行动时搜索 | 二者都有学习模型,计算放置不同 | | PPO / DPO | 在线采样的策略优化与固定偏好对损失 | DPO 不是适用于所有 MDP 的 PPO 替代品 | | PPO / GRPO | 学习价值基线与组内比较基线 | GRPO 无独立 Critic,但仍有奖励和 rollout 成本 | | DAPO / Dr. GRPO | 多项训练配方修正与特定归一化偏差分析 | 两者处理长度相关问题,但分母并不相同 | | FACTOR / DRACO | TD 决定动作级正负贡献,或 judge 对轨迹优势做保符号分配 | 均非已验证的独立 token 因果解释器 | | TTPO / 普通后训练 | 部署/测试时继续更新参数 | 需要另计适应预算及检查点选择协议 | 上述表是教学归纳,具体设定以各篇链接版本为准。 ## 统一实验阅读方法:哪些结果能够放在一起比较 **先确定实验单位。** 经典控制可能按环境 step 或 frame 计;语言模型可能按 prompt、rollout、token 或 optimizer step 计;Agent 还可能有工具调用和中间状态重启。不同单位的“训练 100 步”没有直接可比性。 | 要核对的项目 | 为什么影响结论 | |---|---| | 起始模型、网络、预训练 | 更强基座可能解释一部分收益 | | 真实数据、合成数据、示范、奖励标签 | 相同优化器不代表相同信息预算 | | 环境交互与生成总 token | 同样更新次数可能消耗完全不同的样本量 | | GPU 时间、模型调用、人工干预 | 样本效率不是完整计算或人力效率 | | 奖励与评估是否独立 | 被优化的评分器可能高估模型改善 | | 随机种子与评估重复 | 一个训练种子上生成 32 次,不等于 32 个训练种子 | | 误差条定义 | 标准差、标准误、极差、置信区间不可互换 | | 检查点选择 | 报告测试集上的最佳检查点可能引入选择偏差 | | 环境与数据版本 | Atari 协议、Gym 与 D4RL 版本变化会影响分数 | | 消融的其他配置 | 移除模块时也改变训练预算,难以单独归因 | **区分三个常见语言模型指标。** - Avg@k:同题采 k 次后平均正确率,常用于降低单次采样评估噪声。 - Pass@k:k 个候选至少一个成功的概率或相应估计,通常会随候选数增加。 - Majority vote:选 k 个回答中最常出现的答案,再算正确率。 多轮 Agent 的 $pass^k$ 又可能表示 k 次全部成功的一致性指标。必须逐篇查看定义。 **区分两类论证。** Bellman 收敛、梯度恒等式、望远镜求和是数学结论,各有前提;真实网络的稳定性、泛化和成本主要靠实验回答。一个漂亮恒等式不能自动证明其学习到的中间量准确,一个好分数也不能单独证明作者提出的机制解释唯一正确。 ## 三个贯穿系列的教学实验 三个实验分别检验价值高估、长度归一化和模型误差,连接本系列的主要方法。以下均为尚未运行的教学方案;可手算的结果单独列出,训练效果需要实际实验验证。 ### 实验 A:高估、覆盖与保守性 固定两动作bandit的真实奖励分布,例如A均值1、B均值0、二者标准差1。先单独建立一个不均衡数据集:A有100条,B仅1条且恰好观测到3。这一条件数据集用于演示,不能用于宣称无条件平均性能。 实验分成两条线:第一条在相同完整数据上比较估值和选出的动作;第二条重新随机生成许多数据集,比较期望表现。Double Q应按其抽样/更新机制训练,不能在两套完全相同的精确样本均值上假装得到了独立去偏。 | 项目 | 预先指定的方案 | |---|---| | 自变量 | B样本数1、5、20、100;奖励噪声;保守正则强度 | | 对比 | 单Q、双估计、简化保守价值目标 | | 固定 | 同一轮试验的数据、动作真值、训练更新总量 | | 主要指标 | 选中真实较优动作的比例、估值偏差、真实策略收益 | | 不确定性 | 建议至少30个独立数据种子;报告分布与置信区间 | | 可能推翻预期的结果 | 双估计未改善覆盖不足;过强正则错压真正好动作 | ```text for independent_seed in 预先固定的种子列表: 生成同一份训练数据供各方法使用 for method in [单Q, 双估计, 保守目标]: 以相同更新预算训练 冻结策略,用独立奖励样本评估 保存估值、真实均值差、选动作与收益 按种子配对比较,不能只保留最漂亮的一次 ``` 它把Double Q/Double DQN、TD3、BCQ/BEAR、CQL/IQL联系起来。**假设而非结果**:减少估值高估可能改善动作选择,但无法替代缺失的信息。 ### 实验 B:长度分母到底改变哪个量 令两回答长度分别10和100,优势都为+1,G=2,固定最大长度100。以下是ρ=1、裁剪前的系数手算。 | 归约 | 短回答每token | 长回答每token | 短回答系数总和 | 长回答系数总和 | |---|---:|---:|---:|---:| | 每回答先平均,再对2条平均 | 1/20 | 1/200 | 0.5 | 0.5 | | 全部有效token平均 | 1/110 | 1/110 | 10/110 | 100/110 | | 固定 G×Lmax 分母 | 1/200 | 1/200 | 0.05 | 0.5 | 优势全为−1时表中系数翻转符号,绝对比例不变。本批中全局token平均与固定分母只差整体尺度,但换成其他长度批次,尺度比例会变;它们跨batch的优化过程不等价。 第二阶段才做训练实验:使用同一批轨迹、同一模型起点、同一优化器,分别记录梯度范数、有效KL、正确/错误回答长度与独立题正确率。先控制学习率,再另做匹配梯度尺度的对照,避免把纯幅度差当成新机制。 对于FACTOR,要同时验证动作内权重均值为1和action-mean归约;对于DRACO,要验证token系数总和保持AN。两者守恒对象不同,均不能推出参数梯度向量守恒。 ### 实验 C:模型误差如何被策略利用 真实一维环境为s'=s+a,动作限制[-1,1],目标位置设为5。学习模型在指定区间错误预测s'=s+2a,其他位置准确。回报可用负目标距离,另报告实际到达率,防止代理回报掩盖任务失败。 | 项目 | 预先指定的方案 | |---|---| | 自变量 | 想象长度1、3、10;误差区间;模型误差幅度 | | 对比 | 长规划、短分支、加入末端价值、加入数据分布约束 | | 固定 | 真实数据量、候选动作总预算、初始状态集合 | | 两组预算 | 一组匹配真实交互量;一组匹配全部计算时间 | | 指标 | 想象收益、真实收益、二者差、到达率、控制延迟 | | 关键对照 | 给准确模型的oracle上界;给错误价值尾部的敏感性分析 | ```text 固定真实环境与带局部误差的模型 对每组初始状态与算法配置: 在模型内选动作/训练Actor 记录模型预测的回报 在真实环境执行同一策略并独立评价 保存想象—真实差距与是否进入误差区域 比较短rollout、价值尾部和分布约束各自的作用 ``` 这连接Dyna、PETS、MBPO、Dreamer、MuZero、MBDPO与WorldSample。**假设而非结果**:更长规划可能找到更好的真实方案,也可能更善于利用模型漏洞;实验应允许两种结果出现。 ## 三处值得进一步验证的证据疑点 1. **WorldSample 数字口径**:摘要的成功率增幅,与表 1 展示均值直接相减的结果不同;步数和时间降幅对应标签也需核对。表中数据的直接计算与摘要表述存在差异,原因尚待澄清。 2. **MBDPO 扩展趋势**:正文提到较大模型在某个数据设置下降,因此不能只引用概括性的“单调扩展”。能量与行为密度的对应也依赖负样本假设。 3. **TTPO 评估协议**:无标签测试时更新加峰值检查点报告,与固定模型的独立测试不是相同设定。需要补充预先指定检查点和完整成本才能支持更强比较。 上述疑点来自论文文本分析,仍需作者说明或独立实验加以澄清。 ### 证据链与澄清方式 | 疑点 | 当前能确定的内容 | 尚不能确定的内容 | 下一步有效证据 | |---|---|---|---| | WorldSample数字口径 | 表1展示均值可以明确手算 | 摘要增幅与标签差异的原始计算口径 | 作者说明权重、未四舍五入数据及日志 | | MBDPO扩展趋势与能量 | 正文写出30任务340M下降;负样本来自错配动作 | 单调说法的限定范围、能量密度假设是否满足 | 分设置曲线、不同负样本分布对照 | | TTPO检查点选择 | 原文说明保存并报告峰值检查点 | 无标签部署如何选点及完整成本 | 预先固定终点、无标签停止规则、所有生成/训练成本 | 这些差异尚不足以判断原因。进一步的解释需要对应版本的原文、计算口径和实验日志支持;来源见 [MBDPO](56-mbdpo.md)、[WorldSample](57-worldsample.md) 与 [TTPO](59-ttpo.md)。 ## 学习检查:怎样判断自己真的读懂 读完一篇论文后,合上正文,尝试完成以下四项自测: 1. **画信息流**:数据从哪里来,奖励谁提供,哪些模型训练、冻结或延迟更新? 2. **写一个核心更新**:说明每个量来自真实样本、网络估计还是搜索,以及哪些路径反向传播。 3. **复述一个证据**:明确任务、基线、指标与预算,说明它支持什么、不能说明什么。 4. **构造一个失败例子**:如缺乏覆盖、模型幻觉、错误多数票、奖励偏差或优势分配错误。 ### 使用 Agent 辅助阅读 以下提示词可用于概念自测和逐步推导: > 按《强化学习 60 篇论文博客》的第 N 篇带我学习。先检查我是否理解它依赖的概念,然后只讲当前最重要的一步。请让我自己解释公式或做一道手算题,依据我的回答继续。区分原论文内容、教学例子与你的分析;核对具体版本与实验条件。不要只用缩写解释缩写,也不要把理论保证直接套在神经网络实现上。 ## 引用版本与证据范围 - 经典理论:Q-learning 1992、REINFORCE 1992、DPG 2014 原文。 - 深度控制:DQN 2015;DDPG arXiv v6、GAE v6、TRPO v5、PPO v2、TD3 v3、SAC v2。版本后缀标明本文引用的文本版本,与论文首次发表年份分别记录。 - 离线与世界模型:CQL v3、IQL v1、Dreamer v3、MuZero v2。 - 语言模型:InstructGPT v1、DPO v2、DeepSeekMath v1、DeepSeek-R1 v1、DAPO v1、Dr. GRPO v1。 - 2026 专题:MBDPO、WorldSample、FACTOR、TTPO、DRACO,均为所链接 v1 文本。 - 论文成绩均引自作者报告;教学手算单独标注。本系列未独立运行原论文训练,尚未核实的实验细节在各篇中注明。 ## 论文来源与阅读范围索引 下表列出各篇的来源版本与阅读范围。“方法/实验相关正文”涵盖文中讨论所依据的段落,完整证明、附录和代码未逐项审核。本系列未独立运行原论文训练;首次发表年份与所引用修订版分别记录。 | 序号 | 文章 | 原始来源/版本 | 阅读范围 | |---|---|---|---| | 1 | [早期 Actor–Critic:让行动者拥有一个评价者](01-actor-critic.md) | *Neuronlike Adaptive Elements That Can Solve Difficult Learning Control Problems*,1983。[原论文](https://www.derongliu.org/adp/adp-cdrom/refs/barto19830834.pdf)。 | 原始资料限于摘要与书目信息,全文尚未可靠获取。现代 Actor–Critic 公式与伪代码用于解释两类组件的作用,并非 1983 年 ASE/ACE 更新规则的精确复刻;实验曲线与数值尚未核实。 | | 2 | [TD(λ):结果还没出现,预测为什么就能学习](02-td-lambda.md) | *Learning to Predict by the Methods of Temporal Differences*,1988。[原论文](https://jmvidal.cse.sc.edu/library/sutton88a.pdf)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 3 | [Dyna:一次真实交互,如何产生多次学习](03-dyna.md) | *Integrated Modeling and Control Based on Reinforcement Learning and Dynamic Programming*,1990。[原论文](https://proceedings.neurips.cc/paper/1990/file/d9fc5b73a8d78fad3d6dffe419384e70-Paper.pdf)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 4 | [Q-learning:从一条经验开始,学会比较未来](04-q-learning.md) | Watkins & Dayan,*Q-learning*,1992。[原文](https://www.gatsby.ucl.ac.uk/~dayan/papers/cjch.pdf)。1989 年博士论文提出算法,此篇重点是收敛证明。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 5 | [REINFORCE:环境不可微,也能沿奖励的梯度学习](05-reinforce.md) | Williams,*Simple Statistical Gradient-Following Algorithms for Connectionist Reinforcement Learning*,1992。[原文](https://gwern.net/doc/reinforcement-learning/model-free/1992-williams.pdf)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 6 | [SARSA:学习实际会执行的行为,而不只学习贪心目标](06-sarsa.md) | *On-line Q-learning using connectionist systems*,1994。[原论文](https://mi.eng.cam.ac.uk/reports/svr-ftp/auto-pdf/rummery_tr166.pdf)。 | 原始技术报告的 PDF 文本提取受限,可靠信息限于书目与可识别段落。SARSA 更新采用标准教学形式;原报告的实验数值、表号和变体细节尚未核实。 | | 7 | [Options:把“到达门口”也当作一个动作](07-options.md) | *Between MDPs and Semi-MDPs: A Framework for Temporal Abstraction in Reinforcement Learning*,1999。[原论文](https://people.eecs.berkeley.edu/~russell/classes/cs294/f05/papers/sutton%2Bal-1999.pdf)。 | 原始资料限于摘要与书目信息,全文尚未可靠获取。下文采用 Options 的标准数学教学形式;原论文的实验曲线、消融与页码尚未核实。 | | 8 | [策略梯度定理:Critic 近似到什么程度才不带偏 Actor](08-policy-gradient-theorem.md) | *Policy Gradient Methods for Reinforcement Learning with Function Approximation*,1999。[原论文](https://papers.nips.cc/paper/1999/file/464d828b85b0bed98e80ade0a5c43b0f-Paper.pdf)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 9 | [自然策略梯度:同样改一个参数,行为变化为什么不同](09-natural-policy-gradient.md) | *A Natural Policy Gradient*,2001。[原论文](https://proceedings.neurips.cc/paper/2001/file/4b86abe48d358ecf194c56c69108433e-Paper.pdf)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 10 | [LSPI:反复利用同一批数据进行策略迭代](10-lspi.md) | *Least-Squares Policy Iteration*,2003。[原论文](https://www.jmlr.org/papers/v4/lagoudakis03a.html)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 11 | [Double Q-learning:为什么取最大值会制造乐观偏差](11-double-q.md) | *Double Q-learning*,2010。[原论文](https://papers.nips.cc/paper/2010/file/091d584fced301b442654dd8c23b3fc9-Paper.pdf)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 12 | [Guided Policy Search:先找到好轨迹,再让策略学会产生它](12-gps.md) | *Guided Policy Search*,2013。[原论文](https://proceedings.mlr.press/v28/levine13.html)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 13 | [DPG:沿价值对动作的梯度,训练连续策略](13-dpg.md) | Silver 等,*Deterministic Policy Gradient Algorithms*,2014。[原文](https://proceedings.mlr.press/v32/silver14.pdf)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 14 | [TRPO:策略更新太猛,为什么会毁掉好不容易学会的行为](14-trpo.md) | Schulman 等,*Trust Region Policy Optimization*,2015。[正文](https://arxiv.org/html/1502.05477v5)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 15 | [GAE:把一串 TD 误差变成更好用的策略优势](15-gae.md) | Schulman 等,*High-Dimensional Continuous Control Using Generalized Advantage Estimation*,2015/2016。[正文](https://arxiv.org/html/1506.02438v6)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 16 | [DQN:让 Q-learning 从像素中学习,先要稳住自举目标](16-dqn.md) | Mnih 等,*Human-level control through deep reinforcement learning*,2015。[原文](https://www.nature.com/articles/nature14236);[可读 PDF](https://web.stanford.edu/class/psych209/Readings/MnihEtAlHassibis15NatureControlDeepRL.pdf)。以前篇 2013 版为背景,本节以 2015 版为准。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 17 | [DDPG:把确定性策略梯度放进深度网络](17-ddpg.md) | Lillicrap 等,*Continuous control with deep reinforcement learning*,2015/2016。[正文](https://arxiv.org/html/1509.02971v6)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 18 | [Double DQN:不用加一整套网络,也能分开选动作与打分](18-double-dqn.md) | *Deep Reinforcement Learning with Double Q-learning*,2015。[原论文](https://arxiv.org/abs/1509.06461)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 19 | [优先经验回放:经验并非都值得同样多次重读](19-per.md) | *Prioritized Experience Replay*,2015。[原论文](https://arxiv.org/abs/1511.05952)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 20 | [Dueling DQN:先判断处境,再判断动作差别](20-dueling-dqn.md) | *Dueling Network Architectures for Deep Reinforcement Learning*,2015。[原论文](https://arxiv.org/abs/1511.06581)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 21 | [AlphaGo:策略、价值与树搜索如何分工](21-alphago.md) | *Mastering the game of Go with deep neural networks and tree search*,2016。[原论文](https://storage.googleapis.com/deepmind-media/alphago/AlphaGoNaturePaper.pdf)。 | 已通过DeepMind原始PDF核对正文训练、搜索、图1—5及部分扩展说明;没有完整审计代码与全部扩展表。下文伪代码聚焦核心分工。 | | 22 | [A3C:用多个环境的异步经验稳定深度学习](22-a3c.md) | *Asynchronous Methods for Deep Reinforcement Learning*,2016。[原论文](https://arxiv.org/abs/1602.01783)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 23 | [GAIL:模仿专家的行为分布,而不只复制单步动作](23-gail.md) | *Generative Adversarial Imitation Learning*,2016。[原论文](https://arxiv.org/abs/1606.03476)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 24 | [ICM:好奇心奖励应该预测什么](24-icm.md) | *Curiosity-driven Exploration by Self-supervised Prediction*,2017。[原论文](https://arxiv.org/abs/1705.05363)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 25 | [MADDPG:训练时看全局,执行时各自行动](25-maddpg.md) | *Multi-Agent Actor-Critic for Mixed Cooperative-Competitive Environments*,2017。[原论文](https://arxiv.org/abs/1706.02275)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 26 | [HER:失败轨迹也能成为另一个目标的成功经验](26-her.md) | *Hindsight Experience Replay*,2017。[原论文](https://arxiv.org/abs/1707.01495)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 27 | [PPO:裁剪替代目标到底限制了什么](27-ppo.md) | Schulman 等,*Proximal Policy Optimization Algorithms*,2017。[PDF](https://arxiv.org/pdf/1707.06347v2)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 28 | [C51:不只预测平均回报,还预测回报分布](28-c51.md) | *A Distributional Perspective on Reinforcement Learning*,2017。[原论文](https://arxiv.org/abs/1707.06887)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 29 | [Rainbow:六种DQN改进叠加后,哪些真的重要](29-rainbow.md) | *Rainbow: Combining Improvements in Deep Reinforcement Learning*,2017。[原论文](https://arxiv.org/abs/1710.02298)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 30 | [SAC:随机性进入目标,而不仅是探索噪声](30-sac.md) | Haarnoja 等,*Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor*,2018。[正文](https://arxiv.org/html/1801.01290v2)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 31 | [TD3:给 DDPG 的价值误差加三道约束](31-td3.md) | Fujimoto 等,*Addressing Function Approximation Error in Actor-Critic Methods*,2018。[正文](https://arxiv.org/html/1802.09477v3)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 32 | [IMPALA:采样与学习分离后,用V-trace处理策略滞后](32-impala.md) | *IMPALA: Scalable Distributed Deep-RL with Importance Weighted Actor-Learner Architectures*,2018。[原论文](https://arxiv.org/abs/1802.01561)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 33 | [DIAYN:没有任务奖励,能否先学会一组不同技能](33-diayn.md) | *Diversity is All You Need: Learning Skills without a Reward Function*,2018。[原论文](https://arxiv.org/abs/1802.06070)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 34 | [QMIX:用单调混合,让局部贪心与团队价值一致](34-qmix.md) | *QMIX: Monotonic Value Function Factorisation for Deep Multi-Agent Reinforcement Learning*,2018。[原论文](https://arxiv.org/abs/1803.11485)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 35 | [PETS:用模型集成表示不确定性,再进行短期规划](35-pets.md) | *Deep Reinforcement Learning in a Handful of Trials using Probabilistic Dynamics Models*,2018。[原论文](https://arxiv.org/abs/1805.12114)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 36 | [RND:预测一个冻结随机网络,也能产生探索奖励](36-rnd.md) | *Exploration by Random Network Distillation*,2018。[原论文](https://arxiv.org/abs/1810.12894)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 37 | [BCQ:离线学习时,先别选择数据从没支持过的动作](37-bcq.md) | *Off-Policy Deep Reinforcement Learning without Exploration*,2018。[原论文](https://arxiv.org/abs/1812.02900)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 38 | [BEAR:限制支持范围,而不必复制行为频率](38-bear.md) | *Stabilizing Off-Policy Q-Learning via Bootstrapping Error Reduction*,2019。[原论文](https://arxiv.org/abs/1906.00949)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 39 | [MBPO:不要在错误模型里想象太久](39-mbpo.md) | *When to Trust Your Model: Model-Based Policy Optimization*,2019。[原论文](https://arxiv.org/abs/1906.08253)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 40 | [Dreamer:把策略训练搬到潜在世界里](40-dreamer.md) | Hafner 等,*Dream to Control: Learning Behaviors by Latent Imagination*,2019/2020。[正文](https://arxiv.org/html/1912.01603v3)。本文讨论初代 Dreamer;V3、V4 属于后续工作。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 41 | [MuZero:不用重构世界,也能学出供搜索使用的模型](41-muzero.md) | Schrittwieser 等,*Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model*,2019/2020。[正文](https://arxiv.org/html/1911.08265v2)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 42 | [CQL:不敢相信未知动作,就直接惩罚乐观估值](42-cql.md) | Kumar 等,*Conservative Q-Learning for Offline Reinforcement Learning*,2020。[正文](https://arxiv.org/html/2006.04779v3)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 43 | [AWAC:先用旧数据起步,再顺利接入在线学习](43-awac.md) | *AWAC: Accelerating Online Reinforcement Learning with Offline Datasets*,2020。[原论文](https://arxiv.org/abs/2006.09359)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 44 | [Decision Transformer:把控制写成条件序列预测](44-decision-transformer.md) | *Decision Transformer: Reinforcement Learning via Sequence Modeling*,2021。[原论文](https://arxiv.org/abs/2106.01345)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 45 | [TD3+BC:离线学习中,一项模仿损失能走多远](45-td3-bc.md) | *A Minimalist Approach to Offline Reinforcement Learning*,2021。[原论文](https://arxiv.org/abs/2106.06860)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 46 | [IQL:不查询数据外动作,也能向更好价值学习](46-iql.md) | Kostrikov、Nair、Levine,*Offline Reinforcement Learning with Implicit Q-Learning*,2021/2022。[正文](https://arxiv.org/html/2110.06169v1)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 47 | [InstructGPT:从预测下一个词,到学习人类更偏好的回答](47-instructgpt.md) | Ouyang 等,*Training language models to follow instructions with human feedback*,2022。[正文](https://arxiv.org/html/2203.02155v1)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 48 | [DreamerV3:为什么跨任务稳定,比单个任务高分更难](48-dreamerv3.md) | *Mastering Diverse Domains through World Models*,2023。[原论文](https://arxiv.org/abs/2301.04104)。 | 引用 arXiv 修订正文中的方法与基准结果。2023 指首次预印本年份,后续修订结果不能全部归入首版。各版本的完整差异与代码尚未逐项核实。 | | 49 | [DPO:为什么偏好分类可以直接更新语言模型](49-dpo.md) | Rafailov 等,*Direct Preference Optimization: Your Language Model is Secretly a Reward Model*,2023。[正文](https://arxiv.org/html/2305.18290v2)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 50 | [IPO:偏好胜负差距,是否应该被无限拉大](50-ipo.md) | *A General Theoretical Paradigm to Understand Learning from Human Preferences*,2023。[原论文](https://arxiv.org/abs/2310.12036)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 51 | [KTO:只有“好/不好”标签,如何进行模型对齐](51-kto.md) | *KTO: Model Alignment as Prospect Theoretic Optimization*,2024。[原论文](https://arxiv.org/abs/2402.01306)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 52 | [DeepSeekMath/GRPO:用同题多回答,替代独立价值基线](52-grpo.md) | Shao 等,*DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models*,2024。[正文](https://arxiv.org/html/2402.03300v1)。GRPO 在这篇论文中提出,而非首次出现在 R1。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 53 | [DeepSeek-R1:区分纯RL探索、完整训练管线与蒸馏](53-r1.md) | DeepSeek-AI,*DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning*,2025。[初版正文](https://arxiv.org/html/2501.12948v1)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 54 | [DAPO:GRPO训练中的采样、长度与裁剪,如何一起修正](54-dapo.md) | Yu 等,*DAPO: An Open-Source LLM Reinforcement Learning System at Scale*,2025。[正文](https://arxiv.org/html/2503.14476v1)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 55 | [Dr. GRPO:两个归一化分母,怎样改变学习方向的权重](55-dr-grpo.md) | Liu 等,*Understanding R1-Zero-Like Training: A Critical Perspective*,2025。[初版正文](https://arxiv.org/html/2503.20783v1)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 56 | [MBDPO:让世界模型、价值学习与扩散策略更一致](56-mbdpo.md) | Cheng 等,*Scaling World-Model Reinforcement Learning Through Diffusion Policy Optimization*,2026-05-25。[正文](https://arxiv.org/html/2605.26282v1)。这里的 Diffusion Policy Optimization 与直接偏好优化 DPO 不是同一算法。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 57 | [WorldSample:合成经验什么时候值得交给真实机器人学习](57-worldsample.md) | Xue 等,*WorldSample: Closed-loop Real-robot RL with World Modelling*,2026-07-02。[正文](https://arxiv.org/html/2607.02431v1)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 58 | [FACTOR:先分配动作信用,再决定哪些token承担它](58-factor.md) | Ma 等,*How Much, Then Where: Credit-Conserving Action-to-Token Allocation for Multi-Turn Agent Reinforcement Learning*,2026-08-07。[正文](https://arxiv.org/html/2608.07118v1)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 59 | [TTPO:没有标准答案,测试时还能怎样更新模型](59-ttpo.md) | Wang 等,*TTPO: Test-Time Policy Optimization*,2026-08-27。[正文](https://arxiv.org/html/2608.27448v1)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | | 60 | [DRACO:没有成功验证器时,如何把评分准则分配到步骤](60-draco.md) | Gandhi 等,*DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training*,2026-09-03。[正文](https://arxiv.org/html/2609.04094v1)。 | 方法/实验相关正文;完整预算、全部随机性和代码未逐项审核 | ## 阅读与复现实验记录表 每阅读一篇论文或完成一次实验,记录版本、证据与未解决的问题。下表为空白记录模板。 | 阅读日期 | 论文与版本 | 最关键公式及前提 | 已核实图表与数值 | 尚未核实内容 | 自己的反例/问题 | 复现实验与结果 | |---|---|---|---|---|---|---| | 首次阅读时填写 | 写明v几或出版版 | 写出符号和假设 | 写任务、预算、比较对象 | 区分未报告与未读到 | 明确自构 | 未运行就写未运行 | 一篇论文读完后,至少能回答:它改了哪个接口?用了什么额外信息?哪项证据最能支持它?哪个失败例子会推翻过强的概括?这四个问题比记住算法缩写更有用。 [回到60天首页](README.md)