Home
/
大语言模型
/
发展时间线总览
# 大语言模型发展时间线:表示、规模、对齐与推理系统 [论文目录](README.md) · [系列总结](101-系列总结.md) 语言模型并不是从聊天界面开始的。它最初要解决的是一个概率问题:给定前文,下一个词是什么?围绕这个问题形成的表示、优化和计算技术,后来逐步支撑翻译、问答、代码、多模态理解和工具使用。阅读这条时间线时,应始终区分三个层面:模型怎样训练、推理时怎样调用、结果怎样评价。 ## 技术地图 ```mermaid flowchart TD A[序列概率与分布式表示] --> B[LSTM与RNN语言模型] A --> C[NNLM与word2vec及GloVe] B --> D[Seq2Seq与可学习对齐] C --> D D --> E[Transformer] E --> F[双向编码 BERT及ELECTRA] E --> G[因果生成 GPT及Llama] E --> H[编码解码 T5及BART] G --> I[规模定律与数据配方] I --> J[指令学习与偏好对齐] J --> K[推理强化学习与验证] G --> L[RAG及工具Agent] K --> M[推理预算分配与系统评估] L --> M E --> N[MoE与长上下文及状态空间] E --> O[分布式训练 量化 缓存与解码] E --> P[视觉语言对齐与多模态指令] ``` 注意力是一种信息交互运算,Transformer 是包含它的架构;LLM 是规模与用途相关的模型类别。MoE 改变参数如何被激活,LoRA 改变微调时哪些参数可以更新,RAG 改变推理时从哪里取得知识,这三者并不互斥。PPO、GRPO 与 DPO 属于对齐或策略优化路线,也不取代底层语言模型架构。 ## 1997—2013:先解决表示共享与长程记忆 | 时间 | 代表论文 | 原有瓶颈 | 新思想及边界 | |---|---|---|---| | 1997 | [LSTM](001-lstm.md) | 误差信号沿时间传播时容易衰减 | 为记忆设计可控写入和读出;原论文不是今天所有门控变体的集合 | | 2003 | [神经概率语言模型](002-nnlm.md) | 离散 n-gram 难以共享相似表达的信息 | 联合学习词向量与条件概率;仍使用有限上下文 | | 2010 | [RNNLM](003-rnnlm.md) | 固定窗口丢失更早历史 | 用递归状态压缩过去;无限形式上下文不等于可靠长程记忆 | | 2013 | [word2vec](004-word2vec.md)、[负采样](005-negative-sampling.md) | 高质量词表示训练昂贵 | 简化预测任务、减少输出计算;词向量仍以静态语义为主 | 这组论文把“相似词共享统计规律”和“历史能够影响当前预测”变成可训练机制。两者是不同问题:词向量很好,不代表模型能记住很远的条件;状态持续存在,也不代表梯度足以教会它存什么。 ## 2014—2017:从整句压缩到直接访问输入 [Seq2Seq](006-seq2seq.md) 将输入输出长度不同的任务统一为条件生成;[Bahdanau Attention](007-attention.md) 使解码器每一步能够从源序列重新取信息,减轻单向量瓶颈。[Transformer](015-transformer.md) 进一步以注意力为主要序列交互运算,提高训练并行性。 同期,[Adam](009-adam.md)、[Layer Normalization](012-layernorm.md) 改善优化实践;[BPE](011-bpe.md) 让稀有词能够分解为可复用单元;[稀疏 MoE](014-sparse-moe.md) 尝试让参数量增长快于每个样本的计算增长。架构创新与工程条件共同推动规模扩展,不能把全部收益只归因于注意力。 ## 2018—2020:预训练成为通用任务接口 | 路线 | 代表论文 | 训练问题 | 迁移方式 | |---|---|---|---| | 上下文化特征 | [ELMo](016-elmo.md) | 双向语言建模 | 将上下文表示交给下游模型 | | 因果生成 | [GPT](017-gpt.md)、[GPT-2](021-gpt2.md)、[GPT-3](035-gpt3.md) | 根据前缀预测后续 | 微调或利用提示中的示例 | | 双向编码 | [BERT](018-bert.md)、[RoBERTa](023-roberta.md)、[ELECTRA](031-electra.md) | 掩码恢复或替换检测 | 分类、抽取等任务微调 | | 编码解码 | [T5](027-t5.md)、[BART](028-bart.md) | 文本去噪与统一输入输出 | 文本到文本迁移 | [规模定律](029-scaling-laws.md) 开始把模型、数据与计算看作可测量的资源分配问题;[Megatron](024-megatron.md) 和 [ZeRO](026-zero.md) 处理大模型训练的设备与内存限制。规模带来能力变化,但实验设计必须说明到底增加了参数、数据、训练步数还是总算力。 知识也开始从参数之外取得:[REALM](030-realm.md) 将检索融入预训练,[DPR](032-dpr.md) 学习稠密检索,[RAG](034-rag.md) 将检索文档作为生成隐变量,[FiD](036-fid.md) 在解码端融合多段材料。检索改善知识访问,却不会自动保证检索正确或引用忠实。 ## 2021—2022:高效适配、指令学习与推理提示 [Prefix-Tuning](044-prefix-tuning.md)、[Prompt Tuning](045-prompt-tuning.md) 与 [LoRA](047-lora.md) 研究如何用较少可训练参数适配模型。它们减少的是特定资源,不必然同时减少所有训练显存、推理延迟或数据需求。 [FLAN](050-flan.md) 与 [T0](051-t0.md) 把多任务指令迁移变成训练目标;[InstructGPT](054-instructgpt.md) 通过示范、偏好与强化学习改善指令响应。人类偏好是一个可学习信号,却不能直接等同于事实正确性。 [CoT](053-cot.md) 展示中间推理示例的作用,[Self-Consistency](056-self-consistency.md) 用多次采样与答案聚合,[STaR](055-star.md) 将成功推理用于再训练,[PAL](063-pal.md) 把计算交给程序。这些方法分别改变提示、采样、训练和工具执行,不应笼统称为一种“思维链算法”。 [Chinchilla](057-chinchilla.md) 重新审视计算预算下模型与数据的配比;[FlashAttention](059-flashattention.md) 利用内存层级优化精确注意力;[Speculative Decoding](064-speculative.md) 用廉价草稿减少目标模型串行解码成本。数学运算量与真实速度是两个需要分别测量的指标。 ## 2023—2024:模型能力变成系统能力 | 分支 | 代表论文 | 需要分清的实验对象 | |---|---|---| | 开放模型与对齐 | [Llama](068-llama.md)、[Llama 2](078-llama2.md)、[DPO](075-dpo.md) | 基座能力、聊天配方与偏好数据的贡献 | | 检索与工具 | [Toolformer](067-toolformer.md)、[Self-RAG](082-self-rag.md)、[GraphRAG](090-graphrag.md) | 生成器、检索器、外部语料与索引预算 | | Agent | [ReAct](060-react.md)、[Reflexion](070-reflexion.md)、[SWE-agent](087-sweagent.md) | 模型参数、界面、记忆、工具与重试次数 | | 推理服务 | [GPTQ](061-gptq.md)、[QLoRA](074-qlora.md)、[AWQ](076-awq.md)、[vLLM](079-vllm.md) | 量化误差、吞吐、首 token 延迟和显存 | | 架构 | [Mamba](083-mamba.md)、[Mamba-2](088-mamba2.md)、[Mixtral](084-mixtral.md) | 激活参数、总参数、序列长度与硬件效率 | | 多模态 | [CLIP](043-clip.md)、[Flamingo](058-flamingo.md)、[BLIP-2](066-blip2.md)、[LLaVA](071-llava.md) | 对齐、桥接模块、视觉输入及指令数据 | 这一阶段最容易出现的误读,是把系统分数提升全部归给底层模型。一次成功可能依赖检索到正确文档、工具执行代码、多个候选中的正确答案被验证器选中。把这些环节拆开,才能复现,也才能判断迁移到新场景是否仍有效。 ## 2025—2026:推理学习与计算分配 [DeepSeek-R1](094-r1.md) 与 [DAPO](097-dapo.md) 将验证奖励下的推理训练带到更大规模;[s1](095-s1.md) 研究少量示范与预算控制;[LLaDA](096-llada.md) 探索不同于单向自回归的生成形式。不同路线改变的训练目标与执行方式并不相同。 2026 年的三篇样例把注意力转向系统控制与评价:[验证扩展](098-rubric-verification.md) 研究准则驱动的反馈,[AutoTTS](099-autotts.md) 自动搜索推理预算控制器,[推理扩展评估协议](100-tts-protocol.md) 区分单轨迹、完整候选聚合与前缀搜索。这些工作应结合版本与验证条件阅读,不应仅凭新近发布时间赋予更高证据等级。 ## 贯穿时间线的五个问题 1. 新论文修改了模型结构、目标函数、数据分布,还是推理调用方式? 2. 新增能力来自学习,还是更多候选、工具与验证? 3. 成本用参数量、FLOPs、token、延迟还是实际费用衡量? 4. 评价集测的是任务成功、语言拟合、偏好,还是某种代理指标? 5. 数据污染、提示调优、答案选择与工具权限是否进入了比较条件? 这些问题把不同年代的论文放在同一张可比较的地图中。目录提供历史顺序,单篇文章负责说明具体机制与证据,系列总结则将这些设计放回可实施的实验中。