Large Language Models
100 篇精读
大语言模型 100 篇:从词表示到推理系统
语言模型的发展,既是表示能力的变化,也是数据、计算与评价方式的变化。本系列以 100 篇论文为线索,从 LSTM、注意力和预训练读到检索、工具、对齐与测试时计算。
每篇文章怎么读
- 问题与背景:它真正修改的对象是表示、优化、数据还是推理时系统。
- 方法与公式:关键机制用便于比较的记号写出,而不是复述接口。
- 算法流程:教学伪代码帮助看清信息从哪里来、更新什么。
- 实验设计:任务、数据、基线、预算和评价协议要分开核对。
- 证据强度:结果支持什么,不能证明什么。
- 贡献与代价:新能力来自哪个环节,以及引入了什么成本。
- 自测:用机制题和边界题检查是否真的读懂。
全系列架构
注意力、Transformer 与 LLM 不是同一层概念。MoE、LoRA 和 RAG 分别改变激活、微调和知识访问,可以同时出现在一个系统里。
flowchart TD
A[序列概率与分布式表示] --> B[LSTM与RNN语言模型]
A --> C[NNLM与word2vec及GloVe]
B --> D[Seq2Seq与可学习对齐]
C --> D
D --> E[Transformer]
E --> F[双向编码 BERT及ELECTRA]
E --> G[因果生成 GPT及Llama]
E --> H[编码解码 T5及BART]
G --> I[规模定律与数据配方]
I --> J[指令学习与偏好对齐]
J --> K[推理强化学习与验证]
G --> L[RAG及工具Agent]
K --> M[推理预算分配与系统评估]
L --> M
E --> N[MoE与长上下文及状态空间]
E --> O[分布式训练 量化 缓存与解码]
E --> P[视觉语言对齐与多模态指令]
100 篇目录
最小阅读路线
先读 Transformer、BERT、GPT-3,建立预训练与上下文学习;再读 LoRA、InstructGPT、DPO,区分参数适配与偏好优化;最后把 RAG、ReAct 与测试时计算放在一起,理解模型之外的系统。