历史脉络: 从 NLP 到 LLM, 再到 Agent
这一节想单独整理一个更长一点的历史视角。目标不是把所有论文都列一遍,而是先把主干路线梳理清楚:
- 从传统 NLP 到 Transformer,这条线是怎么发展的?
- 从 Transformer 到当代 LLM,标志性的节点工作有哪些?
- RL、偏好优化和后训练为什么会在近几年变得越来越重要?
- 为什么大家开始越来越多地讨论 tool use 和 agent?
我自己的理解是:
如果把过去十几年压缩来看,大模型的发展并不是突然跳出来的一段孤立历史,而是几条技术路线逐步汇合的结果:
- 表示学习的路线
- 序列建模的路线
- 预训练与对齐的路线
- 工具使用与行动系统的路线
1. 从 NLP 到 Transformer
2013 前后: word2vec 与词向量
这一阶段最重要的变化之一,是“词的表示”开始从离散 one-hot 走向连续向量。
这件事非常关键,因为它让 NLP 里的很多问题第一次可以比较自然地接进神经网络框架。
从今天回头看,embedding 已经像是理所当然的部件,但在当时,它其实代表了一种非常重要的范式转换:
- 文本不再只是符号
- 词也不再只是一个离散编号
- 而是可以嵌入到一个连续空间里
这也是为什么我一直觉得,哪怕今天在讲 LLM,embedding 这件事依然应该放回 NLP 历史里看。
参考:
2014: Attention 机制
Attention 的出现,最初并不是为了“做一个更强的大模型”,而是为了缓解 seq2seq 中的信息瓶颈问题。
在更早的 encoder-decoder 结构里,输入序列往往会被压缩成一个固定长度的中间表示。这种做法在短序列上还可以,但序列一长,信息损失和长距离依赖问题就会变得明显。
Attention 带来的核心想法是:
- 在生成当前输出时
- 不要只依赖一个压缩后的全局状态
- 而是允许模型动态地去看输入中更相关的位置
从今天回头看,这一步几乎可以说是后面 Transformer 和 LLM 整条路线的关键前置条件。
参考:
2017: Transformer
2017 年的《Attention Is All You Need》可以说是整个历史里的分水岭之一。
它的重要性不只是“提出了一个新模型”,而是把 attention 从一个辅助机制推到了主干结构的位置。
Transformer 的几个关键影响是:
- 放弃了 RNN 式的递归主干
- 把序列内部的信息交互交给 attention
- 更适合并行训练
- 更适合大规模扩展
这也是为什么今天再看 LLM,虽然工程细节变化很多,但主干结构依然基本建立在 Transformer 这一套范式之上。
参考:
2018-2020: 预训练语言模型成为主线
这一阶段一个很重要的变化是:
“先做大规模预训练,再针对任务适配” 逐渐成为 NLP 的主流思路。
其中有几个非常关键的节点:
- 2018 年:BERT 让预训练语言模型成为 NLP 的核心方法之一
- 2019 年:GPT-2 展示出更大规模自回归语言模型的潜力
- 2020 年:GPT-3 让 in-context learning 成为一个无法忽视的现象
如果说 2017 年 Transformer 解决的是“主干结构”问题,那么 2018 到 2020 年这段则更像是在回答:
- 这种结构怎样在大规模文本上训练?
- 训练出来以后,它会不会自动长出一些更一般的能力?
参考:
- BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding (2018)
- Language Models are Few-Shot Learners / GPT-3 (2020)
2. 从 LLM 到对齐: 2022 之后为什么变化这么快?
2022: InstructGPT 与 ChatGPT
如果说 GPT-3 让大家重新认识了大模型的规模效应,那么 2022 年之后,一个更明显的变化是:
大家开始越来越重视“模型是否符合人类期望”。
InstructGPT 这一类工作带来的影响是:
- 不再只强调预训练本身
- 而是强调如何让模型更符合指令、更符合偏好、更符合期望行为
这也是为什么“预训练 + 后训练 / 对齐”逐渐成为一个更完整的产品和研究框架。
从产品侧看,ChatGPT 则让这条路线真正变成大众可见的主流形态。
参考:
2023: GPT-4 与 post-training 路线强化
GPT-4 的一个重要信号是:
大模型的发展已经不只是“堆更大的预训练”,而是越来越依赖预训练和后训练的结合。
从技术叙述上看,这时候一个越来越清晰的框架是:
pretrain -> instruction tuning / preference tuning -> 更强的行为质量
也就是说,模型的基础能力和模型的行为方式,开始被更明确地区分成不同阶段来处理。
参考:
3. RL、偏好优化与推理训练
RLHF: 为什么它重要?
RLHF 之所以重要,不是因为 “reinforcement learning” 这几个字听起来高级,而是因为它提供了一种方式,让模型不只是拟合文本分布,还能借助偏好信号进一步调整行为。
简单说,RLHF 的意义在于:
- 预训练回答“模型学到了什么语言分布”
- 对齐回答“模型该如何表现得更符合我们的目标”
所以从历史上看,RLHF 可以理解成“让大模型从会说话,进一步走向更可控”的关键一步。
2023: DPO
到了 2023 年,DPO 之所以引起很多关注,是因为它把原来比较复杂的 RLHF 过程,改写成了一种更直接的偏好优化形式。
它的重要性不一定在于“从此 RL 消失了”,而在于它让大家更清楚地看到:
- 偏好优化本身可以有不同实现路径
- 不一定每次都要走完整的 reward model + PPO 流程
所以从这之后,“偏好优化” 和 “RLHF” 这两个概念虽然仍然高度相关,但也开始出现更细的技术分化。
参考:
2024-2026: 可验证任务、推理能力与 RL 再升温
如果再往后看,RL 在近几年重新升温,一个很重要的原因是:
大家越来越多地把模型放到数学、代码、证明、规划这类“结果更可验证”的任务上。
在这些任务里,光靠静态偏好数据往往不够,因为:
- 任务本身有明显对错
- 中间过程可能涉及多步推理
- 最终目标可以通过程序、测试、规则或答案校验来提供反馈
这时候,RL 和偏好优化的结合就变得更有吸引力。
像 DeepSeekMath 这类工作里出现的 GRPO,可以看成这条线上的代表之一。
它的重要性不只是某一个具体算法,而是说明了一件事:
- 当任务结果可验证时
- 训练模型推理能力这件事,会越来越自然地和 RL 重新结合起来
这也是为什么我会把 2025-2026 这段概括成:
“推理能力、可验证反馈和后训练强化正在进一步汇合。”
参考:
4. Tool Use 与 Agent 为什么会爆发?
2022-2023: 从 reasoning 到 acting
在很多早期讨论里,大模型更多被看成“生成文本的系统”。
但从 ReAct 开始,一个越来越明确的方向是:
- 模型不只是要生成答案
- 还要在推理过程中和环境交互
- 要能调用工具、获取信息、执行动作
ReAct 的重要性就在于,它把 reasoning 和 acting 放进了一个统一框架里讨论。
参考:
2023: Toolformer 与 function calling
到 2023 年,工具使用这条线开始变得更具体。
一方面,Toolformer 从研究角度强调:
语言模型可以学习什么时候调用工具、调用什么工具、以及如何使用返回结果。
另一方面,OpenAI 在 2023 年推出 function calling,则从产品和开发接口层面,把“模型调用外部工具”这件事做成了开发者可直接使用的能力。
这一步非常重要,因为它意味着:
- 工具使用不再只是论文里的设想
- 而开始成为真实系统设计里的默认选项
参考:
- Toolformer: Language Models Can Teach Themselves to Use Tools (2023)
- Function calling and other API updates (OpenAI, 2023-06-13)
2024-2026: 从工具调用到 agent 系统
如果继续往后看,到 2024 年之后,一个更明显的变化是:
讨论重点开始从“模型能不能调用一个工具”,逐渐转向“模型能不能作为一个系统,维持状态、规划步骤、调用多个工具并完成更长任务”。
这里有几个很典型的节点:
- 2024 年:Anthropic 发布 computer use,把模型直接操作屏幕、鼠标和键盘的能力产品化
- 2024 年底:Anthropic 提出 MCP,尝试把模型接入外部数据源和工具这件事标准化
- 到 2025-2026 年:agent 系统开始快速升温,重点越来越多地转向多步任务执行、外部工具协作和环境交互
最后一句是我的总结,不是某一篇论文单独给出的结论。
如果只看过去几年的变化,我觉得完全可以把它概括成:
- 早期重点是“更强的语言建模”
- 后来重点变成“更强的对齐和推理”
- 再往后则越来越走向“更强的工具使用和行动系统”
参考:
- Introducing computer use, a new Claude 3.5 Sonnet, and Claude 3.5 Haiku (Anthropic, 2024-10-22)
- Introducing the Model Context Protocol (Anthropic, 2024-11-25)
5. 这一节最重要的主线是什么?
如果只保留最核心的一条主线,我觉得是:
- LLM 不是突然出现的新物种,它延续了 NLP 里表示学习、序列建模和预训练的主线。
- Transformer 提供了今天主流大模型的结构核心。
- 2022 之后,后训练、偏好优化和 RL 让模型不只是“会预测文本”,而开始更强调“如何表现”。
- tool use 和 agent 的爆发,则让模型从“语言系统”逐渐走向“行动系统”。
所以如果后面再看 MiniMind 这样的项目,我会更倾向于把它放在这样一条连续历史里理解:
它不是凭空在讲一个模型,而是在今天这整条技术演化链上,选了一个足够小、足够清晰、足够能动手的切入点。