Keyboard shortcuts

Press or to navigate between chapters

Press S or / to search in the book

Press ? to show this help

Press Esc to hide this help

历史脉络: 从 NLP 到 LLM, 再到 Agent

这一节想单独整理一个更长一点的历史视角。目标不是把所有论文都列一遍,而是先把主干路线梳理清楚:

  1. 从传统 NLP 到 Transformer,这条线是怎么发展的?
  2. 从 Transformer 到当代 LLM,标志性的节点工作有哪些?
  3. RL、偏好优化和后训练为什么会在近几年变得越来越重要?
  4. 为什么大家开始越来越多地讨论 tool use 和 agent?

我自己的理解是:
如果把过去十几年压缩来看,大模型的发展并不是突然跳出来的一段孤立历史,而是几条技术路线逐步汇合的结果:

  • 表示学习的路线
  • 序列建模的路线
  • 预训练与对齐的路线
  • 工具使用与行动系统的路线

1. 从 NLP 到 Transformer

2013 前后: word2vec 与词向量

这一阶段最重要的变化之一,是“词的表示”开始从离散 one-hot 走向连续向量。

这件事非常关键,因为它让 NLP 里的很多问题第一次可以比较自然地接进神经网络框架。
从今天回头看,embedding 已经像是理所当然的部件,但在当时,它其实代表了一种非常重要的范式转换:

  • 文本不再只是符号
  • 词也不再只是一个离散编号
  • 而是可以嵌入到一个连续空间里

这也是为什么我一直觉得,哪怕今天在讲 LLM,embedding 这件事依然应该放回 NLP 历史里看。

参考:

2014: Attention 机制

Attention 的出现,最初并不是为了“做一个更强的大模型”,而是为了缓解 seq2seq 中的信息瓶颈问题。

在更早的 encoder-decoder 结构里,输入序列往往会被压缩成一个固定长度的中间表示。这种做法在短序列上还可以,但序列一长,信息损失和长距离依赖问题就会变得明显。

Attention 带来的核心想法是:

  • 在生成当前输出时
  • 不要只依赖一个压缩后的全局状态
  • 而是允许模型动态地去看输入中更相关的位置

从今天回头看,这一步几乎可以说是后面 Transformer 和 LLM 整条路线的关键前置条件。

参考:

2017: Transformer

2017 年的《Attention Is All You Need》可以说是整个历史里的分水岭之一。
它的重要性不只是“提出了一个新模型”,而是把 attention 从一个辅助机制推到了主干结构的位置。

Transformer 的几个关键影响是:

  • 放弃了 RNN 式的递归主干
  • 把序列内部的信息交互交给 attention
  • 更适合并行训练
  • 更适合大规模扩展

这也是为什么今天再看 LLM,虽然工程细节变化很多,但主干结构依然基本建立在 Transformer 这一套范式之上。

参考:

2018-2020: 预训练语言模型成为主线

这一阶段一个很重要的变化是:
“先做大规模预训练,再针对任务适配” 逐渐成为 NLP 的主流思路。

其中有几个非常关键的节点:

  • 2018 年:BERT 让预训练语言模型成为 NLP 的核心方法之一
  • 2019 年:GPT-2 展示出更大规模自回归语言模型的潜力
  • 2020 年:GPT-3 让 in-context learning 成为一个无法忽视的现象

如果说 2017 年 Transformer 解决的是“主干结构”问题,那么 2018 到 2020 年这段则更像是在回答:

  • 这种结构怎样在大规模文本上训练?
  • 训练出来以后,它会不会自动长出一些更一般的能力?

参考:

2. 从 LLM 到对齐: 2022 之后为什么变化这么快?

2022: InstructGPT 与 ChatGPT

如果说 GPT-3 让大家重新认识了大模型的规模效应,那么 2022 年之后,一个更明显的变化是:
大家开始越来越重视“模型是否符合人类期望”。

InstructGPT 这一类工作带来的影响是:

  • 不再只强调预训练本身
  • 而是强调如何让模型更符合指令、更符合偏好、更符合期望行为

这也是为什么“预训练 + 后训练 / 对齐”逐渐成为一个更完整的产品和研究框架。

从产品侧看,ChatGPT 则让这条路线真正变成大众可见的主流形态。

参考:

2023: GPT-4 与 post-training 路线强化

GPT-4 的一个重要信号是:
大模型的发展已经不只是“堆更大的预训练”,而是越来越依赖预训练和后训练的结合。

从技术叙述上看,这时候一个越来越清晰的框架是:

pretrain -> instruction tuning / preference tuning -> 更强的行为质量

也就是说,模型的基础能力和模型的行为方式,开始被更明确地区分成不同阶段来处理。

参考:

3. RL、偏好优化与推理训练

RLHF: 为什么它重要?

RLHF 之所以重要,不是因为 “reinforcement learning” 这几个字听起来高级,而是因为它提供了一种方式,让模型不只是拟合文本分布,还能借助偏好信号进一步调整行为。

简单说,RLHF 的意义在于:

  • 预训练回答“模型学到了什么语言分布”
  • 对齐回答“模型该如何表现得更符合我们的目标”

所以从历史上看,RLHF 可以理解成“让大模型从会说话,进一步走向更可控”的关键一步。

2023: DPO

到了 2023 年,DPO 之所以引起很多关注,是因为它把原来比较复杂的 RLHF 过程,改写成了一种更直接的偏好优化形式。

它的重要性不一定在于“从此 RL 消失了”,而在于它让大家更清楚地看到:

  • 偏好优化本身可以有不同实现路径
  • 不一定每次都要走完整的 reward model + PPO 流程

所以从这之后,“偏好优化” 和 “RLHF” 这两个概念虽然仍然高度相关,但也开始出现更细的技术分化。

参考:

2024-2026: 可验证任务、推理能力与 RL 再升温

如果再往后看,RL 在近几年重新升温,一个很重要的原因是:
大家越来越多地把模型放到数学、代码、证明、规划这类“结果更可验证”的任务上。

在这些任务里,光靠静态偏好数据往往不够,因为:

  • 任务本身有明显对错
  • 中间过程可能涉及多步推理
  • 最终目标可以通过程序、测试、规则或答案校验来提供反馈

这时候,RL 和偏好优化的结合就变得更有吸引力。

像 DeepSeekMath 这类工作里出现的 GRPO,可以看成这条线上的代表之一。
它的重要性不只是某一个具体算法,而是说明了一件事:

  • 当任务结果可验证时
  • 训练模型推理能力这件事,会越来越自然地和 RL 重新结合起来

这也是为什么我会把 2025-2026 这段概括成:
“推理能力、可验证反馈和后训练强化正在进一步汇合。”

参考:

4. Tool Use 与 Agent 为什么会爆发?

2022-2023: 从 reasoning 到 acting

在很多早期讨论里,大模型更多被看成“生成文本的系统”。
但从 ReAct 开始,一个越来越明确的方向是:

  • 模型不只是要生成答案
  • 还要在推理过程中和环境交互
  • 要能调用工具、获取信息、执行动作

ReAct 的重要性就在于,它把 reasoning 和 acting 放进了一个统一框架里讨论。

参考:

2023: Toolformer 与 function calling

到 2023 年,工具使用这条线开始变得更具体。

一方面,Toolformer 从研究角度强调:
语言模型可以学习什么时候调用工具、调用什么工具、以及如何使用返回结果。

另一方面,OpenAI 在 2023 年推出 function calling,则从产品和开发接口层面,把“模型调用外部工具”这件事做成了开发者可直接使用的能力。

这一步非常重要,因为它意味着:

  • 工具使用不再只是论文里的设想
  • 而开始成为真实系统设计里的默认选项

参考:

2024-2026: 从工具调用到 agent 系统

如果继续往后看,到 2024 年之后,一个更明显的变化是:
讨论重点开始从“模型能不能调用一个工具”,逐渐转向“模型能不能作为一个系统,维持状态、规划步骤、调用多个工具并完成更长任务”。

这里有几个很典型的节点:

  • 2024 年:Anthropic 发布 computer use,把模型直接操作屏幕、鼠标和键盘的能力产品化
  • 2024 年底:Anthropic 提出 MCP,尝试把模型接入外部数据源和工具这件事标准化
  • 到 2025-2026 年:agent 系统开始快速升温,重点越来越多地转向多步任务执行、外部工具协作和环境交互

最后一句是我的总结,不是某一篇论文单独给出的结论。
如果只看过去几年的变化,我觉得完全可以把它概括成:

  • 早期重点是“更强的语言建模”
  • 后来重点变成“更强的对齐和推理”
  • 再往后则越来越走向“更强的工具使用和行动系统”

参考:

5. 这一节最重要的主线是什么?

如果只保留最核心的一条主线,我觉得是:

  1. LLM 不是突然出现的新物种,它延续了 NLP 里表示学习、序列建模和预训练的主线。
  2. Transformer 提供了今天主流大模型的结构核心。
  3. 2022 之后,后训练、偏好优化和 RL 让模型不只是“会预测文本”,而开始更强调“如何表现”。
  4. tool use 和 agent 的爆发,则让模型从“语言系统”逐渐走向“行动系统”。

所以如果后面再看 MiniMind 这样的项目,我会更倾向于把它放在这样一条连续历史里理解:
它不是凭空在讲一个模型,而是在今天这整条技术演化链上,选了一个足够小、足够清晰、足够能动手的切入点。