人工智能发展路线

想搞懂 ChatGPT、Claude、通义千问、DeepSeek 从哪来,先把时间线拉直:规则 → 统计 → 深度学习 → Transformer → 大模型。只有回看历史,才容易找准现在站在哪。

一句话:现代大模型 ≈ Transformer + 规模化预训练 + 对齐 +(可选)检索与工具。你调的对话 API,多半在 Decoder-only Transformer + 对齐 这条岔路上。

本文重点拆 谷歌 TransformerGPT 一脉。年份不用背,盯住每一段在换什么假设。

一张时间线

1
2
3
4
5
6
7
8
9
10
11
1950–56   图灵测试思想;Dartmouth 命名「AI」
1958–69 感知机起落;连接主义降温
1970s–80s 专家系统高峰 → AI 冬天
1990s 统计学习 / SMT 成「可用 AI」
2012 AlexNet:深度学习爆发
2013–15 Word2Vec → Seq2Seq → Attention
2017 Google Transformer
2018 GPT-1 / BERT:写 vs 读
2020 GPT-3:提示即接口
2022 ChatGPT:对齐做成产品
2023+ 多模态、工具、开源、推理模型

起源:智能能不能被机器实现

「人工智能」一词出现前,人们先问:思维是否可计算?

  • 1950,Turing:别争有没有心智,看对话能不能骗过人——今天刷大模型,评价仍多是「好不好用」。
  • 1956,Dartmouth:McCarthy 等人正式命名 AI,乐观到以为形式化 + 算力很快就能通吃智能。
  • 更早的 McCulloch & Pitts(1943) 把神经元写成阈值开关:还不是可训练深网,但把「大脑计算」拉进了形式化。

形式化比想象难,算力也不够。留下的是一条信念:智能可以被工程化。

感知机:连接主义第一轮起伏

1958 年 Rosenblatt 的感知机能做线性分类,媒体吹过头。上图是早期硬件 Mark I。1969 年 Minsky & Papert 指出:单层搞不定 XOR,多层又训不稳——连接主义大幅降温。

非线性要「叠层」,叠层当时缺可靠训练。三连击卡死路线:理论局限 + 训不动 + 算力不够。后来反向传播、GPU、大数据逐条击穿,它才卷土重来。

两条路线,今天都还在

符号主义 连接主义
假设 智能 ≈ 符号与逻辑 智能 ≈ 可学习的加权连接
长处 可解释、可控 感知、开放语言
短板 脆、规则写不全 吃数据、行为难保证

大模型是连接主义的极端规模化;规则、权限、工具白名单仍到处都是——能力归模型,边界归系统

专家系统与统计学习:两代「可用 AI」

专家系统(1960s–80s):采访专家 → if-then → 推理引擎。DENDRAL、MYCIN 在封闭领域能接近专家,还可审计。最终撞墙:知识写不全、开放世界例外无穷、感知搞不定、规则爆炸。AI 冬天不是技术消失,而是过度承诺后的资金与叙事退潮。

遗产还在:审批流、风控、Agent 工具白名单、「先检索再生成」。

统计学习(1990s–2000s):有标注就拟合。SVM、HMM、CRF、统计机器翻译……

与其穷举规则,不如从数据估计规律。

NLP 靠人肉特征工程:评测强、换领域就重做。SMT 证明数据驱动能进工业,也逼出下一问——表示本身能不能从数据里学?

深度学习:特征终于也能学

梯度消失、标注贵、CPU 慢——多层网理论强、现实训不动。1986 年反向传播被讲透;1989 年 LeCun 卷积网会认手写数字。真正爆发,要等大数据 + GPU。

2012 AlexNet 打穿 ImageNet:层次特征可以端到端学。ResNet 等再把「特别深」训稳,视觉几乎通吃。

语言是另一条线。RNN/LSTM 用隐状态传记忆,撑起了 2010 年代翻译和语音,却有两个硬伤:

  1. 难并行——(h_t) 必须等 (h_{t-1})
  2. 长程隔着状态链——信息只能一跳一跳传

目标因此很清楚:任意两位置直接对话,并且可并行。Attention 上场。

Transformer:从 Attention 到行业骨架

Attention 不是 2017 突然发明的:

  1. Word2Vec(2013):词变向量;表示可先学——但静态,不懂上下文
  2. Seq2Seq(2014):整句压成一个向量再解码;一长就忘
  3. Bahdanau Attention(2014/15):解码时按相关性回看源句——仍是 RNN + Attention

Google 再进一步:

如果 Attention 已经能建模依赖,还要 RNN 干什么?

《Attention Is All You Need》——注意力就够了。

论文主战场是机器翻译(上图原论文结构)。行业意义是:可并行、可堆叠、可 scaling。没有这副骨架,后面千亿参数训练很难划算。

自注意力

每个位置造 Q / K / V:找什么、怎么被检索、贡献什么。

1
Attention(Q, K, V) = softmax(Q Kᵀ / √d_k) V

任意两 token 一步相连;训练时可并行。… because it was too tired 里,it 该看谁,注意力可以直接加权。

1
2
RNN:       词1 → 词2 → … → 词100      (接力)
Self-Attn: 词1/2/3… ──直连──→ 词100 (O(n²) 换短路径)

多头、位置、残差

  • 多头:多组 QKV,多视角;别神话「每头都有人类可读语义」
  • 位置编码:注意力近似不认顺序;RoPE / ALiBi 等关系到窗口与外推
  • 残差 + Norm + FFN:让深层堆得住——注意力路由位置间信息,FFN 做位置内变换

拆零件:你用的模型在哪条岔路

类型 谁看谁 用途
编码器自注意力 源句内部 理解
解码器因果注意力 只看已生成前缀 自回归生成
交叉注意力 解码器 Q ← 编码器 K/V 翻译等条件生成
1
2
3
                 ┌── Encoder-only ──► BERT / 嵌入(读懂)
Transformer ────┼── Decoder-only ──► GPT / LLaMA…(写出)
└── Enc–Dec ───────► T5 / 翻译 / 摘要

复杂度约 (O(n^2)):换并行与长程直连。极长上下文会疼,才有 FlashAttention、稀疏注意力、SSM;主航道上密集注意力已经够用。

对号入座: 聊天助手多在 Decoder-only;RAG 的 embedding / 重排常仍是 Encoder 血统。

GPT 一脉:预测下一个词,如何长成助手

2018 前后换轨:海量无标注预训练 → 少量数据微调 / 提示 / 对齐。ELMo、ULMFiT 探路,GPT-1 / BERT 把预训练建在 Transformer 上。

笨目标为什么强

给定前文,预测下一个 token。

文本里压缩了语法、常识、解题格式甚至代码。要猜对下一词,模型不得不内化这些——也会内化偏见与幻觉。

GPT-1:解码器开局

整体 Decoder-only,每层一个 block。注意力带因果掩码(只能看左边),语言建模才合法:

同期 BERT 用 Encoder + 遮词刷理解榜。一时印象:BERT 会读,GPT 会写。后来生成够强,很多理解题也能改写成提示;检索嵌入则仍常请编码器。

GPT-2 / 3:规模开始说话

GPT-2:不微调、只靠提示,也能做翻译/摘要雏形。
GPT-3(约 175B):In-Context Learning——给指令或几个示例,不必改权重。

「涌现」真假有争议;工程事实清楚:大力出奇迹极度有效。Scaling Law 说的是损失随参数、数据、算力近似幂律下降,两边要匹配。GPT 能成,关键是结构允许规模化

Codex / Copilot 再证明:代码也可当语言建模;可执行反馈给工具调用、Agent 式编程埋了线。

InstructGPT → ChatGPT:对齐做成产品

会续写 ≠ 好助手。

1
预训练 → SFT(示范)→ 奖励模型(人类两两比)→ RLHF / DPO 等
阶段 学什么 翻车点
SFT 口吻与结构 示范太窄 → 死板
偏好优化 什么回答更受欢迎 迎合、reward hacking

ChatGPT 把对齐后的对话做成低门槛产品。配方几乎定型:预训练打底 → 指令微调 → 偏好优化 → 产品层加工具与安全。对齐改的是行为策略,不是幻觉根除器。

模型之后是系统

GPT-4 世代起,拼长上下文、多模态、工具调用、推理期多想几步。骨架多数仍是 Decoder-only;差别在数据、对齐与系统。闭源有 GPT / Claude / Gemini,开放权重有 LLaMA / Qwen / DeepSeek……

基座够强后,瓶颈变成:

  1. 幻觉 / 知识过期 → RAG
  2. 动不了真世界 → Tool Calling
  3. 多步任务 → Agent
  4. 不可控 → 护栏、评测、权限

单一前向生成 ≠ 完整智能系统。

这也是框架、MCP、工作流和模型本身一样热闹的原因。应用上常踩三个坑:Token ≠ 字(计费按 token);窗口是工作记忆(不是永久记忆);自回归是局部决策链(前面一步歪,后面整段可能崩)。

旁支补一句:T5 把任务统一成 text-to-text;扩散模型走出文生图另一条线,并在多模态里与语言骨干汇合;开源让故事不再是单公司英雄史诗。

收束

1
2
3
4
规则 → 统计 → 深度 → Attention → Transformer(2017)
├ BERT(读)
├ T5(条件生成)
└ GPT(写)→ 规模 → 对齐 → 工具/RAG
专家系统 统计/早期深度 大模型系统
知识 专家规则 标注数据 预训练 + 少量对齐
失败 规则没覆盖 过拟合 幻觉 / 工具误用
工程重点 维护规则 特征与标注 数据、评测、安全、集成

三句:AI 目标没变,变的是可扩展范式;Transformer 解决序列建模的效率与长程结构;GPT 证明自回归语言建模 + 规模 + 对齐 + 系统能走出通用助手——不是魔法,是工程。

别搞混:Transformer ≠ ChatGPT;GPT 没取代 BERT;更大不一定更好;对齐消灭不了幻觉;窗口再大也不该整库硬塞。

上手:手推自注意力 → 训个会续写的小 LM → 会调 API/工具 → 会做 RAG → 再碰 SFT/Agent。接着看 什么是RAG?什么是LangChain?

参考