想搞懂 ChatGPT、Claude、通义千问、DeepSeek 从哪来,先把时间线拉直:规则 → 统计 → 深度学习 → Transformer → 大模型。只有回看历史,才容易找准现在站在哪。
一句话:现代大模型 ≈ Transformer + 规模化预训练 + 对齐 +(可选)检索与工具。你调的对话 API,多半在 Decoder-only Transformer + 对齐 这条岔路上。
本文重点拆 谷歌 Transformer 和 GPT 一脉。年份不用背,盯住每一段在换什么假设。
一张时间线
1 | 1950–56 图灵测试思想;Dartmouth 命名「AI」 |
起源:智能能不能被机器实现
「人工智能」一词出现前,人们先问:思维是否可计算?
- 1950,Turing:别争有没有心智,看对话能不能骗过人——今天刷大模型,评价仍多是「好不好用」。
- 1956,Dartmouth:McCarthy 等人正式命名 AI,乐观到以为形式化 + 算力很快就能通吃智能。
- 更早的 McCulloch & Pitts(1943) 把神经元写成阈值开关:还不是可训练深网,但把「大脑计算」拉进了形式化。
形式化比想象难,算力也不够。留下的是一条信念:智能可以被工程化。
感知机:连接主义第一轮起伏
1958 年 Rosenblatt 的感知机能做线性分类,媒体吹过头。上图是早期硬件 Mark I。1969 年 Minsky & Papert 指出:单层搞不定 XOR,多层又训不稳——连接主义大幅降温。
非线性要「叠层」,叠层当时缺可靠训练。三连击卡死路线:理论局限 + 训不动 + 算力不够。后来反向传播、GPU、大数据逐条击穿,它才卷土重来。
两条路线,今天都还在
| 符号主义 | 连接主义 | |
|---|---|---|
| 假设 | 智能 ≈ 符号与逻辑 | 智能 ≈ 可学习的加权连接 |
| 长处 | 可解释、可控 | 感知、开放语言 |
| 短板 | 脆、规则写不全 | 吃数据、行为难保证 |
大模型是连接主义的极端规模化;规则、权限、工具白名单仍到处都是——能力归模型,边界归系统。
专家系统与统计学习:两代「可用 AI」
专家系统(1960s–80s):采访专家 → if-then → 推理引擎。DENDRAL、MYCIN 在封闭领域能接近专家,还可审计。最终撞墙:知识写不全、开放世界例外无穷、感知搞不定、规则爆炸。AI 冬天不是技术消失,而是过度承诺后的资金与叙事退潮。
遗产还在:审批流、风控、Agent 工具白名单、「先检索再生成」。
统计学习(1990s–2000s):有标注就拟合。SVM、HMM、CRF、统计机器翻译……
与其穷举规则,不如从数据估计规律。
NLP 靠人肉特征工程:评测强、换领域就重做。SMT 证明数据驱动能进工业,也逼出下一问——表示本身能不能从数据里学?
深度学习:特征终于也能学
梯度消失、标注贵、CPU 慢——多层网理论强、现实训不动。1986 年反向传播被讲透;1989 年 LeCun 卷积网会认手写数字。真正爆发,要等大数据 + GPU。
2012 AlexNet 打穿 ImageNet:层次特征可以端到端学。ResNet 等再把「特别深」训稳,视觉几乎通吃。
语言是另一条线。RNN/LSTM 用隐状态传记忆,撑起了 2010 年代翻译和语音,却有两个硬伤:
- 难并行——(h_t) 必须等 (h_{t-1})
- 长程隔着状态链——信息只能一跳一跳传
目标因此很清楚:任意两位置直接对话,并且可并行。Attention 上场。
Transformer:从 Attention 到行业骨架
Attention 不是 2017 突然发明的:
- Word2Vec(2013):词变向量;表示可先学——但静态,不懂上下文
- Seq2Seq(2014):整句压成一个向量再解码;一长就忘
- Bahdanau Attention(2014/15):解码时按相关性回看源句——仍是 RNN + Attention
Google 再进一步:
如果 Attention 已经能建模依赖,还要 RNN 干什么?
《Attention Is All You Need》——注意力就够了。
论文主战场是机器翻译(上图原论文结构)。行业意义是:可并行、可堆叠、可 scaling。没有这副骨架,后面千亿参数训练很难划算。
自注意力
每个位置造 Q / K / V:找什么、怎么被检索、贡献什么。
1 | Attention(Q, K, V) = softmax(Q Kᵀ / √d_k) V |
任意两 token 一步相连;训练时可并行。… because it was too tired 里,it 该看谁,注意力可以直接加权。
1 | RNN: 词1 → 词2 → … → 词100 (接力) |
多头、位置、残差
- 多头:多组 QKV,多视角;别神话「每头都有人类可读语义」
- 位置编码:注意力近似不认顺序;RoPE / ALiBi 等关系到窗口与外推
- 残差 + Norm + FFN:让深层堆得住——注意力路由位置间信息,FFN 做位置内变换
拆零件:你用的模型在哪条岔路
| 类型 | 谁看谁 | 用途 |
|---|---|---|
| 编码器自注意力 | 源句内部 | 理解 |
| 解码器因果注意力 | 只看已生成前缀 | 自回归生成 |
| 交叉注意力 | 解码器 Q ← 编码器 K/V | 翻译等条件生成 |
1 | ┌── Encoder-only ──► BERT / 嵌入(读懂) |
复杂度约 (O(n^2)):换并行与长程直连。极长上下文会疼,才有 FlashAttention、稀疏注意力、SSM;主航道上密集注意力已经够用。
对号入座: 聊天助手多在 Decoder-only;RAG 的 embedding / 重排常仍是 Encoder 血统。
GPT 一脉:预测下一个词,如何长成助手
2018 前后换轨:海量无标注预训练 → 少量数据微调 / 提示 / 对齐。ELMo、ULMFiT 探路,GPT-1 / BERT 把预训练建在 Transformer 上。
笨目标为什么强
给定前文,预测下一个 token。
文本里压缩了语法、常识、解题格式甚至代码。要猜对下一词,模型不得不内化这些——也会内化偏见与幻觉。
GPT-1:解码器开局
整体 Decoder-only,每层一个 block。注意力带因果掩码(只能看左边),语言建模才合法:
同期 BERT 用 Encoder + 遮词刷理解榜。一时印象:BERT 会读,GPT 会写。后来生成够强,很多理解题也能改写成提示;检索嵌入则仍常请编码器。
GPT-2 / 3:规模开始说话
GPT-2:不微调、只靠提示,也能做翻译/摘要雏形。
GPT-3(约 175B):In-Context Learning——给指令或几个示例,不必改权重。
「涌现」真假有争议;工程事实清楚:大力出奇迹极度有效。Scaling Law 说的是损失随参数、数据、算力近似幂律下降,两边要匹配。GPT 能成,关键是结构允许规模化。
Codex / Copilot 再证明:代码也可当语言建模;可执行反馈给工具调用、Agent 式编程埋了线。
InstructGPT → ChatGPT:对齐做成产品
会续写 ≠ 好助手。
1 | 预训练 → SFT(示范)→ 奖励模型(人类两两比)→ RLHF / DPO 等 |
| 阶段 | 学什么 | 翻车点 |
|---|---|---|
| SFT | 口吻与结构 | 示范太窄 → 死板 |
| 偏好优化 | 什么回答更受欢迎 | 迎合、reward hacking |
ChatGPT 把对齐后的对话做成低门槛产品。配方几乎定型:预训练打底 → 指令微调 → 偏好优化 → 产品层加工具与安全。对齐改的是行为策略,不是幻觉根除器。
模型之后是系统
GPT-4 世代起,拼长上下文、多模态、工具调用、推理期多想几步。骨架多数仍是 Decoder-only;差别在数据、对齐与系统。闭源有 GPT / Claude / Gemini,开放权重有 LLaMA / Qwen / DeepSeek……
基座够强后,瓶颈变成:
- 幻觉 / 知识过期 → RAG
- 动不了真世界 → Tool Calling
- 多步任务 → Agent
- 不可控 → 护栏、评测、权限
单一前向生成 ≠ 完整智能系统。
这也是框架、MCP、工作流和模型本身一样热闹的原因。应用上常踩三个坑:Token ≠ 字(计费按 token);窗口是工作记忆(不是永久记忆);自回归是局部决策链(前面一步歪,后面整段可能崩)。
旁支补一句:T5 把任务统一成 text-to-text;扩散模型走出文生图另一条线,并在多模态里与语言骨干汇合;开源让故事不再是单公司英雄史诗。
收束
1 | 规则 → 统计 → 深度 → Attention → Transformer(2017) |
| 专家系统 | 统计/早期深度 | 大模型系统 | |
|---|---|---|---|
| 知识 | 专家规则 | 标注数据 | 预训练 + 少量对齐 |
| 失败 | 规则没覆盖 | 过拟合 | 幻觉 / 工具误用 |
| 工程重点 | 维护规则 | 特征与标注 | 数据、评测、安全、集成 |
三句:AI 目标没变,变的是可扩展范式;Transformer 解决序列建模的效率与长程结构;GPT 证明自回归语言建模 + 规模 + 对齐 + 系统能走出通用助手——不是魔法,是工程。
别搞混:Transformer ≠ ChatGPT;GPT 没取代 BERT;更大不一定更好;对齐消灭不了幻觉;窗口再大也不该整库硬塞。
上手:手推自注意力 → 训个会续写的小 LM → 会调 API/工具 → 会做 RAG → 再碰 SFT/Agent。接着看 什么是RAG?、什么是LangChain?。
参考
- Attention Is All You Need · BERT · GPT-3 · InstructGPT · T5
- 同站:什么是RAG? · 什么是LangChain?
- 配图:Wikimedia Commons(CC / 公有领域或论文授权学术转载)