ChatGPT在做什么,以及它为什么能起作用(二)
原文:What Is ChatGPT Doing and Why Does It Work
想看第一部分的可以跳转到这里ChatGPT在做什么,以及它为什么能起作用(一)
第一部分的的核心内容是ChatGPT 并不具备“意识”,它本质上是一个 “概率预测机器” 。它所做的唯一一件事,就是根据前文预测下一个单词(Token)是什么
如果说 “概率预测” 是 ChatGPT 的底层逻辑,那支撑这一逻辑落地、让它能精准捕捉语言规律、突破传统模型局限的核心,就是神经网络与Transformer 架构。这也是我们这篇要深入拆解的关键 —— 从基础的神经元运作,到 Transformer 的核心创新,看懂 AI 如何把 “概率预测” 做到极致。
引言:从大脑到数学模型
在第一部分中,我们揭开了 ChatGPT 的"概率接龙"本质。但这引出一个更深层的问题:
这些概率是如何计算出来的?
答案藏在一种受人脑启发的数学模型中——神经网络。
正如沃尔弗拉姆所言:
“每一个神经元都在做简单的工作……但 1750 亿个连接在一起,就能神奇地完成’人类水平’的生成任务。这在科学上是一个惊人的发现。”
一、神经网络:大脑的理想化模型
1.1 从生物神经元到数学函数
当我们"看见"一个数字"2"时,人脑发生了什么?
光线 → 视网膜细胞 → 神经信号 → 视觉皮层 → ... → "我看到了2"
这个复杂的过程涉及约 1000 亿个神经元,每个神经元以每秒最多约 1000 次的频率传递信号。
人工神经网络(ANN)是这个过程的理想化数学模型
下图是二者的对比图:
| 特性 | 人脑 | 人工神经网络 |
|---|---|---|
| 神经元数量 | 约 1000 亿 | 可变(数千到数十亿) |
| 信号类型 | 电脉冲 | 数值计算 |
| 连接方式 | 复杂生物网络 | 层结构 |
| 学习方式 | 生物进化/可塑性 | 梯度下降/反向传播 |
1.2 神经网络的基本结构
神经网络的核心逻辑是分层处理信息—— 从原始数据到最终结果,每一层都在做 “特征提炼”,最终把复杂问题拆解成可计算的数学任务。我们以经典的手写数字识别为例,下面是简单的图示:
输入层 (784个神经元)
↓ 对应 28×28 像素图像
隐藏层 1
隐藏层 2
隐藏层 3
隐藏层 4
↓ 核心特征提取
输出层 (10个神经元)
↓ 对应 0-9 的数字分类
推荐使用TensorFlow Neural Network Playground
这是一个交互式神经网络的生成网站,能直观了解网络的工作原理。上手玩一下,或许能有点收获
1.3 神经元的数学:每个"细胞"在做什么?
神经网络的核心单元是神经元,本质上只执行一套极其简单的运算
输出 = f ( w 1 ⋅ x 1 + w 2 ⋅ x 2 + . . . + w n ⋅ x n + b ) 输出 = f(w₁·x₁ + w₂·x₂ + ... + wₙ·xₙ + b) 输出=f(w1⋅x1+w2⋅x2+...+wn⋅xn+b)
我们可以把每个符号拆成直白的解释:
x₁、x₂…xₙ:神经元的输入信号(比如来自上一层神经元的输出,或原始数据如图片像素);w₁、w₂…wₙ:对应输入的权重(Weight)—— 相当于可调节的 “旋钮”,权重大小决定了这个输入信号的 “重要程度”;b:偏置(Bias)—— 给运算加一个 “基础偏移”,让神经元更灵活地适配数据;f:激活函数(如 ReLU、Sigmoid)—— 给简单的线性运算加入 “非线性”,让神经元能学习复杂规律。
单个神经元的能力极其优先,做的运算也毫无智能感,但数以亿计的神经元通过权重相互连接、层层叠加,这些简单的运算就会被放大,最终形成能处理图像识别、语言生成等复杂任务的强大系统。
二、吸引子:识别的本质
2.1 什么是"吸引子"?
神经网络如何"识别"一个残缺、模糊或带噪点的图像?关键就是吸引子(Attractor)
我的理解是,不管起点在哪里,最后都会稳定跑到同一个状态,这个“最终状态”就是吸引子。举个不恰当的例子解释就是,一个在碗里的小球,不管你把球放在碗的那个位置,不考虑他弹出的情况,他最终都会停在碗底。
神经网络也是如此:
【模糊/残缺输入】
输入:噪声、残缺、歪斜的"2"
↓
【神经网络(动态系统)】
输入层 → 隐藏层1 → 隐藏层2 → 隐藏层3 → 隐藏层4
(逐层提取特征,状态不断收敛)
↓
【吸引子(稳定状态)】
吸引子 = 系统最终收敛的标准模式
↓
【输出:识别为"2"】
不管输入的残缺、模糊或者带噪点的图片,网络最终都会自动收敛到最接近的那个数字,在上面这张图片就表现为:希望所有的数字1都被一个地方吸引,而数字2被另外一个地方吸引。
核心原理:
- 所有数字"1"的变体都被吸引到同一个区域
- 所有数字"2"的变体都被吸引到另一个区域
- 网络学会将"相似"的输入映射到"相似"的输出状态

2.2 特征提取的层级
当我们向神经网络展示猫的图像时,每一层提取不同级别的特征:
输入图像(猫)
↓
第1层:边缘检测、轮廓、颜色区块
↓
第5层:眼睛、耳朵形状、纹理
↓
第10层:尖耳朵、胡须、猫的脸(抽象概念)
↓
输出:"猫"
这些特征大多没有人类能理解的名字,比如“尖耳朵”是我们起的名字,但神经网络学到的很多特征,人类根本无法用语言描述,它们只是数学上的一组激活模式,不是我们定义的概念。
但值得注意的是,像这里显示的神经网络的前几层似乎提取图像的某些方面(如物体的边缘),这些方面与我们知道的由大脑视觉处理第一级提取的方面相似。
三、机器学习与神经网络的训练
3.1 训练的本质
神经网络一开始是随机初始化的,基本上是在"瞎猜"。
训练的过程,就是找到一组合适的权重(参数),让网络能复现我们提供的示例。
简单来说,就是给模型看一大堆例子,让它自动调节那一部分更重要(权重),然后让他根据一些理论的规则限制它,它最后把规律一点点装进神经网络里面
流程如下:
- 一开始:模型参数全是随机值,啥也不会,只会乱猜。
- 训练中:用损失函数算 “错多少”,用梯度下降不断调整参数。
- 训练完:模型记住的不是答案,而是规律。
训练的关键目标不只是记住训练数据,更要具备泛化能力—,也就是能对从未见过的新数据做出正确判断。
3.2 损失函数
损失函数(Loss Function) 是给网络的错误程度打分,也就是衡量我们离目标函数还有多远。
最常用的是均方误差:
损失 = ∑ ( 实际输出 − 目标输出 ) 2 损失 = ∑(实际输出 - 目标输出)^2 损失=∑(实际输出−目标输出)2
损失值越大,说明网络错得越离谱;
损失值越小,说明网络越接近目标。
最终目标是找到让损失函数最小化的权重组合。
3.3 梯度下降
梯度是一个“方向指示器”,它能告诉我们:调整哪个权重、朝哪个方向,才能让损失函数的数值变小。
你可以想象正站在山坡上,梯度会指示 “往哪走能更快下山”(对应损失降低)。
假设损失函数是一个多维度的"地形":
高损失(山顶)
/\
/ \
/ \
______/ \______
低损失(山谷)
梯度下降算法就是:
- 计算当前位置的梯度(坡度)
- 朝梯度的反方向走一步
- 重复直到到达山谷底部
权重更新公式:
新权重 = 旧权重 − 学习率 × 梯度 新权重 = 旧权重 - 学习率 × 梯度 新权重=旧权重−学习率×梯度
| 组件 | 作用 |
|---|---|
| 梯度 | 告诉我们"哪个方向能减少损失" |
| 学习率 | 决定"步子迈多大" |
| 反向传播 | 高效计算梯度的算法 |
四、Transformer 与注意力
4.1 为什么需要 Transformer?
早期的语言模型有一个问题:长距离遗忘
"The cat ... [100个词后] ... it _____"
↑
难以联系到前面的"cat"
隔得太远了,模型早就忘记前面说的是cat,所以不知道指代的是谁。
简单举个例子就是:
早期模型就有点像是一个记性很差的学生,学了后面忘了前面,没法把之前的知识串联起来。
Transformer就有点像是给模型配了一个老师,可以看到整篇文章的内容,自动把相关的词联系起来,就不会出现前面说的话忘记的问题。
这个助教就是Transformer的核心:自注意力机制(Self-Attention)
4.2 自注意力机制:每个词都能"回头看"
在 Transformer 中,每个词都可以直接"关注"序列中的任何其他词,不管他们隔得多远:
比如下面这句:
"The cat sat on the mat because it was comfortable"
│ │
└───────────────────────────┘
"it"的注意力
指向"cat"(强)
指向"mat"(弱)
模型能自动判断:
- it 主要关注 cat(注意力强)
- it 也可以轻微关注 mat(注意力弱)
这样就彻底解决了之前的 “长距离遗忘” 问题。
工作原理:
每个词计算三个向量:
- Query(查询):我想找什么?
- Key(键):我这里有什么信息?
- Value(值):我实际要传递的内容是什么?
- 用 Query 和所有词的 Key 匹配,算出注意力分数
- 分数越高,代表两个词关系越紧密
- 最后把 Value 按分数加权求和,得到注意力输出
注意力分数 = Q u e r y ⋅ K e y 注意力分数 = Query · Key 注意力分数=Query⋅Key
输出 = 加权的 V a l u e 之和 输出 = 加权的 Value 之和 输出=加权的Value之和
自注意力机制让每个词都能 “看见” 整句话,并自动决定该和谁关联,这就是 Transformer 能理解长文本的核心。
4.3 多头注意力
多头注意力,就是让模型同时“开好几个视角”去看一句话
如果只有一个注意力头,它一次只能关注一种关系;
而多头,就像让模型同时用好几双眼睛看内容,每双眼睛负责找不同的联系:
头1:关注语法关系("动词 → 主语")
头2:关注语义关系("猫 → 动物")
头3:关注指代关系("it → cat")
最后把所有头的结果拼在一起,模型就能一次性理解语法、意思、指代等所有关系,而不是一次只看懂一种。
我的理解就是从多个角度同时理解一句话,再把所有的角度的信息整合在一起的过程就是多头注意力。
4.4 GPT 规模对比
在原文只是GPT2和GPT3的对比,但是在这几年ai飞速发展的今天,对比起来的数据会更加惊人
| 特性 | GPT‑2 (2019) | GPT‑3 (2020) | GPT‑3.5 (2022) | GPT‑4 (2023) | GPT‑5.2 (2025–2026) |
|---|---|---|---|---|---|
| 参数量 | 15 亿 | 1750 亿 | ≈1750 亿 | ≈1.8 万亿(MoE) | ≈1.8 万亿(MoE) |
| 层数 | 48 | 96 | 96 | >96 | >96 |
| 注意力头 | 25 | 96 | 96 | 多组并行 | 多组并行 |
| 嵌入维度 | 1600 | 12288 | 12288 | 更大 | 更大 |
| 上下文窗口 | 1024 | 2048 | 4k/8k/32k | 8k/32k/128k | 256k+ / 1M+ |
| 架构 | 标准 Transformer | 标准 Transformer | 标准 Transformer | MoE(混合专家) | MoE + 动态路由 |
| 模态 | 文本 | 文本 | 文本 | 文本 + 图像 | 文本 + 图像 + 视频 + 音频 |
GPT 从 GPT‑3 到 2026 年,早已不只是参数的量变,而是架构、模态、上下文、对齐、智能体能力的全面质变 —— 从 “会说话” 进化到 “会思考、会行动、会协作” 的通用智能体。
五、训练的三个阶段
这一块我之前的文章有提到过,所以简单带过
5.1 阶段一:预训练
-
目标:学习语言的通用规律
-
训练数据:数千亿个词(网页、书籍、文章、代码)
-
训练目标:给定前面的词,预测下一个词
通过简单的任务,模型会自动学会一些基本的语法规则,常识,逻辑关系等等。 -
结果:一个能够生成连贯文本的基础模型。
5.2 阶段二:指令微调
-
问题:预训练后的模型,就像个 “只会写作文的机器”—— 你问它 “1+1 等于几”,它可能不会直接说 “2”,反而会续写 “1+1 等于几是一个经典的数学问题,在小学课本里经常出现……”,完全没 get 到你要 “直接回答” 的需求。
-
解决方案:用高质量的提示-响应对进行微调,专门教模型“按指令做事”。简单来说,就是给模型看大量“人类问什么,该怎么回答”的例子。
5.3 阶段三:人类反馈强化学习(RLHF)
-
目标:指令微调后的模型 “会做事” 了,但可能 “不听话”,会有叛逆期,比如会生成虚假信息、说脏话、或者答非所问(虽然通顺,但不符合你的真实需求)。这一步就是让模型 “符合人类价值观”,变得有用、诚实、无害。
-
实施步骤:分两步走,相当于 “先教它判断好坏,再让它往好的方向学”。
步骤 1:训练奖励模型
提示 → 生成多个回答 → 人类排序 → 训练奖励模型
步骤 2:使用强化学习优化
提示 → 生成回答 → 奖励模型打分 → 调整权重
结果:一个有用、诚实、无害的 AI 助手。
六、规模的悖论:越大越好
6.1 令人惊讶的发现
参数越多(模型越大),反而越容易训练,因为高维空间里有更多的方向可以通向"正确答案",不容易卡在死胡同里。
6.2 规模与能力的正相关
模型规模直接决定了能力边界,参数越多,能承载的知识和技能越复杂:
| 参数规模 | 能力 |
|---|---|
| 小(<10B) | 基础语言理解 |
| 中(10B-100B) | 推理、多任务 |
| 大(>100B) | 少样本学习、复杂推理 |
6.3 "涌现"现象
当模型参数达到某个临界规模后,会突然解锁之前完全没有的新能力,就像 “量变到质变” 的瞬间爆发,这就是涌现。
- 算术能力
- 上下文学习能力
- 思维链推理
你有没有好奇AI 的 “理解” 和人类的 “思维” 到底有何不同?
我很好奇,所以就有了下一篇,应该也是最后一篇。马上就要结束了,感谢你看到这里,希望这篇文章对你有帮助。
更多推荐
所有评论(0)