原文:What Is ChatGPT Doing and Why Does It Work

想看第一部分的可以跳转到这里ChatGPT在做什么,以及它为什么能起作用(一)

第一部分的的核心内容是ChatGPT 并不具备“意识”,它本质上是一个 “概率预测机器” 。它所做的唯一一件事,就是根据前文预测下一个单词(Token)是什么

如果说 “概率预测” 是 ChatGPT 的底层逻辑,那支撑这一逻辑落地、让它能精准捕捉语言规律、突破传统模型局限的核心,就是神经网络与Transformer 架构。这也是我们这篇要深入拆解的关键 —— 从基础的神经元运作,到 Transformer 的核心创新,看懂 AI 如何把 “概率预测” 做到极致。


引言:从大脑到数学模型

在第一部分中,我们揭开了 ChatGPT 的"概率接龙"本质。但这引出一个更深层的问题:
这些概率是如何计算出来的?

答案藏在一种受人脑启发的数学模型中——神经网络

正如沃尔弗拉姆所言:

“每一个神经元都在做简单的工作……但 1750 亿个连接在一起,就能神奇地完成’人类水平’的生成任务。这在科学上是一个惊人的发现。”


一、神经网络:大脑的理想化模型

1.1 从生物神经元到数学函数

当我们"看见"一个数字"2"时,人脑发生了什么?


光线 → 视网膜细胞 → 神经信号 → 视觉皮层 → ... → "我看到了2"

这个复杂的过程涉及约 1000 亿个神经元,每个神经元以每秒最多约 1000 次的频率传递信号。

人工神经网络(ANN)是这个过程的理想化数学模型

下图是二者的对比图:
在这里插入图片描述

特性 人脑 人工神经网络
神经元数量 约 1000 亿 可变(数千到数十亿)
信号类型 电脉冲 数值计算
连接方式 复杂生物网络 层结构
学习方式 生物进化/可塑性 梯度下降/反向传播

1.2 神经网络的基本结构

神经网络的核心逻辑是分层处理信息—— 从原始数据到最终结果,每一层都在做 “特征提炼”,最终把复杂问题拆解成可计算的数学任务。我们以经典的手写数字识别为例,下面是简单的图示:

输入层 (784个神经元)
  ↓ 对应 28×28 像素图像
隐藏层 1
隐藏层 2
隐藏层 3
隐藏层 4
  ↓ 核心特征提取
输出层 (10个神经元)
  ↓ 对应 0-9 的数字分类

推荐使用TensorFlow Neural Network Playground
这是一个交互式神经网络的生成网站,能直观了解网络的工作原理。上手玩一下,或许能有点收获
在这里插入图片描述

1.3 神经元的数学:每个"细胞"在做什么?

神经网络的核心单元是神经元,本质上只执行一套极其简单的运算
输出 = f ( w 1 ⋅ x 1 + w 2 ⋅ x 2 + . . . + w n ⋅ x n + b ) 输出 = f(w₁·x₁ + w₂·x₂ + ... + wₙ·xₙ + b) 输出=f(w1x1+w2x2+...+wnxn+b)
我们可以把每个符号拆成直白的解释:

  • x₁、x₂…xₙ:神经元的输入信号(比如来自上一层神经元的输出,或原始数据如图片像素);
  • w₁、w₂…wₙ:对应输入的权重(Weight)—— 相当于可调节的 “旋钮”,权重大小决定了这个输入信号的 “重要程度”;
  • b偏置(Bias)—— 给运算加一个 “基础偏移”,让神经元更灵活地适配数据;
  • f激活函数(如 ReLU、Sigmoid)—— 给简单的线性运算加入 “非线性”,让神经元能学习复杂规律。

单个神经元的能力极其优先,做的运算也毫无智能感,但数以亿计的神经元通过权重相互连接、层层叠加,这些简单的运算就会被放大,最终形成能处理图像识别、语言生成等复杂任务的强大系统。


二、吸引子:识别的本质

2.1 什么是"吸引子"?

神经网络如何"识别"一个残缺、模糊或带噪点的图像?关键就是吸引子(Attractor)

我的理解是,不管起点在哪里,最后都会稳定跑到同一个状态,这个“最终状态”就是吸引子。举个不恰当的例子解释就是,一个在碗里的小球,不管你把球放在碗的那个位置,不考虑他弹出的情况,他最终都会停在碗底。

神经网络也是如此:

【模糊/残缺输入】
   输入:噪声、残缺、歪斜的"2"
       ↓

【神经网络(动态系统)】
输入层 → 隐藏层1 → 隐藏层2 → 隐藏层3 → 隐藏层4
       (逐层提取特征,状态不断收敛)
       ↓

【吸引子(稳定状态)】
   吸引子 = 系统最终收敛的标准模式
       ↓

【输出:识别为"2"】

不管输入的残缺、模糊或者带噪点的图片,网络最终都会自动收敛到最接近的那个数字,在上面这张图片就表现为:希望所有的数字1都被一个地方吸引,而数字2被另外一个地方吸引。

核心原理

  • 所有数字"1"的变体都被吸引到同一个区域
  • 所有数字"2"的变体都被吸引到另一个区域
  • 网络学会将"相似"的输入映射到"相似"的输出状态
    在这里插入图片描述

2.2 特征提取的层级

当我们向神经网络展示猫的图像时,每一层提取不同级别的特征:

输入图像(猫)
    ↓
第1层:边缘检测、轮廓、颜色区块
    ↓
第5层:眼睛、耳朵形状、纹理
    ↓
第10层:尖耳朵、胡须、猫的脸(抽象概念)
    ↓
输出:"猫"

这些特征大多没有人类能理解的名字,比如“尖耳朵”是我们起的名字,但神经网络学到的很多特征,人类根本无法用语言描述,它们只是数学上的一组激活模式,不是我们定义的概念。

但值得注意的是,像这里显示的神经网络的前几层似乎提取图像的某些方面(如物体的边缘),这些方面与我们知道的由大脑视觉处理第一级提取的方面相似。


三、机器学习与神经网络的训练

3.1 训练的本质

神经网络一开始是随机初始化的,基本上是在"瞎猜"。

训练的过程,就是找到一组合适的权重(参数),让网络能复现我们提供的示例。

简单来说,就是给模型看一大堆例子,让它自动调节那一部分更重要(权重),然后让他根据一些理论的规则限制它,它最后把规律一点点装进神经网络里面

流程如下:

  1. 一开始:模型参数全是随机值,啥也不会,只会乱猜。
  2. 训练中:用损失函数算 “错多少”,用梯度下降不断调整参数。
  3. 训练完:模型记住的不是答案,而是规律

训练的关键目标不只是记住训练数据,更要具备泛化能力—,也就是能对从未见过的新数据做出正确判断。

3.2 损失函数

损失函数(Loss Function) 是给网络的错误程度打分,也就是衡量我们离目标函数还有多远。

最常用的是均方误差:
损失 = ∑ ( 实际输出 − 目标输出 ) 2 损失 = ∑(实际输出 - 目标输出)^2 损失=(实际输出目标输出)2

损失值越大,说明网络错得越离谱;
损失值越小,说明网络越接近目标。

最终目标是找到让损失函数最小化的权重组合。

3.3 梯度下降

梯度是一个“方向指示器”,它能告诉我们:调整哪个权重、朝哪个方向,才能让损失函数的数值变小。
你可以想象正站在山坡上,梯度会指示 “往哪走能更快下山”(对应损失降低)。

假设损失函数是一个多维度的"地形":

        高损失(山顶)
             /\
            /  \
           /    \
    ______/      \______
       低损失(山谷)

梯度下降算法就是:

  1. 计算当前位置的梯度(坡度)
  2. 朝梯度的反方向走一步
  3. 重复直到到达山谷底部

权重更新公式
新权重 = 旧权重 − 学习率 × 梯度 新权重 = 旧权重 - 学习率 × 梯度 新权重=旧权重学习率×梯度

组件 作用
梯度 告诉我们"哪个方向能减少损失"
学习率 决定"步子迈多大"
反向传播 高效计算梯度的算法

四、Transformer 与注意力

4.1 为什么需要 Transformer?

早期的语言模型有一个问题:长距离遗忘

"The cat ... [100个词后] ... it _____"
                   ↑
         难以联系到前面的"cat"

隔得太远了,模型早就忘记前面说的是cat,所以不知道指代的是谁。

简单举个例子就是:
早期模型就有点像是一个记性很差的学生,学了后面忘了前面,没法把之前的知识串联起来。
Transformer就有点像是给模型配了一个老师,可以看到整篇文章的内容,自动把相关的词联系起来,就不会出现前面说的话忘记的问题。

这个助教就是Transformer的核心:自注意力机制(Self-Attention)

4.2 自注意力机制:每个词都能"回头看"

在 Transformer 中,每个词都可以直接"关注"序列中的任何其他词,不管他们隔得多远:
比如下面这句:

"The cat sat on the mat because it was comfortable"
         │                           │
         └───────────────────────────┘
                  "it"的注意力
                  指向"cat"(强)
                  指向"mat"(弱)

模型能自动判断:

  • it 主要关注 cat(注意力强)
  • it 也可以轻微关注 mat(注意力弱)

这样就彻底解决了之前的 “长距离遗忘” 问题。
工作原理

每个词计算三个向量:
- Query(查询):我想找什么?
- Key(键):我这里有什么信息?
- Value(值):我实际要传递的内容是什么?
  1. Query 和所有词的 Key 匹配,算出注意力分数
  2. 分数越高,代表两个词关系越紧密
  3. 最后把 Value 按分数加权求和,得到注意力输出

注意力分数 = Q u e r y ⋅ K e y 注意力分数 = Query · Key 注意力分数=QueryKey
输出 = 加权的 V a l u e 之和 输出 = 加权的 Value 之和 输出=加权的Value之和

自注意力机制让每个词都能 “看见” 整句话,并自动决定该和谁关联,这就是 Transformer 能理解长文本的核心。

4.3 多头注意力

多头注意力,就是让模型同时“开好几个视角”去看一句话

如果只有一个注意力头,它一次只能关注一种关系;

多头,就像让模型同时用好几双眼睛看内容,每双眼睛负责找不同的联系:

头1:关注语法关系("动词 → 主语")
头2:关注语义关系("猫 → 动物")
头3:关注指代关系("it → cat")

最后把所有头的结果拼在一起,模型就能一次性理解语法、意思、指代等所有关系,而不是一次只看懂一种。

我的理解就是从多个角度同时理解一句话,再把所有的角度的信息整合在一起的过程就是多头注意力。

4.4 GPT 规模对比

在原文只是GPT2和GPT3的对比,但是在这几年ai飞速发展的今天,对比起来的数据会更加惊人

特性 GPT‑2 (2019) GPT‑3 (2020) GPT‑3.5 (2022) GPT‑4 (2023) GPT‑5.2 (2025–2026)
参数量 15 亿 1750 亿 ≈1750 亿 ≈1.8 万亿(MoE) ≈1.8 万亿(MoE)
层数 48 96 96 >96 >96
注意力头 25 96 96 多组并行 多组并行
嵌入维度 1600 12288 12288 更大 更大
上下文窗口 1024 2048 4k/8k/32k 8k/32k/128k 256k+ / 1M+
架构 标准 Transformer 标准 Transformer 标准 Transformer MoE(混合专家) MoE + 动态路由
模态 文本 文本 文本 文本 + 图像 文本 + 图像 + 视频 + 音频

GPT 从 GPT‑3 到 2026 年,早已不只是参数的量变,而是架构、模态、上下文、对齐、智能体能力的全面质变 —— 从 “会说话” 进化到 “会思考、会行动、会协作” 的通用智能体。


五、训练的三个阶段

这一块我之前的文章有提到过,所以简单带过

5.1 阶段一:预训练

  • 目标:学习语言的通用规律

  • 训练数据:数千亿个词(网页、书籍、文章、代码)

  • 训练目标:给定前面的词,预测下一个词
    通过简单的任务,模型会自动学会一些基本的语法规则,常识,逻辑关系等等。

  • 结果:一个能够生成连贯文本的基础模型。

5.2 阶段二:指令微调

  • 问题:预训练后的模型,就像个 “只会写作文的机器”—— 你问它 “1+1 等于几”,它可能不会直接说 “2”,反而会续写 “1+1 等于几是一个经典的数学问题,在小学课本里经常出现……”,完全没 get 到你要 “直接回答” 的需求。

  • 解决方案:用高质量的提示-响应对进行微调,专门教模型“按指令做事”。简单来说,就是给模型看大量“人类问什么,该怎么回答”的例子。

5.3 阶段三:人类反馈强化学习(RLHF)

  • 目标:指令微调后的模型 “会做事” 了,但可能 “不听话”,会有叛逆期,比如会生成虚假信息、说脏话、或者答非所问(虽然通顺,但不符合你的真实需求)。这一步就是让模型 “符合人类价值观”,变得有用、诚实、无害。

  • 实施步骤:分两步走,相当于 “先教它判断好坏,再让它往好的方向学”。

步骤 1:训练奖励模型

提示 → 生成多个回答 → 人类排序 → 训练奖励模型

步骤 2:使用强化学习优化

提示 → 生成回答 → 奖励模型打分 → 调整权重

结果:一个有用、诚实、无害的 AI 助手。


六、规模的悖论:越大越好

6.1 令人惊讶的发现

参数越多(模型越大),反而越容易训练,因为高维空间里有更多的方向可以通向"正确答案",不容易卡在死胡同里。

6.2 规模与能力的正相关

模型规模直接决定了能力边界,参数越多,能承载的知识和技能越复杂:

参数规模 能力
小(<10B) 基础语言理解
中(10B-100B) 推理、多任务
大(>100B) 少样本学习、复杂推理

6.3 "涌现"现象

当模型参数达到某个临界规模后,会突然解锁之前完全没有的新能力,就像 “量变到质变” 的瞬间爆发,这就是涌现。

  • 算术能力
  • 上下文学习能力
  • 思维链推理

你有没有好奇AI 的 “理解” 和人类的 “思维” 到底有何不同?
我很好奇,所以就有了下一篇,应该也是最后一篇。马上就要结束了,感谢你看到这里,希望这篇文章对你有帮助。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐