什么是大语言模型(LLM):从语言模型到 ChatGPT,一篇看懂核心能力与边界
什么是大语言模型(LLM):从语言模型到 ChatGPT,一篇看懂核心能力与边界
本文是我的大语言模型学习笔记。它不讨论复杂公式,而是先建立一张清晰的“地图”:LLM 是什么、为什么它突然变得强大、它能做什么,以及使用时应当警惕什么。
1. 从一个问题开始:LLM 到底是什么?
当我们向 ChatGPT 输入“帮我总结这篇文章”时,它能读懂要求、提炼重点,还能按照指定格式输出结果。它背后的核心技术,就是大语言模型(Large Language Model,简称 LLM)。
可以先用一句话理解:
LLM 是在海量文本上训练、拥有大量参数,并能理解和生成自然语言的神经网络模型。
这里有三个关键词:
| 关键词 | 通俗理解 | 为什么重要 |
|---|---|---|
| 大量参数 | 模型内部可学习的“旋钮”更多 | 能容纳更复杂的语言规律与知识模式 |
| 海量数据 | 阅读过书籍、网页、代码、对话等大量文本 | 获得广泛的语言表达和任务知识 |
| 语言建模 | 根据前文预测下一个 token(词或词的一部分) | 看似简单的训练目标,能衍生出理解、写作、问答等能力 |
例如,给模型一句话:今天天气很好,我想去。训练时,模型会学习预测后面可能出现的 token,如“公园”“散步”等。这个过程在海量文本中重复无数次后,模型逐渐学会语法、语义、常识关联,甚至一定的推理模式。
Token 不等于“一个汉字”或“一个单词”。 它是模型切分文本后的基本单位。英文一个单词可能拆成多个 token,中文短语也可能被切成不同数量的 token。
2. LLM 和传统 NLP 模型有什么不同?
在 LLM 出现以前,自然语言处理(NLP)通常遵循“一个任务,一套训练”的方式。
比如要做情感分析,就收集“好评/差评”标注数据,训练一个分类模型;要做翻译,则重新准备平行语料和模型。BERT、T5 等预训练语言模型(PLM)极大提升了这类任务的效果,但面对新任务时,往往仍需要专门的数据与微调。
LLM 改变的不是“会不会预测下一个词”这个基本目标,而是规模、训练方式和使用方式。模型更大、数据更多、训练更充分后,它可以仅凭一句指令或几个示例完成新任务。
| 对比维度 | 传统 PLM / 任务模型 | LLM |
|---|---|---|
| 常见规模 | 从千万到数十亿参数不等 | 通常从十亿级到千亿级,规模不是唯一标准 |
| 典型工作流 | 预训练后,针对每个任务微调 | 通过 Prompt、示例、检索或轻量微调适配任务 |
| 任务形式 | 常为分类、抽取、匹配等单一任务 | 可在同一对话中完成写作、问答、代码、总结等多任务 |
| 输入输出 | 常需要固定格式 | 更自然的文本指令与文本输出 |
| 代表架构 | Encoder-Only、Encoder-Decoder 等 | 当前通用生成模型多为 Decoder-Only,也有多模态及混合架构 |
这并不意味着传统模型被淘汰。在标签固定、延迟极低、成本敏感或必须本地部署的场景,小模型依然很有价值。LLM 的优势主要在于:它更通用,更容易用自然语言与人协作。
3. 为什么 ChatGPT 让 LLM 走进大众视野?
GPT-3 展示了大规模语言模型的潜力,而 ChatGPT 让普通用户真正感受到它的可用性。一个常见的简化理解是:ChatGPT 类模型会经历以下三个阶段。
阶段一:预训练(Pre-training)
模型在大规模文本、代码等数据上进行“预测下一个 token”的训练。这个阶段主要让模型获得基础语言能力与广泛的知识模式,但它不一定擅长听从人类指令。
阶段二:监督微调(Supervised Fine-Tuning,SFT)
训练者提供高质量的“指令 - 理想回答”样本,例如:
指令:用三句话解释什么是 Transformer。
回答:Transformer 是一种以注意力机制为核心的神经网络架构。它能并行处理序列中的各个位置,擅长捕捉长距离依赖。如今许多 LLM 都以它或其变体为基础。
通过学习大量这样的样本,模型开始知道怎样以助手的方式回答问题。
阶段三:偏好对齐(以 RLHF 为代表)
即使两个回答都“没有明显错误”,人类也可能更偏好其中一个,因为它更清楚、更有帮助、更安全。偏好对齐会把这种人类反馈纳入训练,让模型的表达更贴近用户期待。
说明:不同模型的具体训练流程并不完全相同。除 RLHF 外,也有 DPO、RLAIF 等对齐方法;“三阶段”是帮助初学者建立整体认识的经典框架。
4. LLM 的四项核心能力
下面用“让模型帮助规划一次周末北京一日游”这个例子,理解 LLM 常被讨论的能力。
4.1 涌现能力:规模增长带来的能力跃迁
涌现能力(Emergent Abilities)指的是:当模型规模、数据规模和训练计算量跨过某个范围后,一些复杂能力会突然变得明显,而小模型中很难观察到。
它有点像水加热到一定温度后沸腾:持续加热是量变,出现沸腾现象是质变。这里需要保持审慎:学界对“涌现”是否完全是能力突变、还是评测指标与尺度造成的视觉效果,仍有讨论。无论如何,更大规模的模型在复杂任务上往往表现得更强,这是工程实践中反复观察到的现象。
4.2 上下文学习:给几个例子就能上手
上下文学习(In-context Learning,ICL)是指不更新模型参数,只在输入中给出任务说明或少量示例,模型便能完成任务。
任务:判断情感倾向。
示例:
“物流很快,包装也很好” -> 正面
“质量一般,和描述不太一致” -> 负面
现在请判断:
“界面简洁,使用起来很顺手” -> ?
模型会从上下文中推断标签规则,并给出“正面”。这就是常说的 Few-shot Prompting(少样本提示)。
对于“北京一日游”任务,我们不必先训练一个“旅行规划模型”,可以直接写:
请为第一次来北京的大学生规划一日游路线。
预算 500 元以内,偏好历史景点,按时间、地点、交通和预计花费输出。
4.3 指令遵循:把自然语言需求转成结果
经过指令微调与对齐后,模型能理解“做什么、怎么做、用什么格式做”。这就是指令遵循(Instruction Following)。
同样是介绍故宫,下面的提示会产生完全不同、但都合理的结果:
| 指令 | 期望输出 |
|---|---|
| 用 100 字介绍故宫 | 简短的科普文 |
| 为小学生介绍故宫 | 更简单、生动的表达 |
| 用表格列出故宫参观注意事项 | 结构化清单 |
指令越具体,模型越容易产出可用结果。一个实用的提示词结构是:
角色:你是一名……
任务:请完成……
背景:已知信息包括……
约束:不要……;长度控制在……
输出格式:请按……输出。
4.4 逐步推理:把复杂问题拆开处理
复杂问题常需要多个中间步骤,例如行程规划需要考虑时间、距离、预算和开放时间。通过要求模型先分解问题、再给出结论,通常能得到更稳定的答案。这类方法常被称为思维链(Chain-of-Thought,CoT)提示。
需要注意,模型展示出的推理文本不一定等同于它内部真实的计算过程,也不能保证推理过程完全正确。对数学、法律、医学等高风险问题,仍应使用计算工具、权威资料或专业人士进行核验。
5. LLM 的几个重要特点与限制
能力强不等于无所不能。理解 LLM 的边界,是正确使用它的前提。
5.1 多语言能力:会多种语言,但并不均衡
LLM 的训练语料通常包含多种语言,因此常具备翻译、跨语言问答等能力。不过,不同语言的高质量训练数据数量不同,模型在英文、中文和低资源语言上的表现也可能存在明显差异。实际使用时,应当用目标语言的真实任务样本进行评估,而不是只看通用榜单。
5.2 长上下文:能读得更长,不代表能记得更准
上下文窗口决定了一次输入中能放入多少 token。早期 BERT 常见长度为 512 token;如今不少 LLM 支持更长的上下文,适合处理长文档、会议记录和代码仓库。
但“支持很长的上下文”不等于“每一处信息都能准确利用”。当材料很长时,模型可能遗漏中间内容,或对细节引用不准确。因此,长文档任务更适合配合分段、检索、引用来源和人工复核。
5.3 多模态:不只读文字,也能理解图像等信息
多模态大模型会把图像、音频、视频等信息编码后,与文本能力结合。例如,用户上传一张图表并询问“这张图说明了什么”,模型可以同时理解图像内容与文字问题。
5.4 幻觉:最需要警惕的问题
幻觉(Hallucination)是指模型生成了看似流畅、实际却虚假或无法证实的信息。例如,它可能编造不存在的论文、错误引用政策条款,或给出貌似合理但错误的计算结果。
幻觉产生的根源在于:语言模型的目标是生成与上下文“统计上合理”的文本,而不是天然的事实数据库。
| 场景 | 更稳妥的做法 |
|---|---|
| 查资料、写论文 | 要求给出可访问来源,并逐条核验 |
| 企业知识问答 | 使用 RAG(检索增强生成),让回答基于已检索文档 |
| 数学与数据分析 | 让模型调用计算工具,并复算关键结论 |
| 医疗、金融、法律 | 仅作辅助,不把模型输出作为最终专业结论 |
一个重要原则:把 LLM 当作高效的协作者,而不是不需要验证的权威。
6. 一张图总结:从 LLM 到实际应用
7. 小结
LLM 本质上仍是语言模型:它通过预测下一个 token 学习语言规律。但当模型、数据和训练规模提升后,再经过指令微调与偏好对齐,它展现出了更强的通用能力:
- 涌现能力:复杂任务上的表现随规模提升而显著增强。
- 上下文学习:通过提示词和少量示例适配新任务,无需每次重新训练。
- 指令遵循:能够理解自然语言需求,并按约束和格式完成任务。
- 逐步推理:能将部分复杂问题拆解为多个步骤处理。
同时,LLM 仍会产生幻觉,能力也会受到数据、上下文长度、提示方式和具体模型的影响。理解其能力与局限,才能把它真正用在可靠的学习和工程实践中。
8. 下一步学什么?
建立了整体概念后,可以沿着下面的顺序继续学习:
下一篇我计划深入学习:LLM 的预训练、监督微调(SFT)与偏好对齐究竟分别解决了什么问题?
参考阅读
- OpenAI. Language Models are Few-Shot Learners(GPT-3).
- Wei et al. Emergent Abilities of Large Language Models.
- Ouyang et al. Training language models to follow instructions with human feedback(InstructGPT).
- Wei et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models.
更多推荐



所有评论(0)