大模型名词精讲08:Pre-training(预训练)
小伙伴们有没有好奇过:AI明明没人手把手教它,怎么就懂那么多东西?上知天文下知地理,连我们随口说的网络热梗都能接上,甚至还能帮我们写代码、编故事。它到底是偷偷上了多少补习班?
其实,AI的“学习”方式和大家想象的不一样。它不需要老师划重点、改作业,而是靠自己在海量文本里“泡”着,泡着泡着就学会了。这个“泡澡”的过程,就是我们今天要聊的——Pre-training,预训练。
一、预训练到底在干嘛?
说白了,预训练就是让大模型玩一场无限循环的文字接龙游戏。
规则特别简单:给模型看一段话,遮住最后一个词,让它猜被遮住的是什么。比如给它看“床前明月__”,它要猜出“光”;给它看“今天天气真__”,它要猜出“好”或者“热”。猜对了就强化它的记忆,猜错了就调整它的“脑回路”。
这个过程有个专业名字叫自监督学习——不需要人工给它标注答案,数据本身就自带“答案”。毕竟一段完整的文本,前面所有的词就是后面那个词的“上下文提示”,模型自己就能判断自己猜的对不对。
你可以把它想象成一个刚学说话的小孩,没人教他语法书,但他天天泡在大人说话的环境里,听了几百亿句话之后,自然就摸清了“主谓宾怎么排”“什么词该接什么词”的规律。预训练就是大模型的“语言浸泡期”,泡得越久,吸的知识越多。
二、预训练到底“吃”什么?
模型的“食物”就是海量的文本数据,来源五花八门:
- 互联网网页:占大头,比如维基百科、新闻网站、论坛帖子,什么领域的内容都有,让模型见多识广。
- 书籍:小说、科普书、教材,帮模型学会长逻辑的表达,理解复杂的故事和知识。
- 代码:GitHub上的开源代码,让模型学会编程语言的语法和逻辑,以后才能帮你写代码、改bug。
- 对话数据:论坛、社交平台的聊天记录,让模型学会口语化的表达,以后和你聊天的时候不会像个机器人。
不同模型的“食谱”也不一样。比如GPT-3的训练数据里多数是网页内容,少数是书籍;LLaMA的数据里多数是对话数据,书籍很少。数据配比不同,模型擅长的方向也不同,就像偏食的小孩,吃蔬菜多的长得壮,吃肉多的力气大。
不过不是所有文本都能喂给模型。数据要经过严格的清洗:要去掉重复的内容,过滤掉骂人、造谣的有害信息,还要统一格式,把文字切成模型能看懂的Token(咱们第2篇讲过的“识字积木”)。数据质量差,模型学出来就“歪”,就像小孩跟着满嘴脏话的人学说话,以后张嘴就骂人。
三、预训练有多“烧钱”?
预训练是出了名的“富人的游戏”,普通团队根本玩不起。
首先是算力需求:要同时用几千甚至上万张高端GPU(比如英伟达的H100、H800),不眠不休跑好几个月。OpenAI训练GPT-4用了2.5万多张A100 GPU,跑了100多天,光电费就够一个小城市用一周。
其次是成本:根据斯坦福大学2024年的AI指数报告,不同模型的预训练成本差得离谱:
| 模型 | 预训练成本 | 备注 |
|---|---|---|
| Transformer(2017年) | 930美元 | 开山鼻祖,成本极低 |
| BERT(2018年) | 3300美元 | 谷歌出品,早期经典 |
| GPT-3(2020年) | 430万美元 | OpenAI的1750亿参数模型 |
| GPT-4(2023年) | 7800万美元 | 当时最贵的模型之一 |
| Gemini Ultra(2023年) | 1.91亿美元 | 谷歌的旗舰模型 |
| DeepSeek-V3(2024年底) | 557.6万美元 | 国产黑马,成本仅GPT-4的1/14 |
可以看到,成本涨得比房价还快。不过DeepSeek-V3证明了,靠架构创新(比如MoE混合专家架构),不用堆算力也能训出顶级模型,557万美元就做出了比肩GPT-4o的效果,直接把行业门槛拉低了一大截。
这里还有个著名的Scaling Law(缩放定律):也就是大力出奇迹,2020年OpenAI的研究发现,模型的性能和三个因素正相关——模型参数越多、训练数据越多、算力越大,模型就越聪明。而且这种提升是可以预测的,不是玄学。这也就是为什么各大厂拼命卷参数、卷数据、卷算力,因为只要投入够多,模型就一定会变强。
四、预训练完,模型就会聊天了吗?
并没有。
预训练出来的模型,本质上只是个“文字接龙高手”。你给它输入“中国的首都是”,它会接“北京”;你给它输入“1+1=”,它会接“2”。但如果你问它“中国的首都是哪里?”,它可能不会回答你,而是接着写“中国的首都是哪里?这是一个很多人都不知道的问题……”——它只会顺着你的话往下续写,不会回答问题。
要让模型学会“对话”,还需要两个后续阶段:
- 监督微调(SFT):给它看大量“问题+标准答案”的样本,教它怎么按照指令回答问题,从“续写者”变成“答题者”。
- 人类反馈强化学习(RLHF):让人类给模型的不同回答打分,告诉它“这个回答好”“那个回答差”,让它学会什么该说、什么不该说,从“答题者”变成“懂规矩的助手”。
我们平时用的ChatGPT、通义千问,都是经过这三个阶段打磨的最终成品。预训练只是第一步,相当于给模型打了“知识地基”,后面两步才是“精装修”。
五、普通人需要关心预训练吗?
完全不需要自己搞预训练。
预训练的成本太高,99%的企业和个人都玩不起。如果你想搞自己的AI应用,直接拿开源的预训练模型(比如Llama、Qwen、DeepSeek)来做微调就行,成本能降好几个数量级。
不过你可以关注两个点:
- 模型的预训练数据质量:数据越干净、越丰富,模型的基础能力就越强。比如专门用医学文献预训练的模型,肯定比通用模型更懂医学知识。
- 模型的预训练规模:参数越多、数据越多的模型,通常能力上限越高,但推理成本也越高。选模型的时候要根据你的需求来,别盲目追求最大的。
总结
预训练是大模型成长的“第一阶段”,靠自监督学习在海量文本里“泡”出通用的语言能力和世界知识。它不需要人工标注,但需要巨额算力、海量数据和顶尖技术。预训练出来的模型只是个“半成品”,还要经过微调和RLHF才能变成我们日常使用的AI助手。理解预训练,你就能明白为什么大模型这么“烧钱”,也能明白为什么开源模型能让普通开发者也能用上顶级AI——站在巨人的肩膀上,真的能省很多力气。
小伙伴们,让我们猜猜下一篇是关于那些内容的?
更多推荐
所有评论(0)