【从零实现C++AI大模型接入SDK(标准项目)】《系列(一)------项目简介+AI知识科普》
一. 项⽬背景
从1994年接⼊互联⽹⾄今,中国互联⽹的发展历经了PC时代、移动互联⽹时代,尤其是在移动互联⽹时代进⾏了⼤量的海量数据、技术积累,以及硬件算⼒的巨⼤提升,之前不温不⽕的⼈⼯智能,伴随着ChatGPT的横空出现,迎来了今天AI的爆⽕,各种⼤模型、智能体应⽤等如⾬后春笋版涌现出来,AI在更进⼀步进⼊普通⼈的⽣活。现在各个⼚商也在积极拥抱AI,作为程序员我们决不能停留在简单使⽤DeepSeek、ChatGPT这种⼤模型级别的产品,⽽应该去学习⼤模型应⽤背后的相关技术,将模型接⼊到我们程序中来,让AI为⾃⼰服务,提⾼⽣产效率。本项⽬就带领⼤家从底层学习如何接⼊⼤模型,这也是进⾏⼤模型开发的第⼀步。
本项⽬⽬标旨在:
- 掌握⼤模型相关的⼀些基础知识
- 掌握官⽹提供⼤模型的API接⼝的学习
- 掌握C++下远程接⼊⼤模型思路及技术实现
- 掌握C++下本地接⼊⼤模型的思路及技术实现
- 开发⼀套语⾔聊天⼤模型应⽤

二.名词解释
【模型 - Model】
此处模型专指AI领域的模型。可以简单理解成⼀个从⼤量数据中学习规律、⽤于进⾏预测的数学函数,只是该函数参数巨多、⽆⽐复杂。可以简单类⽐成⼀个正在学说话的⼩孩。
⼩孩通过⽿朵输⼊海量的语⾳数据,⽐如:家⼈的⼝头教学、⽇常⽣活对话、读绘画本,通过眼睛去认识各种物品,⽐如家庭⽇⽤品、交通⼯具、动物、花花草草等,⼩孩通过⼤⼈的⽿传⾝教不断学习成⻓,慢慢地就能听懂⼤⼈的指令,甚⾄模仿⼤⼈⾏为等,建⽴起⾃⼰的语⾔规则。
⽐如他发现,我们经常将"吃"和"饭饭"、"⽔果"连在⼀起,"睡觉觉"和"床"连在⼀起,
当给孩⼦说:宝宝太晚了,我们⼀起上床_____
宝宝就会说:睡觉觉~~~
【⼤模型 - Large Model】
⼤模型就是AI⾥的超级学霸,参数巨多、知识量爆炸的AI模型,像吃了百科全书+全⽹数据的“六边形战⼠”。⼀个既能看懂你的照⽚(视觉),⼜能听懂你的指令(语⾳),还能⽤⽂字回答你的模型,就是⼤模型。⼤体现在:
- 参数海量:GPT-3有1750亿个参数,⽽早期模型参数不到⼀百万。
- 训练数据恐怖:吃掉整个互联⽹⽂本(书籍、论⽂、⽹⻚、代码...)
- 训练⼀次GPT-3 ≈ 190万度电(够5000个家庭⽤1年)
【⼤语⾔模型 - Large Language Model - LLM】
⼤语⾔模型就是AI界的"超级话痨",是⼀个吃掉整个互联⽹的⽂本,能读会写、知识渊博的AI⼤脑,专⻔处理⼈类语⾔,⽐如聊天、协作、翻译、编程等,但可能会胡说⼋道。将整个互联⽹的数据喂给⼤模型后,⼤模型会通过神经⽹络分析词语之间的关系,例如将"猫"、"喵喵
叫"、"⽑茸茸"词归类到⼀起,但是它并不理解,当⼈类在提问的时候它会推测出最可能得回答。
⼤模型的局限性
- 可能会出现"幻觉"
- 没有真正"理解"
- 偏⻅与安全⻛险
目前主流的大语言模型中,OpenAI于2025年8月正式发布的GPT-5、Google的推理强模型Gemini 2.5 Pro、Anthropic首款混合推理模型Claude 3.7 Sonnet、深度求索的DeepSeek-V3.2(其V4也已发布预览版)、阿里的Qwen3系列,以及字节跳动的Doubao-Seed-1.6等
【提⽰词 - Prompt】
给AI的任务说明书,告诉AI要做什么、怎么做的指令。
【提⽰词设计三要素】
- ⻆⾊设定Role
"你是⼀个具有⼗年以上C++后端开发的架构师,请帮我设计类似微信的聊天软件"
问题描述
- 任务描述Task
"⽤200字总结导致拖延症原因"
- 格式约束Format
"请按要点分条列出,每条不超过15字"
【上下⽂ - Content】
AI在对话或任务中临时记住的信息,像⼈类聊天时不会突然失忆,能联系前后⽂理解意思。
⽤⼾:推荐⼀部科幻电影
AI:《星际穿越》
⽤⼾:为什么推荐这部?
AI(结合上下⽂):因为它的硬核科学设定和感⼈⽗⼥情...
大语言模型并不会记住所有上下文信息,当对话超出其上下文窗口时,最早的部分会被丢弃,就像内存满了自动覆盖旧数据一样。例如,GPT-4的上下文窗口为128K tokens,大约对应10万个英文字词
【token】
token 是模型⽤来表⽰⾃然语⾔⽂本的基本单位,可直观理解为“字”或“词”;通常 1 个中⽂词
语、1 个英⽂单词、1 个数字或 1 个符号计为 1 个 token。
不同模型中关于token的计算⽅式可能稍有差异。下⾯是DeepSeek官⽹中关于公布的token的计算⽅式以及收费:


三.DeepSeek、ChatGPT、Gemini使⽤
3.1 产品和模型
DeepSeek、ChatGPT、Gemini并不是⼤模型,⽽是基于某个⼤模型开发出来的⼤模型应⽤产品。
⼤模型具有⼤量参数(数⼗亿甚⾄百亿)的⼈⼯智能模型,它学习了海量知识,掌握了理解⾃然语⾔、逻辑推理、写作、编程等底层通⽤能⼒,是⼀个拥有巨⼤潜⼒的"⼤脑"。
⼤模型产品是基于具体⼤模型开发出来的应⽤或服务,这些产品将⼤模型的能⼒封装成⽤⼾友好的界⾯或⼯具,提供给最终⽤⼾进⾏使⽤。⽐如DeepSeek官⽹提供的能和⽤⼾聊天的⽹⻚服务,实际就是DeepSeek-V4模型装上了⼀个聊天界⾯,让⽤⼾低成本使⽤⼤模型提供的服务,你问⼤模型问题,⼤模型将理解你的问题后将⾃⼰回答输出给你。
⽐如:DeepSeek是深度求索公司开发的,基于DeepSeek-V4模型的产品。
3.2 deepseek使⽤
deepseek官⽹:DeepSeek | 深度求索
以前打开DeepSeek官⽹,显⽰如下⻚⾯
DeepSeek当前最新版本(截至2026年7月31日)
当前DeepSeek的主力是V4系列。
| 对比项 | DeepSeek-V4-Pro | DeepSeek-V4-Flash |
|---|---|---|
| 定位 | 旗舰推理模型,性能最强 | 轻量高效模型,性价比最高 |
| 总参数/激活参数 | 1.6T / 49B | 284B / 13B |
| 上下文窗口 | 100万Token(标配) | 100万Token(标配) |
| 架构 | MoE + 混合注意力(CSA/HCA) | MoE + 混合注意力(CSA/HCA) |
| 推理模式 | Non-think / Think High / Think Max | Non-think / Think High / Think Max |
| 性能定位 | 逼近闭源前沿模型(如GPT-5.5),差距约3-6个月 | 推理能力接近Pro版,但纯知识任务稍弱 |
| 价格(输出/百万Token) | 平时$0.87,高峰$1.74 | 平时$0.28,高峰$0.56 |
| 适用场景 | 复杂推理、Agent任务、长文档处理、高难度编程 | 实时对话、高频调用、函数调用、成本敏感场景 |
V4-Pro是“满血旗舰”,V4-Flash是“高性价比轻量版”,两者都标配100万Token超长上下文。

① 深度推理模式和快速响应模式开关,默认未选中为快速响应模式,选中之后切换到深度思考模式。
② 未选中时仅使⽤模型预训练知识,开启后可获取最新信息,注意联⽹搜索模式下不⽀持上传⽂件。
③ 未选中时⽆法上传⽂件,仅通过⽂本输⼊和模型交互,开启后⽀持上传PDF、Word、Excel等⽂件,模型会读取⽂件内容并根据内容回答问题,⽬前暂不⽀持图⽚。
④ 输⼊⽤⼾提⽰词之后,发送给模型,让模型思考回答
⑤ 开新⼀轮对话。⽐如切换⼀个新话题、当对话边的混乱,模型开始"胡⾔乱语"时。
⑥ ⽀持会话管理。可以点击任意⼀条之前的会话记录,快速回到该次会话中,继续之前会话,就想看书时返回之前章节⼀样。会话名称⼀般是第⼀次问题的开头命名。

3.3 ChatGPT
ChatGPT,从名字中看Chat是聊天的意思,GPT是什么意思?
GPT是 Generative Pre-trained Transformer 的缩写。
Generative(⽣成式) : 它能⽣成内容(⽂字、代码图像等),不是简单检索
Pre-trained(预训练) : 在⼤模型⽂本数据上先进⾏通⽤训练,再针对具体任务做微调
Transformer : ⼀种深度学习框架,是⽬前⼤语⾔模型的核⼼技术,擅⻓处理序列数据,⽐如⾃然语⾔。
GPT就是基于深度学习框架的⼀种⼤语⾔模型系列,⽐如:GPT-4、GPT-5。ChatGPT就是基于GPT模型的聊天式⼈⼯智能助⼿,是⼀个产品。
GPT-4可以处理⽂字和图⽚输⼊,刚开始主要是⽂字版(GPT-4-turbo),后来逐步开放图像输⼊,⽐如识别图⽚中⽂字、分析图表等,但输出主要是⽂字。GPT-5是⼀个完整的多模态模型,输⼊可以是⽂字、图⽚、⾳频、视频帧等,输出可以是⽂字、语⾳、甚⾄可以配合Sora⽣成视频。

① 使⽤ChatGPT搜索:选中之后会先调⽤"联⽹搜索"获取⽹⻚,再把结果交给ChatGPT进⾏总结和会话
② 与ChatGPT交谈:标准聊天模式,主要⽤来对话、问答、写作、编程等
③ 研究:⾃动查资料并⽣成结构化且带引⽤的研究报告
④ Sora:Sora是⽣成视频的模型,输⼊⽂字即可⽣成视频内容,和GPT系列不同

3.4 Gemini
官网:https://gemini.google.com/app
gemini翻译过来是双⼦座,双⼦座标志是两个并排站⽴的⼈物,象征则会⼆元性、合作以及强⼤的⼒量。Google在开发Gemini时,将Google DeepMind和Google Research的"Brain"团队合并,这两个团队的合作被视为"双⼦",共同致⼒于打造这个野⼼勃勃的多模态AI模型。

还有⼀个说法是致敬NASA(美国国家航空航天局)的双⼦座计划,该计划是阿波罗登⽉计划之前的关键⼀步,旨在测试宇航员⻓时间太空⻜⾏和太空对接等技术,这项开创性计划的巨⼤努⼒和对未来成功的奠定,与开发⼤语⾔模型的艰难任务产⽣了共鸣,因此团队使⽤了"Gemini"名字。

① 上传⽂件,⽀持⽂本、图⽚、视频等不同格式⽂件,让⼤模型进⾏理解并进⾏各种操作,⽐如总结⽂档关键内容,分析表格数据等
② Deep Research:对问题进⾏更深⼊、全⾯的信息检索和分析,⼀般在处理复杂或专业性强的问题时⾮常有⽤
③ 图⽚⽣成:根据⽤⼾的提⽰词,Gemini会使⽤Imagen模型⽣成⼀幅符合描述的图⽚
④ 创建⽂档和应⽤:启⽤之后Gemini会根据⽤⼾输⼊需求,使⽤Canvas⽣成⽂档初稿,⽤⼾可以实时调整和优化
⑤ 像⼀个私⼈导师,能⽤多种⽅式来辅助学习,⽐如总结提炼核⼼要点、⽣成学习材料等。
⑥ ⽀持语⾳输⼊
⑦ 发起新⼀轮对话和临时对话,临时对话不会显⽰在会话记录中,临时会话系统仅保留72⼩时;发起新⼀轮对话会开启⼀个全新的聊天会话
⑧ 模型切换,模型切换功能目前支持Gemini 2.5 Flash和Gemini 2.5 Pro,其中Flash版主打高性价比与低延迟,适合实时交互、大规模分类等高频简单任务;Pro版则作为旗舰推理模型,专攻复杂编程、深度逻辑推理和多步骤Agent任务。不过需要留意的是,随着2026年5月谷歌发布Gemini 3.5 Flash,新的Flash版本在数学和知识类等多项基准测试中已反超Gemini 2.5 Pro,仅在编程任务上2.5 Pro仍保持微弱优势,因此如果追求最新性能表现,升级至3.x系列可能是更优选择。
⑨ ⽀持会话管理

四. 为什么学习通过API使⽤⼤模型
既然各个⼤模型⼚商已经提供了类似DeepSeek、ChatGPT、Gemini这样的⼤模型服务了,开箱即⽤⾮常⾹,在⽇常学习⼯作中已经收获颇丰,为什么还要学习⼿动接⼊⼤模型?
我认为有以下⼏点原因:
- 了解更多⼤模型知识,提⾼⾃⼰竞争⼒使⽤官⽅⼤模型服务就像开⻋,会操作就⾏,⽬的是到达终点;调⽤API就像学习汽⻋原理、保养和改装,能让你造出更适合任务的专⽤⻋,甚⾄将发动机装到⻜机、轮船上。前者是⼤模型产品的使⽤者,后者已经摇⾝成为⼤模型应⽤的创造者。
- 构建⾃⼰的应⽤API允许你将⼤模型的"⼤脑"与你⾃⼰的程序、⽹站、数据库等连接起来,实现通⽤机器⼈⽆法完成的任务,解锁⽆限可能性。⽐如:开发智能编程助⼿提⾼⽇常开发效率、构建⾃动化⼯作流(⾃动处理邮件、⽣成报告、分析数据等)、构建垂直领域应⽤(为法律、医疗、教育等领域开发专业的问答⼯具)
- 职业发展⼤模型应⽤越来越⼴泛,许多公司都在将⼤模型能⼒渐渐接⼊到⾃⼰的产品中,在AI原⽣应⽤开发领域,⼤模型应⽤开发相关岗位也越来越多,会使⽤API集成⼤模型的能⼒,能让你在求职中更具竞争⼒,更好的适应⾏业的发展趋势。
- 学术研究有些考研的学⽣,研究的课题可能和⼈⼯智能相关,掌握API接⼊⼤模型技术后,可以为⾃⼰量⾝定制⼤模型应⽤以进⾏实验和数据分析,验证⾃⼰的研究假设。
因此,作为⼀名计算机专业的学⽣,或者将来从事计算机⽅向开发⼯作,学习通过API⽅式使⽤⼤模型是⾮常有价值的,不仅能帮助你更好地理解和使⽤⼤模型,还能给未来职业发展打下坚实基础。
五. 项⽬演⽰
本项⽬是带领⼤家从零⼿搓各种⼤模型接⼊的SDK,在此基础上,实现⼀个智能⽹⻚版的AI聊天助⼿。该应⽤⽬前⽀持以下功能:
- 获取会话列表
- 新建会话
- 获取⽀持模型
- 发送消息
- 获取指定会话的历史聊天记录
- 删除会话
【主界⾯】

【模型选择】

⽬前已接⼊DeepSeek、gpt-4o-mini、gemini-2.0-flash模型,以及deepseek-r1:1.5b的本地接⼊,学习之后同学们也可以接⼊其他更多模型。
【开始会话】

【本地接⼊DeepSeek】

六. 项⽬架构

系统架构图说明如下:
应⽤层:⽤⼾使⽤ChatSDK库来封装⾃⼰的应⽤层服务,⽐如实现智能聊天机器⼈ChatSDK:封装⼤模型管理库,包括⼤模型管理、Session管理以及数据存储。
- ⼤模型管理:负责管理并接⼊各种不同⼤模型,⽬前已接⼊deepseek-v3、gpt-4o-mini、gemini-2.0-flash等云端⼤模型;⽀持接⼊本地⼤模型,并向外提供统⼀接⼝,⽤⼾可以通过提供的接⼝接⼊⾃⼰需要⼤模型。
- 会话管理:⽀持会话管理,⽤⼾可以获取获取会话列表、历史消息等
- 数据存储层:⽀持会话记录的持久化存储,⽅便查看历史会话。
三⽅服务:对于接⼊的云端模型,最终由ChatSDK将⽤⼾消息转发给三⽅服务器,模型回复后将结果返回给应⽤层。对于本地部署⼤模型,ChatSDK会将⽤⼾消息发送给本地安装的Ollama服务器,由Ollama服务器和三⽅模型服务器对接,Ollama将模型的回复返回给ChatSDK,由ChatSDK将结果返回给应⽤层。
下⾯是本项⽬中使⽤的第三⽅库和⼯具:

七.AI知识科普
1. ⼈⼯智能概念
⼈⼯智能,即Artificial Intelligence,简称AI,是计算机科学的⼀个分⽀,旨在让计算机或机器能模仿⼈类的思维和⾏为,能看、能听、能说、能学习、能决策,从⼀个简单的命令执⾏者,变成⼀个可以感知、理解、推理、学习等服务与⼈类的"智慧"伙伴。
为了让机器具有⼈⼯智能的能⼒,需要先让机器看更多的资料去学习,⾃⼰总结规律,最后具备预测的能⼒。
⽐如想要教计算机智能地识别狗。



可以按照下⾯步骤来:
- ⼈⼯提取特征:你需要像⼀个⽼师⼀样,先告诉机器,"要看⼀只狗,你主要检查是否有⼀个湿润的、突出的⿊⾊或棕⾊的⿐⼦、⽿朵的形状和位置、尾巴的⻓度和姿态(翘起、摇摆、卷起)、有没有胡须、眼睛的形状、⽑发的⻓度和纹理"等特征
- 选择模型:选择⼀个合适的机器学习模型
- 训练:把准备好的"狗"和"⾮狗"的图⽚喂给模型,每张图⽚都⽤定义好的特征(湿⿐⼦、胡须等)描述好
- 预测:模型学习后,看到新图⽚,就会去检查这些预设的特征,然后判断,如果符合狗的特征则就是狗。
上⾯的⽅式就是机器学习,给模型看图⽚让它⾃⼰学。但有⼀定局限性,因为模型是基于⼈⼯提取的特征学习的,如果⼀张狗的图⽚是侧⾯的看不到胡须,或者⽿朵折起来了,机器可能就认不出来。

那如果不⽤⼈⼯提取特征,⽽是:
- 端到端学习:把最原始的像素数据(即图⽚本⾝)和标签("这是狗"、"这不是狗")直接扔给⼀个叫做神经⽹络模型
- ⾃动提取特征:神经⽹络结构⾮常复杂,有很多层(深度),它会⾃⼰从像素中,由低到⾼、由抽象到具体地⾃动学习出狗的特征:
底层:选学会认识⼀些边缘、⻆落、颜⾊
中层:组合底层特征,学会识别纹理、形状、眼睛、⽿朵
⾼层:结合中层特征,最终形成"狗脸"、"狗的⾝体"等抽象概念
- 预测:训练好后,它看到新的图⽚,就会动⽤⾃⼰学到的这⼀套从简单到复杂的特征(层级体系)来进⾏判断
这个就是深度学习。对于侧⾯、遮挡、奇怪姿势的狗,深度学习模型因为它⾃⼰学习的特征更丰富、更本质,所以识别能⼒通常远强于传统机器学习⽅法。
所以,想要让机器像⼈⼀样去识别狗的图⽚,可以通过看海量图⽚学习,即机器学习,⽽完成这个任务最有效的⽅式就是深度学习。现在⼤家所看到的酷炫的AI应⽤,⽐如⼈脸识别、语⾳助⼿、⾃动驾驶等,背后都是AI--->ML-->DL的技术在发挥作⽤。
因此⼀个机器,如果学习⼤量的数据之后,具备推理预测能⼒时,我们就可以认为该机器具备⼈⼯智能的能⼒。
⽽现在ChatGPT、DeepSeek等,都是基于Transformer架构的神经⽹络模型,投喂海量的数据(⽹⻚、书籍、⽂章)等供模型学习,让模型构建⾃⼰的知识库,并具备思考、推理、决策能⼒,最终成为现在ChatGPT、DeepSeek等⼈⼯智能⼤语⾔模型产品。

最左边是输入,最右边是输出,中间经过很复杂的AI信息处理给你想要的结果,就是你直接看的答案
2. ⼈⼯智能发展史
在更早的时期,在⼈类的想象和对机器的向往中,已经埋下了⼈⼯智能的影⼦和思想萌芽。⽐如战国时期《列⼦汤问》中就收录了⼀⽚⽂章《偃师献技》
偃师带来了⼀个他制造的“倡者”(即歌舞艺⼈)。这个假⼈能够⾃如地唱歌跳舞,动作姿态与真⼈⽆异。甚⾄在对周穆王的妃⼦眉⽬传情时,惹得穆王⼤怒,认为偃师⽤真⼈欺骗他。偃师为了证明,⽴刻将这个假⼈拆解,展⽰其内部完全是由⽪⾰、⽊头、胶漆、以及⿊、⽩、丹、⻘等颜料构成的机关⼈偶。周穆王这才惊叹道:“⼈之巧乃可与造化者同功乎?”

- AI兴起(1941 - 1956):⼈⼯智能诞⽣
- 1936年:阿兰·图灵(Alan Turing)发表了《论可计算数及其在判定问题中的应⽤》,为⼈⼯智能的理论基础奠定了重要⼀步。
- 1943年,神经学家沃伦·⻨卡洛克和数学家沃尔特·⽪茨在1943年提出了⼈⼯神经元模型,⽤数学⽅法模拟⽣物神经元⽹络,证明简单的神经⽹络可以实现基本的逻辑功能

假设你现在是⼀名⼤⼆或⼤三的学⽣,已经将⽐特⼀个⽅向的课程系统学完,并做出⼀两个项⽬,
⽼师推你找实习,⽽你感觉⾃⼰没有复习好,知识点忘记了,在犹豫是否要找实习。假设将催同学
找实习的事情交给⼈⼯神经⽹络模型决策,那就需要先输⼊给模型⼀些信号(X)和权重(W),⽐如:
i. x1 = 知识储备现状:同学学完【C语⾔ + 数据结构 + C++ + 操作系统 + ⽹络 + 数据库,且还做过⼩项⽬权重w1 = +7,极强正权重,因为这些技能是企业所需要的,能够找实习的资本
ii. x2 = 实习经历:同学找实习欲望不⾼,但实习经历⾮常重要
权重w2 = +8,实习经历企业⾮常认可,尤其是⼤⼚实习经历,能⼤⼤提⾼简历通过率
iii. x3 = 时间窗⼝优势:⼤⼆或⼤三,正是找暑期实习的⻩⾦阶段
权重w3 = +9,暑期实习表现好很容易转正,直接解决就业,避免挤秋招
iv. x4 = ⾃我怀疑、惰性拖延阻⼒:感觉⾃⼰没有复习好,知识点忘记
权重w4 = -5,拖延是⾏动最⼤的敌⼈,知识点忘记是正常的,⽽通过⾯试检测⾃⼰成⻓是
⾮常快激活函数阈值设定为15。将所有输⼊权值求和后,总分超过15,这个神经元就被激活,输出去找实习的决定
⼈⼯神经元模型的核⼼部分
- 输⼊:就像树突,接收来⾃外界或其他神经元的信息
- 权重:每个输⼊都有⼀个权重,代表这个输⼊的重要程度。学习的过程,主要就是调整这些权重⼤⼩的过程。
- 求和:把每个输⼊对应权值全部加起来
- 激活函数:检查求和后的总值是否超过某个"阈值",超过就产⽣响应;否则就不响应,以实现"开关"特性。
- 输出:就向轴突,将决策结果(0或1)传递出去,给下⼀个神经元
这个模型成为了后来所有⼈⼯神经⽹络和深度学习的基⽯
1950年,艾伦图灵在其《计算机与智能》论⽂中提出注明的"图灵测试"
场景设置:有⼀个测试者(⼈类),和两个被测试对象,其中⼀个被测试对象是真⼈,另⼀个是⼀
个计算机程序(AI)。这两个对象在⼀个看不⻅的房间⾥,测试者测试者只能通过电脑屏幕与
他们⽤⽂字交流。
- 游戏⽬标:测试者的任务就是通过⼀系列提问和对话,最终判断出哪个是真的⼈,哪个是机器。
- 获胜条件:如果测试者经常错误地将机器判断为⼈,或者说机器成功“欺骗”了测试者,那么我们就说这台机器通过了图灵测试

⽐如:你向两个房间提问1234567 + 7654321 等于多少?
A房间会话你:等于8888888
B房间回答你:我现在不想算
你现在能区分清那个房间时机器,哪个房间时真⼈吗?
如果⽆法区分,那这台机器就通过了图灵测试。图灵的想法很实⽤:别管它内部是怎么运作的,只要它的⾏为表现得和⼈⼀样智能,我们就当它是智能的。
1956年图灵的这篇⽂章以“机器能够思考吗?”为题重新发表
1956年,在美国达特茅斯学院汇聚了那个时代最聪明的⼀批⼈,他们坐在⼀起开了个会,会议主题是"试图让机器精确模拟学习或其他智能⾏为",该次会议也被称作"AI的宪法会议",约翰·⻨卡锡⾸次提出"⼈⼯智能"⼀词。

AI早期成功(1956 - 1974)
- 1959年,亚瑟·塞缪尔开发了⾸个⾃学习程序-西洋跳棋程序,并引⼊了“机器学习”这⼀概念

- 1966年,约瑟夫·魏岑保姆开发了⼀个能⼒处理⾃然语⾔的聊天程序ELIZA,据说是第⼀个能够尝试图灵测试的程序,展⽰了机器和⼈类⾃然语⾔交流的可能性。

号称⼼理治疗师,⽐如:
你说:我很烦恼
ELIZA:你会经常烦恼吗?
ELIZA⽤程序的⽅式模拟提问,形成⼀种⼼理咨询的效果,其实就是模式匹配,号称⼼理治疗师。
虽然简单,但是给⼈感觉机器很懂我。
- 1970年,第⼀个拟⼈机器⼈WABOT-1在⽇本早稻⽥⼤学建成。它由⼀个肢体控制系统、视觉系统和⼀个对话系统组成。

⾸次将视觉、触觉、移动和对话能⼒整合到⼀个拟⼈化的平台上。它确⽴了“⼈形机器⼈”作为⼀个综合性研究领域的地位
- AI第⼀次寒冬:神经⽹络预冷,研究经费减少(1974 - 1980)
上世纪60年代末到70年代初,⼈⼯智能开始从⾼峰⾛向低估,因为早起雄⼼勃勃的AI项⽬没有兑现,政府和资⽅对AI的耐⼼逐渐耗尽,⼤笔研究经费被削减甚⾄叫停:
• 机器翻译碰壁
• ⼤西洋彼岸质疑
• 军⽅撤资
• 学术批评
上述原因交织在⼀起,导致70年代中期AI研究陷⼊停滞,AI项⽬被砍,研究经费锐减,年轻⼈才专项爱过你别的领域,只有少数学者在坚守阵地。
- AI复兴与第⼆次寒冬(1980 - 1993)
AI领域出现复苏的迹象主要是由于:
• 专家系统在⼯业界的成功应⽤
• 机器学习思想兴起

专家系统就是模拟⼈类专家决策的计算机系统,它把专家的知识和经验编程规则存进电脑⾥,然后向专家⼀样分析问题并给出建议。
专家系统的核⼼组成:
• 知识库:类似专家的⼤脑,⾥⾯存储了许多"如果-那么"的规则和专业知识
• 推理机:类似专家的思维过程。它负责提问、根据⽤⼾回答去知识库查找匹配规则,进⾏逻辑推理并得出答案
• ⽤⼾界⾯:和系统对话的窗⼝
但好景不⻓专家系统的局限性逐渐暴露,他们的开发和维护成本⾼,需要专家不断提供规则,⽆法⾃动学习新知识;其次系统脆弱,⼀旦遇到超出规则范围的情况可能犯荒唐的错误。
随着微型计算机性能提升,性能逐渐超越运⾏专家系统的AI⼯作站,⼤量AI创业公司在短时间内破产或被收购,兔⼦⼈兴趣转移,到1993年前后超过300加AI公司关⻔,迎来了AI的第⼆次寒冬。
庆幸的是AI技术并未⽌步不前,⽽在其他领域悄然发展,⽐如:数据挖掘、⼯业机器⼈、语⾳识别、搜索引擎都在90年代获得突破性进展。
1991年,互联⽹的出现使在线连接和数据共享成为可能,⽆论你是谁,⽆论你在哪⾥。由于数据是⼈⼯智能的燃料,这在以后将被理解为⼈⼯智能的⼀个关键时刻
- AI崛起:深度学习理论和⼯程突破(1993年⾄今)
1997年,IBM的深蓝(Deep Blue)战胜了国际象棋冠军卡斯帕罗夫,成为⾸个在标准⽐赛时限内击
败国际象棋世界冠军的电脑系统。

- 2000年,⿇省理⼯学院的⾟西娅-布雷泽尔开发了Kismet,⼀种能够识别并模拟⼈类情绪的机器⼈。
- 2006年,杰弗⾥·⾟顿等⼈发表重要论⽂《Reducing the dimensionality of data with neuralnetworks(⽤神经⽹络降低数据维数)》,提出了深度置信⽹络(Deep Belief Network),为深度学习的发展奠定了基础。杰弗⾥·⾟顿也被称为深度学习教⽗。

- 2006年,英伟达推出CUDA(统⼀计算架构),GPU开始⽤于解决商业、⼯业以及科学⽅⾯的复杂计算,GPU与深度学习结合,模型的训练速度有了数量级的提升

- CPU(中央处理器):像是⼀个博学的⽼教授。他⾮常聪明,什么复杂任务都能处理,⽐如操作系统、办公软件,但⼀次只能处理⼀两件事(核⼼数少)。让他去数⼀亿粒⽶,他会数得很精确,但速度⾮常慢。
- GPU(图形处理器):最初是为游戏和图形渲染设计的。它像是⼀万名⼩学⽣。每个⼩学⽣都不如⽼教授聪明,只能执⾏⾮常简单的指令(⽐如算术题)。但让他们同时去数⼀亿粒⽶,每⼈分⼀点,瞬间就数完了
AI计算(尤其是深度学习)的本质是什么?
就是海量的、⾼度重复的矩阵乘法和加法。⽐如,识别⼀张猫的图⽚,需要将数百万个像素值与神
经⽹络中数百万个参数进⾏乘法和加法运算。这个过程不需要⼀个"⽼教授"去深度思考,恰恰需
要"⼀万名⼩学⽣"同时进⾏简单的计算。GPU的并⾏计算架构完美匹配了AI计算的需求。
更重要的是英伟达还发明了CUDA(Computer Unified Device Architecture,统⼀计算机架构),构
建了⼀整个AI⽣态系统。CUDA是⼀个软件平台,它允许程序员和研究⼈员⽤熟悉的编程语⾔(如
C++、Python)直接调⽤GPU的强⼤算⼒来进⾏通⽤计算。
今天所有震撼世界的AI产品,如ChatGPT、Sora等,它们的训练和运⾏都完全依赖与数万甚⾄数⼗万颗GPU组成的超级计算机,没有这个算⼒基础,当前的⼤模型就不可能存在。英伟达是AI时代
的“卖铲⼈”。当全世界都在疯狂淘⾦(开发AI)时,英伟达提供了最好⽤、⼏乎是唯⼀的“铲
⼦”(GPU+CUDA),从⽽成为了整个浪潮中最⼤的赢家之⼀。
- 2012年,⾕歌"Google Brain"项⽬的研究⼈员吴恩达、杰夫·迪恩等⼈,也捣⿎了⼀个神经⽹络(10亿参数),⽤来训练对猫的识别。他们⽤16000个CPU核⼼构建了⼀个巨⼤的神经⽹络,在没有任何先验知识的情况下,仅仅通过观看YouTube视频,就⾃发地识别出了“猫”。这个实验让⼯业界第⼀次⼤规模地看到了深度学习的惊⼈潜⼒。
- 2015年,Google Brain团队正式发布TensorFlow机器学习框架,提供了⼀整套⽤⼾构建和训练机器学习模型的⼯具、库和社区资源,由于其通⽤性和强⼤功能,被⼴泛应⽤于计算机视觉、⾃然语⾔处理、语⾳处理、推荐系统等。TensorFlow作为基础⼯具基⽯,其应⽤领域⼏乎涵盖了AI的⽅⽅⾯⾯。2017年,Google AI团队在论⽂《Attention Is All You Need》中⾸次提供了Transformer模型架构,论⽂发布后其参考实现代码⻚随之公开,并迅速被纳⼊TensorFlow、PyTorch等框架的官⽅库和教程中。Transformer 的诞⽣,为后续⼏乎所有⼤型语⾔模型提供了最基础也最关键的架构蓝图。现在DeepSeek、ChatGPT、Gemini基本都是基于Transformer实现的。AlphaGo战胜⼈类顶尖围棋选⼿
- 2022年11⽉30⽇,ChatGPT发布,彻底突破科技圈,它提供了⼀个及其简单、⾃然、免费的聊天界⾯,任何⼈⽆需技术背景,都能直接与其互动。它能写诗、写代码、解数学题、编故事,回答各种问题,震惊了⽆数⼈。⽤⼾们开始在各种社交平台,病毒式分享⾃⼰与ChatGPT对话的惊⼈截图,短短5天内,ChatGPT的⽤⼾就图⽚100万。此后,各⼤科技公司(Google、微软、Meta、亚⻢逊以及中国的百度、阿⾥、深度求索等)全部加速⼊场,发布了各⾃的竞品(如Gemini、Claude、LLaMA、⽂⼼⼀⾔、通义千问、DeepSeek等),将这场热潮持续推⾼,形成了今天我们看到的“百模⼤战”格局。
3. AI相关岗位


适合绝⼤学⽣的AI开发岗位基本是AI应⽤开发。
4. 程序员是否会被ai取代
同学们平时在看新闻或刷视频时应该会看到,⼀些博主在视频中演⽰说:
- 某款AI编程IDE写代码⾮常丝滑,⾃⼰⼀⾏代码不写就完成了某个应⽤
- 不懂任何代码,通过向AI输⼊提⽰词,完成某个应⽤
- AI替代程序员真的要来了,公司20%的代码已由AI⽣成,公司计划裁员...
- AI来了,程序员天踏了;AI当⽴、编程已死...
看到这些帖⼦或视频之后,不知道同学们是否感觉:还没有毕业,就感觉失业了,渐渐就开始摆烂了
【DeepSeek认为】

【ChatGPT认为】

【Gemini认为】


中国科普⽹的⼀⽚⽂章:http://www.kepu.gov.cn/newspaper/2024-03/15/content_183874.html

以后得事情谁也不好说,先顾好眼前少点焦虑:打得过就⼤,打不过就加⼊,你可能就业的不是AI相关领域,但是你不能不懂AI相关技术。
更多推荐
所有评论(0)