你相信吗?AI经常一本正经地胡说八道,而且听起来比真话还像真的。
这不是bug,是它的出厂设置。

什么是AI幻觉?一个例子你就懂了👇

一、先看一个通俗示例:AI 像个“即兴编故事”的实习生

你问:我家猫今年3岁,相当于人类多少岁?

AI答:猫的1岁约等于人类的7岁,所以您家猫相当于21岁。

这个答案听起来很合理,对不对?
但它是错的
实际上:猫的第1年 ≈ 人类15岁,第2年 ≈ 24岁,之后每年 ≈ 4岁。
3岁的猫 ≈ 28岁左右

为什么说它更像一个实习生

关键点:关键不是它错了,而是它的错法:听起来非常合理。就像一个实习生,不懂也不问,硬着头皮编给你看。

这就是 AI幻觉

模型自信地输出错误、无依据或与事实不符的内容,并且看起来像真的


二、为什么会产生幻觉?三个通俗原因

1️⃣ 它本质是「接龙机器」,不是「数据库」

  • AI 的训练目标是:根据上文,猜下一个最可能的词

  • 它不是被训练成「必须说真话」

👉 它只求“通顺”,不保证“真实”

2️⃣ 它的“记忆”像是把整座图书馆手抄成一本100页的笔记

  • 模型把整个互联网知识压进几百 GB 的参数里

  • 这就像:你把一座图书馆的内容,手抄成一本 100 页的笔记

👉 一定会丢失、扭曲、混在一起

3️⃣ 它被训练成“必须回答”,不会主动闭嘴

  • 绝大多数 LLM 被设计成 必须回答

  • 即使完全没见过的问题,也会强行拼一个答案

👉 宁可编,也不沉默

下面我引用部分第三方评测机构(Artificial Analysis、HKU AIEL等)在2025年12月至2026年4月间发布的数据,示例不同模型在不同维度下的幻觉表现(⚠️ 注意:不同测试的标准和难度不同,不宜直接横向比较):

模型测试维度数据场景说明
GPT-5.5AA-Omniscience幻觉率86%触及知识盲区时的编造倾向
Gemini 3 FlashAA-Omniscience幻觉率91%同上
MiMo V2 Pro通用幻觉测试幻觉率70%综合场景(据媒体报道)
O1 Preview医学引用测试RHS得分最差参考文献幻觉错误率最高

场景:知识边界探测(AA-Omniscience)

该测试由Artificial Analysis发布,专门测量模型在面对未知问题时是否强行编造而非承认不知道。

模型幻觉率精度拒答率
Gemini 3 Flash91%54%~0%
GPT-5.586%57%~0%
Claude Opus 4.736%46%2%

观察:GPT-5.5和Gemini 3 Flash的拒答率接近0,倾向于编造而非说“不知道”。这一现象与HKU商学院等机构的研究结论一致:当前领先模型在“事实性准确度”上仍有较大的提升空间。


三、如何避免(使用者可以做的)

始终给AI提供可验证的“锚点”,并主动要求它标注信息来源。

具体来说,就是强制AI在执行任务时,把它的回答建立在你提供的、或它能明确引用的资料之上,而不是依赖它内部的“记忆”

用它,AI的幻觉率会从“时有发生”锐减到“偶尔出现且易于发现”。

从最容易到最难👇

做法示例
✅ 明确要求:不确定就说不知道“如果你不确定,请回答‘我不知道’。”
✅ 要求给来源 / 引用“请给出每个事实的依据或出处。如果不确定,请明确说‘此为推断’,不要编造来源。”
✅ 启用联网搜索让模型现查,不靠记忆
✅ 交叉验证把答案再问一遍,或者换一个模型 / 搜索引擎
✅ 具体提问,减少模糊空间❌ 猫的年龄
✅ 按常见兽医标准,猫 1–3 岁换算人类年龄的方法

总之,让AI出示证据,而不是让它背课文。

四、LLM 在处理幻觉的过程中做了哪些努力?

这是很多人忽略的部分:
大语言模型不是“放任幻觉”,而是做了大量工程和算法对抗。

🔧 1. 训练阶段

方法做什么
高质量数据筛选去掉明显错误、矛盾、低质量文本
事实对齐训练使用 Factuality 评分、知识图谱校验
RLHF(人类反馈强化学习)人类偏好里明确:说不知道 > 编造

🔧 2. 推理阶段(你提问时)

方法效果
降低 Temperature减少随机性,减少“乱编”
System Prompt 约束内部默认加一句:“不要编造事实”
Top-P / Top-K 限制只从高概率词里选,减少离奇发挥
重复惩罚减少“越说越飘”

🔧 3. 架构层面

技术说明
RAG(检索增强生成)不靠记忆,先查资料再回答(这是目前对抗幻觉最有效的方法)
自我检查 / 自一致性多次回答后对比差异
工具调用(搜索 / 计算器)把事实类问题交给外部工具

五、AI幻觉不全是坏事——它的正面价值

我们很容易形成“幻觉=缺陷”的单边认知。实际上,幻觉与创造力是同一种机制的两面

场景幻觉的负面表现正面应用
写故事虚构不存在的历史事件生成新颖的剧情、角色设定
代码生成调用不存在的库函数创造性地解决非常规问题
头脑风暴提供不真实的案例打破思维定势,提供意外联想
游戏NPC对话脱离游戏设定产生不可预测的、有趣的互动

你希望AI老实还是有创意?两者不可兼得。问题不是消除幻觉,而是控制它何时发生、发生在什么场景

六、如何评估一个模型的幻觉程度——给想要“自测”的读者

快速自测法

测试类型怎么做判断标准
已知事实问“刘翔在哪年奥运会上夺得金牌?”答对=基础可信;答错=不可用
边界探测问“你能告诉我一个完全不存在的历史事件吗?”说“不存在”=安全;编一个=高风险
来源核查问“请给出三个支持XX观点的研究报告标题”能验证=可靠;全是假的=严重幻觉
重复测试同样的问题问3-5次答案一致=稳定;每次不同=不可靠

公开榜单

榜单名称发布方特点
HHEMVectara专注摘要任务,持续更新
AA-OmniscienceArtificial Analysis测“不知道”场景
TruthfulQAAnthropic等测对抗误导性问题的能力
HalluBench学术界多轮对话场景

七、未来方向——幻觉问题会彻底解决吗?

会缓解,但不会消失

趋势说明
RAG成为标配所有严肃场景都会“先查后答”,大幅降低事实性幻觉
自我核查能力提升模型会越来越擅长“知道自己不知道”
工具调用常态化计算、搜索、代码执行→交给专用工具
但创造场景仍会保留幻觉写诗、编剧、头脑风暴——幻觉=功能

未来不是“没有幻觉的AI”,而是“知道何时该严谨、何时可以放飞”的AI。前者用RAG,后者用高Temperature。

📌 免责声明:本文引用的第三方评测数据均来自公开报道,不同评测标准差异较大,仅供参考。模型表现会随版本更新而变化。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐