AI 比你想象的更会撒谎:关于“AI 幻觉”,你所知的一切可能都是错的
你相信吗?AI经常一本正经地胡说八道,而且听起来比真话还像真的。
这不是bug,是它的出厂设置。
什么是AI幻觉?一个例子你就懂了👇
一、先看一个通俗示例:AI 像个“即兴编故事”的实习生
你问:我家猫今年3岁,相当于人类多少岁?
AI答:猫的1岁约等于人类的7岁,所以您家猫相当于21岁。
这个答案听起来很合理,对不对?
但它是错的。
实际上:猫的第1年 ≈ 人类15岁,第2年 ≈ 24岁,之后每年 ≈ 4岁。
3岁的猫 ≈ 28岁左右。
为什么说它更像一个实习生
关键点:关键不是它错了,而是它的错法:听起来非常合理。就像一个实习生,不懂也不问,硬着头皮编给你看。
这就是 AI幻觉:
模型自信地输出错误、无依据或与事实不符的内容,并且看起来像真的
二、为什么会产生幻觉?三个通俗原因
1️⃣ 它本质是「接龙机器」,不是「数据库」
-
AI 的训练目标是:根据上文,猜下一个最可能的词
-
它不是被训练成「必须说真话」
👉 它只求“通顺”,不保证“真实”
2️⃣ 它的“记忆”像是把整座图书馆手抄成一本100页的笔记
-
模型把整个互联网知识压进几百 GB 的参数里
-
这就像:你把一座图书馆的内容,手抄成一本 100 页的笔记
👉 一定会丢失、扭曲、混在一起
3️⃣ 它被训练成“必须回答”,不会主动闭嘴
-
绝大多数 LLM 被设计成 必须回答
-
即使完全没见过的问题,也会强行拼一个答案
👉 宁可编,也不沉默
下面我引用部分第三方评测机构(Artificial Analysis、HKU AIEL等)在2025年12月至2026年4月间发布的数据,示例不同模型在不同维度下的幻觉表现(⚠️ 注意:不同测试的标准和难度不同,不宜直接横向比较):
| 模型 | 测试维度 | 数据 | 场景说明 |
|---|---|---|---|
| GPT-5.5 | AA-Omniscience | 幻觉率86% | 触及知识盲区时的编造倾向 |
| Gemini 3 Flash | AA-Omniscience | 幻觉率91% | 同上 |
| MiMo V2 Pro | 通用幻觉测试 | 幻觉率70% | 综合场景(据媒体报道) |
| O1 Preview | 医学引用测试 | RHS得分最差 | 参考文献幻觉错误率最高 |
场景:知识边界探测(AA-Omniscience)
该测试由Artificial Analysis发布,专门测量模型在面对未知问题时是否强行编造而非承认不知道。
| 模型 | 幻觉率 | 精度 | 拒答率 |
|---|---|---|---|
| Gemini 3 Flash | 91% | 54% | ~0% |
| GPT-5.5 | 86% | 57% | ~0% |
| Claude Opus 4.7 | 36% | 46% | 2% |
观察:GPT-5.5和Gemini 3 Flash的拒答率接近0,倾向于编造而非说“不知道”。这一现象与HKU商学院等机构的研究结论一致:当前领先模型在“事实性准确度”上仍有较大的提升空间。
三、如何避免(使用者可以做的)
始终给AI提供可验证的“锚点”,并主动要求它标注信息来源。
具体来说,就是强制AI在执行任务时,把它的回答建立在你提供的、或它能明确引用的资料之上,而不是依赖它内部的“记忆”。
用它,AI的幻觉率会从“时有发生”锐减到“偶尔出现且易于发现”。
从最容易到最难👇
| 做法 | 示例 |
|---|---|
| ✅ 明确要求:不确定就说不知道 | “如果你不确定,请回答‘我不知道’。” |
| ✅ 要求给来源 / 引用 | “请给出每个事实的依据或出处。如果不确定,请明确说‘此为推断’,不要编造来源。” |
| ✅ 启用联网搜索 | 让模型现查,不靠记忆 |
| ✅ 交叉验证 | 把答案再问一遍,或者换一个模型 / 搜索引擎 |
| ✅ 具体提问,减少模糊空间 | ❌ 猫的年龄 ✅ 按常见兽医标准,猫 1–3 岁换算人类年龄的方法 |
总之,让AI出示证据,而不是让它背课文。
四、LLM 在处理幻觉的过程中做了哪些努力?
这是很多人忽略的部分:
大语言模型不是“放任幻觉”,而是做了大量工程和算法对抗。
🔧 1. 训练阶段
| 方法 | 做什么 |
|---|---|
| 高质量数据筛选 | 去掉明显错误、矛盾、低质量文本 |
| 事实对齐训练 | 使用 Factuality 评分、知识图谱校验 |
| RLHF(人类反馈强化学习) | 人类偏好里明确:说不知道 > 编造 |
🔧 2. 推理阶段(你提问时)
| 方法 | 效果 |
|---|---|
| 降低 Temperature | 减少随机性,减少“乱编” |
| System Prompt 约束 | 内部默认加一句:“不要编造事实” |
| Top-P / Top-K 限制 | 只从高概率词里选,减少离奇发挥 |
| 重复惩罚 | 减少“越说越飘” |
🔧 3. 架构层面
| 技术 | 说明 |
|---|---|
| RAG(检索增强生成) | 不靠记忆,先查资料再回答(这是目前对抗幻觉最有效的方法) |
| 自我检查 / 自一致性 | 多次回答后对比差异 |
| 工具调用(搜索 / 计算器) | 把事实类问题交给外部工具 |
五、AI幻觉不全是坏事——它的正面价值
我们很容易形成“幻觉=缺陷”的单边认知。实际上,幻觉与创造力是同一种机制的两面。
| 场景 | 幻觉的负面表现 | 正面应用 |
|---|---|---|
| 写故事 | 虚构不存在的历史事件 | 生成新颖的剧情、角色设定 |
| 代码生成 | 调用不存在的库函数 | 创造性地解决非常规问题 |
| 头脑风暴 | 提供不真实的案例 | 打破思维定势,提供意外联想 |
| 游戏NPC | 对话脱离游戏设定 | 产生不可预测的、有趣的互动 |
你希望AI老实还是有创意?两者不可兼得。问题不是消除幻觉,而是控制它何时发生、发生在什么场景
六、如何评估一个模型的幻觉程度——给想要“自测”的读者
快速自测法
| 测试类型 | 怎么做 | 判断标准 |
|---|---|---|
| 已知事实 | 问“刘翔在哪年奥运会上夺得金牌?” | 答对=基础可信;答错=不可用 |
| 边界探测 | 问“你能告诉我一个完全不存在的历史事件吗?” | 说“不存在”=安全;编一个=高风险 |
| 来源核查 | 问“请给出三个支持XX观点的研究报告标题” | 能验证=可靠;全是假的=严重幻觉 |
| 重复测试 | 同样的问题问3-5次 | 答案一致=稳定;每次不同=不可靠 |
公开榜单
| 榜单名称 | 发布方 | 特点 |
|---|---|---|
| HHEM | Vectara | 专注摘要任务,持续更新 |
| AA-Omniscience | Artificial Analysis | 测“不知道”场景 |
| TruthfulQA | Anthropic等 | 测对抗误导性问题的能力 |
| HalluBench | 学术界 | 多轮对话场景 |
七、未来方向——幻觉问题会彻底解决吗?
会缓解,但不会消失
| 趋势 | 说明 |
|---|---|
| RAG成为标配 | 所有严肃场景都会“先查后答”,大幅降低事实性幻觉 |
| 自我核查能力提升 | 模型会越来越擅长“知道自己不知道” |
| 工具调用常态化 | 计算、搜索、代码执行→交给专用工具 |
| 但创造场景仍会保留幻觉 | 写诗、编剧、头脑风暴——幻觉=功能 |
未来不是“没有幻觉的AI”,而是“知道何时该严谨、何时可以放飞”的AI。前者用RAG,后者用高Temperature。
📌 免责声明:本文引用的第三方评测数据均来自公开报道,不同评测标准差异较大,仅供参考。模型表现会随版本更新而变化。
更多推荐


所有评论(0)