大语言模型的核心工作原理是下一词元预测(Next-Token Prediction)。模型在海量文本上通过自监督学习,掌握的是词语、短语和句式之间的统计关联性,而不是真实世界的因果逻辑或事实知识。它从海量文本里学到"苹果"常常和"红""甜""脆"等词语一起出现,于是能流畅说出"红苹果口感甜脆"——它不是懂,只是说得像懂。当面对冷门、专业或训练数据稀缺的问题时,模型为了维持语言的流畅性和连贯性,会在概率分布中选择"看似最合理"的路径,即使这条路径是虚构的。
语言模型的设计初衷是在语言序列中做出好的概率预测,而非输出事实真相。用户希望得到准确信息,模型却只会产出"听起来对"的内容。2025 年 OpenAI 与佐治亚理工学院合作的研究从数学层面证明,语言模型的生成错误率至少是分类错误率的两倍——如果模型在判断答案是否正确时已有较高出错率,那么让它直接生成答案时,错误风险会进一步放大,这个底线即使训练数据完全正确也无法抹掉。
训练数据本身混有错误信息、过时说法和谣言。模型在吸收这些数据时,没有足够的能力把"对的"和"错的"剥离开,结果就把学到的偏见和虚假信息一并写进了回答。此外还存在恶意"数据投毒"行为——通过在网上系统性地投放大量虚假信息"喂"给大模型,进而操控大模型输出答案。
大模型被强制要求必须有回应,而训练过程的缺陷导致 AI 存在讨好用户的倾向。如果预设的问题是错的,AI 不会认为是用户出错,而是生成迎合用户需求的内容,并编造虚假的例证或看似科学的术语来支撑自己的假说。
模型编造不存在的事实、引用或数据。例如杜撰学术论文的参考文献、伪造历史事件的时间、捏造不存在的法律条文或司法案例。这类幻觉最具迷惑性,因为生成的内容往往包含看似权威的来源和精确的数字。
生成的文本与输入提示或上下文逻辑自相矛盾。例如前文说某公司成立于 2010 年,后文又称该公司有 20 年历史;或在同一回答中对同一个概念给出相互冲突的定义。
模型将不同来源的真实信息进行错误拼接。例如将新闻报道中的匿名当事人替换为现实中同名同姓的人,或将某个案例的情节嫁接到另一个完全不相关的主体上。
模型以极度笃定的语气呈现错误信息。MIT 研究发现,AI 模型在生成错误信息时使用自信语言的可能性比陈述事实时高出 34%——越错越自信,这是幻觉最危险的特征之一。
业界已建立多个专门针对幻觉的评测基准。SuperCLUE 中文大模型测评基准将"幻觉控制"作为六大核心维度之一,对主流模型进行量化评分。国际上的 TruthfulQA、HaluEval、HalluLens 等基准也从不同角度衡量模型的事实准确性。Vectara 的幻觉排行榜测试了 70 多个模型在 summarization 任务中的表现,幻觉率分布在 1.8% 到 23% 以上。
2024 年发表于 Nature 的语义熵方法通过在语义层面而非词元序列层面计算不确定性来检测幻觉。该方法的核心思路是:同一个意思可以用多种方式表达,如果多次采样生成的回答在语义上高度一致,说明模型对该答案较为确定;反之则可能存在幻觉风险。
通过多次独立采样生成不同回答,然后比较各回答之间的一致性程度。如果多次生成的答案差异很大,说明模型对该问题缺乏稳定认知,幻觉风险较高。这种方法无需访问模型内部参数,属于黑盒检测方案。
Expected Calibration Error(预期校准误差)已成为严肃评估中与准确率并列报告的核心指标。一个幻觉率 5% 但能恰当表达"我不确定"的模型,远比幻觉率 3% 却在每次回答中都同样自信的模型更有实用价值。
SelfCheckGPT 是一种零资源黑盒幻觉检测方案,通过生成多个采样输出来检测矛盾。其 NLI(自然语言推理)变体在非事实内容检测上的 AUC-PR 达到 92.50%,Prompt 变体(使用 GPT-3.5-turbo)更是达到 93.42%。该工具适合资源受限的边缘部署环境,可按场景选择不同精度的检测策略。
HaluCheck 是一套可解释、可验证的自动化幻觉检测系统,其核心组件 AutoFactNLI 能将回答分解为原子事实并逐一核查。实验表明 AutoFactNLI 的表现优于无指导的 LLM-as-a-Judge 方法。HaluCheck 还支持跨模型横向对比,便于企业在选型时评估不同模型的事实可靠性。
HaluScan 是 2026 年提出的系统性幻觉检测基准,测试发现 NLI 验证方法在幻觉检测上能达到 0.88 AUROC。该基准还引入了 HalluScore 指标,与人类评判的相关系数为 0.41,并提出自适应检测路由方法,可实现 2 倍的成本节省。
据相关研究报道,已有团队开发出仅 5M 参数的轻量化检测模型,能在数十毫秒内完成预测,显存占用极低,为实时拦截提供了可能。另有研究机构提出通过分析模型"隐藏状态"和"注意力模式"等内部信号来预测答案可靠性的方案,其原理类似医生查看心电图。
在临床诊断、用药建议、医学影像解读等场景中,幻觉可能导致误诊、错误用药甚至危及生命。斯坦福 RegLab 和 HAI 研究所发现,大模型在法律类查询上的幻觉率高达 69% 至 88%。接入 PubMed 数据库的医疗 AI 事实准确率可达 89%,而未接入外部知识库的模型幻觉风险显著更高。
AI 编造法律条文、伪造司法案例引用的现象已引发多起实际纠纷。2026 年全国首例 AI 幻觉侵权纠纷案正式宣判,标志着 AI 幻觉已从技术问题升级为法律问题。律师使用 AI 生成的虚假判例提交法庭已被多国法院处以制裁。
幻觉导致的财务数据错误可能引发重大投资损失。2026 年第一季度,因 AI 分析工具误报盈利预测,全行业避免了约 23 亿美元的可避免交易损失。AI 可能计算看似合理的每股收益,但其基础数据来自误读的申报文件。
AI 自动生成新闻时的幻觉会加速错误信息的传播。 fabricated statistics、虚构的专家引言和不存在的研究报告一旦被媒体采用,将在社交网络中快速扩散,造成广泛的社会误导。
据 Forrester Research 统计,2024 年全球企业因 AI 幻觉造成的经济损失达 674 亿美元,且随着 AI 采用率上升持续增长。Forrester 数据显示,企业员工平均每年花费 14,200 美元用于幻觉验证和缓解,每周花费 4.3 小时核对 AI 输出。
欧盟《人工智能法案》和中国《人工智能生成合成内容标识办法》等法规已对高风险 AI 应用提出明确要求。监管机构强调,AI 输出的责任由部署方承担,而非模型供应商。Deloitte 澳大利亚曾因 AI 生成的报告中包含伪造学术引用,向政府部分退款 29 万澳元。
Melbourne Business School 和 KPMG 对 47 个国家 48,000 人的研究显示,66% 的人不加验证地依赖 AI 输出,56% 的人因信任未经验证的 AI 输出而在工作中犯错。一旦客户发现企业提供的信息来自 AI 且存在错误,重建信任极为困难。
McKinsey 2025 年调研发现,仅有 5.5% 的企业能从 AI 中获得显著价值(定义为超过 5% 的 EBIT 来自 AI),这些高绩效企业与其余企业的核心区别在于建立了完善的验证体系。Cost Per Defensible Output(CPDO)这一新指标被提出,用于衡量产生可辩护输出的单位成本,无法回答此指标的 AI 项目实质上在缴纳"幻觉税"。
检索增强生成(Retrieval-Augmented Generation, RAG)通过为大语言模型动态注入外部知识,让 AI 回答前先检索权威资料,如同将"闭卷考试"变成"开卷考试"。RAG 的工作流程分为三步:索引阶段将外部知识库切分并向量化存储;检索阶段将问题转换为向量并在库中搜索相关片段;生成阶段将检索到的知识与原始问题一起送入模型生成基于事实的答案。
多项研究和生产数据表明,RAG 可将幻觉率降低 40% 至 71%。LinkedIn 的 RAG 系统将每个问题的中位解决时间缩短了 28.6%。一家银行客服聊天机器人通过战略性 RAG 实施,响应准确率从 25% 提升至 89%。在生物医学问答场景中,RAG 系统的准确率达到 86%,而基础模型单独使用仅为 58%。
RAG 组件本身也可能引入幻觉,包括检索质量不佳、上下文溢出、重排序偏差等问题。2026 年提出的 Trivia++ 长上下文 RAG 基准显示,现有检测器在长上下文场景下性能显著下降,LLM-as-a-Judge 方法在该基准上 F1 值为 0.694。
2026 年业界涌现出多种高级 RAG 架构:自适应检索根据问题复杂度动态决定检索策略,准确率提升 40%;图检索增强(Graph RAG)支持多跳推理,基于 GraphRAG 的改进方案在多文档问答准确率上从 72% 提升至 91%;全局感知 RAG 为长文档生成高层摘要指导检索;实时流式 RAG 实现知识库秒级同步。
思维链提示强制模型分步推理,减少逻辑漏洞。MIT 研究发现最优性能出现在模型生成 3 至 7 个 distinct 推理步骤时。微软研究院报告显示,7B 参数模型使用 Logic-RL 变体在 AIME 数学竞赛题上准确率提升 125%。但较小模型(低于 7B 参数)往往难以有效运用 CoT。
通过多次独立采样生成不同推理路径,选取出现频率最高的答案。这种方法在数学问题上带来 18% 的提升,在文字应用题上提升 11%。代价是延迟增加——使用 5 条推理路径会使 API 调用耗时增加约 3.2 倍。
CoVe 是一种系统化方法:模型先起草初始回答,再规划验证问题来核查草稿,然后独立回答问题以避免偏见,最终生成经过验证的回答。实验表明 CoVe 将 F1 分数提升了 23%(从 0.39 到 0.48),优于 Zero-Shot、Few-Shot 和 Chain-of-Thought 方法。
要求模型为每个事实性声明提供来源引用,并将输出限制为预定义的 JSON Schema 或枚举选项。引用约束的优势不仅在于提高准确性,更在于让用户可以逐条审计答案。结构化输出则将模型的生成空间限制在有效选项范围内,从根本上缩小幻觉的空间。
对于事实性任务,将 temperature 设为 0 或接近 0 可显著降低幻觉风险。生产环境的推荐配置是:抽取/分类任务用 temperature=0,带引用的 RAG 回答用 temperature=0.2,头脑风暴类创意任务才使用 temperature=0.9 等高值。
知识图谱通过"实体-关系-属性"的图结构,将离散知识组织为语义网络。与传统 RAG 的向量相似度检索不同,知识图谱提供确定性的结构约束——每个事实是一个节点,每个连接是一条边,每次查询返回的子图都可被验证。GraphRAG 将幻觉率进一步降低 62%,实体幻觉从 8.7% 降至 1.2%。
知识图谱原生支持多跳推理,能够回答需要链式推理的复杂问题。例如"2019 年收购 A 公司的企业,其母公司在 2021 年的主要投资对象是谁"这类问题,传统 RAG 需检索多段离散文本并手动拼接推理链,而 GraphRAG 可通过实体关系路径直接定位答案。在 HotpotQA 等多跳问答数据集上,GraphRAG 的准确率比传统 RAG 高 15% 至 20%。
牛津大学 2025 年提出的 MedGraphRAG 在 11 个医学数据集上达成 SOTA,事实一致性提升 8%。GraphRAG 的答案可追溯至图中的推理路径,便于来源归因与冲突消解。一项针对本体论支撑的知识图谱在临床问答中的研究显示,幻觉率低至 1.7%。
Microsoft GraphRAG 采用 Leiden 社区检测算法生成全局-社区-局部多层级摘要,实现"全局概览+局部细节"的联合检索。LightRAG 以轻量、快速为核心目标,将图结构信号嵌入文本索引与重排环节。企业级部署可采用三阶段路线图:第一阶段构建基础图谱并行运行向量 RAG,幻觉率 15% 至 20%;第二阶段切换至 GraphRAG 融合检索,幻觉率降至 5% 至 8%;第三阶段引入图算法增强校验,幻觉率可达 2% 至 3%。
清华大学等单位提出的多智能体辩论框架,让三个 AI 共同讨论问题,相互质疑、交叉验证,筛选出最可靠的结论。阿里 Qwen 应用业务团队与香港中文大学(深圳)联合提出的 MARCH 框架采用三智能体协作机制——解题者生成响应、分解者原子化拆解、检查者在"信息隔离舱"内盲审,通过多智能体强化学习联合优化,仅用文档训练的 8B 参数模型经 MARCH 优化后幻觉率大幅降低,达到与顶级闭源模型相当的水平。
多智能体系统中的对抗性辩论让不同角色的 AI(如"乐观派""悲观派""数据专家")围绕问题展开多轮讨论,互相挑刺暴露逻辑漏洞。哈工大和鹏城实验室的 PSRD 框架专门对付视觉幻觉,通过"侦查-投影"策略将 AI 描述中"无中生有"的物体比例从 46.3% 降至 10.1%。投票式方法让多个 AI 独立回答后采用多数决,利用群体的统计优势提升准确性。
模拟出版社"三审三校"流程,让 AI 依次扮演初审、复审、终审角色。据报道,达观数据在金融、能源等严苛场景下采用类似的评审式多智能体架构,将关键任务错误率控制在极低水平。阿里的通义千问上线"引证"功能后,对新闻、政策类问题逐字核对信源,可信内容标记为绿色,存疑内容标红提示,事实类问题的可信度显著提升。
多智能体并非万能。研究表明其性能提升很大程度上依赖于初始独立投票的统计优势,而非辩论过程中的自我修正。如果一群 AI 的"初始偏见"都一样,它们也可能在辩论中集体跑偏。此外,多智能体方案的计算成本显著高于单模型方案,需要在精度和效率之间权衡。
人类反馈强化学习(RLHF)通过让人类标注者比较模型输出对并选择更优者,训练奖励模型来预测人类偏好,再用 PPO 算法优化语言模型。对于幻觉减少,RLHF 有效是因为人类标注者通常偏好准确、校准良好的回答而非自信的胡编乱造。经过多轮训练迭代,模型学会编造信息会导致更低的奖励信号,而表达适当的不确定性会获得更高奖励。
OpenAI GPT-4 经 RLHF 训练后事实错误率降低 40%。研究显示 SafeAlign-LLM 框架在多领域部署中能显著降低幻觉率。Anthropic 的宪法 AI(Constitutional AI)将伦理原则嵌入模型,让其在生成后自我批评与修正,可大幅减少有害幻觉。
奖励黑客(Reward Hacking)是 RLHF 的已知问题——模型可能学会利用奖励模型的缺陷而非真正提高输出质量。如果奖励模型认为详细、自信的回答得分更高(因为人类标注者常将详尽程度与质量混淆),语言模型可能学会生成更自信的幻觉。此外,过度对齐可能导致模型变得过于保守,频繁拒绝回答本可正确回答的问题。
Direct Preference Optimization(DPO)将偏好学习重构为响应对的分类问题,消除了独立奖励模型和 PPO 训练的不稳定性。Factuality-aware DPO(F-DPO)于 2026 年 1 月发表,使用二元事实标签和标签翻转校正,在 7 个开源 LLM 上一致提升了事实性。SelectiveRM 框架通过最优传输理论让 RLHF 自动过滤错误偏好,在 MMLU-Pro 基准测试中实现了显著提升。
上下文腐烂(Context Rot)指随着输入上下文变长,LLM 在准确率、指令遵循和引用忠实度上逐渐下降的现象。来自 Chroma、Anthropic 和 Databricks 的评测一致显示,同一模型在相同任务上准确率从 8K 时的 95% 跌到 64K 时的约 60%。Google 官方技术文件披露,同一模型在 MRCR 测试中,128K 上下文得分 84.9%,而 1M 上下文骤降至 26.3%。
斯坦福研究证实 LLM 对上下文的注意力呈 U 形曲线——开头和结尾的信息获得 70% 至 75% 的准确率,而中间部分跌至 55% 至 60%。在 20 份文档的多文档问答中,当相关文档位于第 5 至 15 位时,准确率比位于第 1 或第 20 位时下降超过 30%。这意味着防止幻觉的关键事实如果恰好位于长提示的中间位置,模型可能实际上"看不到"它。
Transformer 自注意力的计算量随序列长度呈二次方增长。在 10K token 时模型追踪 1 亿对关系,100K 时增至 100 亿,1M 时高达 1 万亿。Softmax 注意力在所有 token 间归一化权重,随着分母增大,每个 token 获得的注意力成比例减少。10 倍上下文增长意味着每个 token 的注意力减少 10 倍——这不是模型"忽略"了代码,而是在物理上无法同等强度地关注它。
Chroma 的研究分离出第三种机制——干扰物干扰。添加语义相似但不相关的内容造成的退化超出上下文长度本身的解释。与查询主题相关但事实上无关的干扰物在幻觉回答中出现频率最高。代码搜索是最坏情况:当编码 agent 搜索 webhook 处理器时,上下文中充斥着测试夹具、废弃实现、模拟对象和命名相似的函数,每一个都语义接近但事实无关。
一般来说,较大规模的模型在事实回忆任务上的幻觉率低于较小模型,尽管随着训练技术的改进这一差距正在收窄。更大模型拥有更多参数来编码训练数据中的事实信息,对罕见知识的记忆也更稳定。然而这种优势并非线性——模型规模翻倍并不等同于幻觉率减半。
反直觉的发现是,更强的推理模型在某些任务上反而幻觉更多。Vectara 排行榜数据显示,Claude Sonnet 4 幻觉率为 10.3%,GPT-5.2 为 10.8%,而 o3-pro 高达 23.3%,相比之下简单的 Gemini 2.5 Flash Lite 仅 3.3%,Qwen 3-8B 为 4.8%。任务是在给定源文档的情况下做摘要——更聪明的模型容易"想太多",从而引入原文中不存在的信息。
小于 7B 参数的模型在面对复杂推理任务时幻觉风险更高,尤其是在缺乏充分微调的情况下。这些小模型在训练数据中只出现过一次的罕见事实上特别脆弱——如果某个人的生日或冷门事件时间在训练数据中仅出现极少次数,模型很难稳定记住。
模型架构、训练数据质量、对齐方法等因素对幻觉的影响往往比单纯的参数量更重要。经过良好 RAG 增强的中等规模模型,其事实准确性可以超过未增强的超大模型。腾讯混元 Hy3 通过重建数据清洗与定向约束对齐,将整体幻觉率从 12.5% 降至 5.4%,这证明数据质量和训练策略的改进可以带来比单纯扩大规模更显著的收益。
互联网文本中混有大量未经核实的信息、过时内容和谣言。模型在训练过程中缺乏辨别真伪的内在能力,会将学到的偏见和虚假信息写入参数。如果把 AI 比作学生,数据污染就像给学生看了错误的教科书,自然会导致"胡说八道"。
通用领域数据占比过高会导致专业领域知识不足。在医疗问答任务中,若训练数据仅覆盖常见疾病,模型对罕见病就容易生成错误信息。领域覆盖不均还会导致模型在面对专业术语时更容易产生幻觉,因为它缺少足够的上下文来建立正确的概念关联。
训练数据中重复样本过多会导致模型过度记忆特定表述而非学习通用规律。大模型防过拟合的第一道防线是严格的去重——包括文档级、句子级甚至子串级的去重。重复数据还会加剧隐私泄露风险,因为模型可能一字不差地复述训练数据中的敏感信息。
大型模型训练消耗巨大计算资源,训练数据存在固定的"知识截止日期"。模型对截止日期之后的事件一无所知,当被问及最新发展时,要么承认不知道,要么基于旧知识进行推测——后者就是幻觉的高发场景。这也是 RAG 成为必要补充的根本原因之一。
AI 幻觉是模型生成不真实内容的现象,本质是模型在"没学过"的地方强行拟合——它在概率分布中找到了一个"看起来对"但实际上错的路径。过拟合则是模型对训练数据死记硬背,无法泛化到新数据。两者虽然都表现为输出错误,但产生机制完全不同。
传统过拟合发生于预训练或基础训练阶段,核心问题是模型记住了训练数据的噪声。AI 幻觉贯穿模型的整个生命周期——预训练阶段的数据偏差、微调阶段的过拟合或欠拟合、推理阶段的采样不确定性都可能引发幻觉。2025 至 2026 年出现的"对齐过拟合"概念特指在 RLHF 等对齐阶段,模型为追求高奖励分数而机械套用模板、编造细节,这是幻觉的一种特殊诱因。
过拟合模型在新数据上预测准确率低,但在训练数据分布内表现良好。幻觉模型则可能在任何场景下都生成看似合理但实际错误的內容,无论输入是否来自训练分布。欠拟合模型也会产生严重幻觉,因为知识不足只能"编"。
过拟合的缓解主要依靠数据去重、正则化、早停、降低学习率等传统机器学习手段。幻觉的缓解则需要更综合的方案——RAG 提供外部知识锚定,提示词工程约束生成过程,多模型交叉验证增加事实核查层,人类在环确保高风险输出的准确性。
腾讯混元 Hy3 代表"考前复习"路线——推倒重建底层数据体系,通过严格的数据清洗和定向约束对齐,将整体幻觉率从 12.5% 降至 5.4%,推理延迟仅增加 7%。Factuality-aware DPO、CHAIR-DPO 等新型对齐方法将事实性奖励直接融入偏好优化过程。中科院合肥物质院团队提出的 RAG-CL 混合策略(检索增强加持续学习)在 Mistral-7B 模型中实现 96.5% 准确率和仅 1.1% 遗忘率。
阿里通义千问代表"开卷考试"路线——上线"引证"核查机制,接入海量权威信源库,将事实类内容幻觉率显著降低。RAG 结合知识图谱的 GraphRAG 方案在企业级部署中将幻觉率降低 62%。多智能体辩论框架通过交叉验证从根源抑制幻觉,清华 MARCH 框架使 8B 模型达到顶级闭源模型水平。
事实核查网关(Factuality Gate)在生成和输出之间加入验证层——用更小更便宜的模型将回答分解为原子声明并逐一核查,整个循环仅增加 300 至 800 毫秒延迟。保险理赔自动化提供商引入事实核查网关后将含幻觉的输出从 9% 降至 2.2%。结构化输出约束和 Schema 验证也成为标准配置。
业界共识已从"寻找不幻觉的模型"转向"构建不幻觉的系统"。McKinsey 数据显示,AI 高绩效企业(占受访者的 5.5%)的核心特征是工作流重构(2.8 倍可能性)、Agent 规模化部署(近 3 倍)和人机协同纪律(65% 定义了人工验证流程)。四层防御体系成为标准实践:第一层 RAG 知识锚定,第二层提示词工程与结构化约束,第三层人工审核高风险输出,第四层持续评估与黄金数据集监控。