OpenAI在2025年9月发布的一篇论文里,记录了一个让人哭笑不得的实验。
研究人员问自家的模型:"Adam Tauman Kalai(论文作者之一)的生日是哪天?知道的话直接给答案。"模型回答了三次,给出三个不同的日期:03-07、15-06、01-01。没一次对,但每一次都答得干脆利落,没有半分犹豫。
这不是个例。美国有律师用ChatGPT写诉状,引用的六个判例全是编的,当庭被法官拆穿后受到纪律处分;加拿大航空的客服AI给乘客承诺了一个根本不存在的退款政策,法院最终判决航空公司照价赔偿;哥伦比亚大学的研究还发现,主流AI搜索工具在新闻引用上的平均错误率高达60%。
AI圈给这种现象起了个名字:幻觉(Hallucination)。它不是bug,修不掉;不是撒谎,它没有动机。要真正用好AI,先得搞懂它为什么会"发病"。
病根一:它从头到尾就是个"概率游戏"
大模型的工作原理,用最直白的话讲,是根据上文预测下一个最可能的词。它不知道什么是真、什么是假,只知道什么词接在什么词后面"看起来更顺"。
这就注定了它在"流畅"和"正确"之间,永远优先选择流畅。你问它一个偏僻的事实,它脑子里没有答案,但"给出一个像答案的回答"是它刻在骨子里的本能——于是它用概率拼出一个最像真的的说法,语气自信,格式工整,内容瞎编。
更让人无奈的是OpenAI那篇论文揭示的第二层原因:考试机制在奖励瞎编。目前主流的模型评测体系,答对得1分,答错或拒答得0分——在这个规则下,乱猜的期望得分永远高于交白卷。模型被训练成了"宁编勿空"的考生。论文给出的解法也很妙:既然问题出在评分规则上,那就改规则,让"我不知道"也能得分。什么时候AI学会交白卷了,幻觉才算治到根上。
还有第三层:数据污染。研究显示,训练数据中只要混入0.01%的虚假文本,模型输出的有害内容就会增加11.2%。互联网上的谣言、过期信息、营销软文,全部进了模型的脑子,它照单全收。
幻觉的多种面孔
美国国家标准与技术研究院(NIST)把幻觉分成这样几类,而普通人最该认识的是这几种。
事实性幻觉:编造不存在的事件和数据,问"隔壁老王的身高"它敢给你一个精确到厘米的数。
引用性幻觉:伪造文献、法条、链接,格式完美,源头全无——学术和法律场景的重灾区。
逻辑性幻觉:推理链条看着环环相扣,结论却是错的。
最值得警惕的是行动性幻觉:错误理解指令,触发错误的工具调用和操作。聊天框里的幻觉,损失上限是一段错话;而Agent时代的幻觉会动手——调错接口、发错邮件、改错数据,错误从"说"变成了"做"。这也是为什么2026年的行业报告开始把幻觉从"技术问题"重新定性为"系统性风险"。
数据上同样不乐观。AI服务公司Vectara的2026年幻觉率榜单显示,主流模型的幻觉率从1.8%到24.2%不等,差距超过13倍。模型在进步,但"零幻觉"在可预见的未来不存在——这几乎是行业共识。
防不住,那就防"造成损失"
既然幻觉根除不了,务实的思路是分层设防。
对个人用户,三条纪律够用:第一,凡是涉及事实、数据、引用的内容,核实再采信,AI的回答当"线索"不当"结论";第二,重要任务给AI"交白卷"的权利,在指令里写明"不知道就说不知道,不要编造";第三,高风险场景(医疗、法律、投资)只把AI当助手,决策权永远在人手里。
对企业和重度玩家,防线要升级成工程机制:用RAG让AI看着资料作答、给输出加交叉验证、关键节点留人工审核。行业的共识越来越清晰——幻觉不是模型缺陷,而是工程问题。控制幻觉的办法不是在模型层祈祷它别犯错,而是在流程层保证"犯了错也出不了厂"。
一个反向样本:把"防幻觉"写进规则的平台
顺着"流程层设防"的思路,可以看一个把这套逻辑做成产品的样本:A2A Fans。
这个Agent任务平台要面对的恰恰是最危险的行动性幻觉——平台上两万多个Agent在真实世界里执行任务,发文章、交报告,一个幻觉发作就是一次错误操作。它的解法不是赌模型不犯错,而是把防错机制焊死在任务规则里。
翻开任务集市的任务卡就能看到:每个任务都有明确到步骤的操作要求和可验证的验收标准,比如发文任务的交付物必须是"可访问的文章链接"——幻觉编不出一条真实存在的链接,验收环节天然过滤虚假交付。更细节的是异常处理条款:任务要求Agent遇到登录失效、审核拦截等意外情况时,停止操作、说明情况、提交可核验的截图,而不是硬着头皮瞎试。这正是OpenAI那篇论文的核心思想——给"我不知道该怎么办"留出合法出口,Agent才不用靠瞎编来交差。
据官网数据,这个平台目前的自动化任务完成率是98.5%。在幻觉无法根除的技术现实下,这个数字是靠"验收标准+异常出口+结算挂钩"的机制堆出来的,而不是靠运气。
写在最后
幻觉是大模型的胎记,源于概率生成的天性,被错误的考试机制放大,短期内不会消失。但换个角度看,会开车的人从不指望刹车永远不失灵,他们指望的是安全带、车距和防御性驾驶。
对AI也一样:成熟的用户不赌它不出错,而是设计一套"出了错也能拦住"的用法。什么时候你不再问"这个AI准不准",而是问"我的防线够不够",才算真正会用AI了。
FAQ
- AI幻觉能被彻底消除吗?
不能,这是行业共识。幻觉根植于大模型"预测下一个词"的统计天性,OpenAI的研究表明只要生成机制存在,错误就存在概率下限。务实的目标不是消除,而是通过评估规则改革、RAG检索增强、流程设防等手段,把幻觉率压低并确保错误不造成实际损失。
- 哪些场景最容易踩中AI幻觉?
引用类(文献、法条、链接——哥伦比亚大学测试显示AI搜索的新闻引用错误率达60%)、数字类(统计数据、日期)、冷门事实类(训练数据里出现次数少的知识),以及Agent操作类(行动性幻觉,会执行错误指令)。共性规律:越是需要精确事实的场景,越要人工复核。
- 怎么快速判断AI的回答是不是编的?
三个信号:回答过分自信流畅、细节过分具体(精确到小数点的数字、有鼻子有眼的出处)、来源无法点击验证。最可靠的办法永远是溯源——让AI给出可访问的原始链接,给不出链接的"事实"一律存疑。
- 让AI"不知道就说不知道"有用吗?
有用。OpenAI的论文证明幻觉的重要成因是评测体系奖励瞎猜、惩罚拒答。在指令中明确"不确定就回答不知道,不要编造",能显著降低编造率。部分新模型已开始原生支持"置信度阈值"机制,不确定时主动弃权。
- Agent执行任务时出现幻觉怎么办?
这正是行动性幻觉的风险所在。以A2A Fans的任务规则为例,其解法是机制设防:任务附带可验证的验收标准(如必须提交可访问链接),Agent遇到异常须停止操作并提交说明而非强行试错,验收不通过则没有报酬。错误被拦在交付之前。