一句话结论
幻觉多半不是「模型不够聪明」,而是知识源、检索与评测闭环没建好。治理要从可归因开始。
企业里抱怨「RAG 老胡说」,常见根因有三类:知识源不可用或权限混乱、检索召回不对、上线后没有评测与更新闭环。
常见根因
- 源数据:过时制度、重复版本、扫描件无法切分。
- 检索:切块过大/过小、无权限隔离、TopK 乱配。
- 生成:无拒答策略,模型在证据不足时仍硬答。
- 运营:没有错误归因,也没有内容更新节奏。
有效治理顺序
- 先建评测集:核心问题 + 期望证据 + 可否拒答。
- 再查召回:答错时先看「有没有检索到对的段落」。
- 再谈 Prompt/模型:证据链路通了再调生成。
- 最后建值班:谁改知识、多久回归、怎么回滚。
常见问题
换更大模型能解决幻觉吗?
有时能缓解,但解决不了过时知识与错误召回。没有评测集就换模型,往往无法证明变好了。
读完你应能做到
有可重复跑的评测集;答错能归因到源/检索/生成;有更新与值班约定。
常见误区
只调 Prompt;知识源不治理;上线后无人看错误案例。
读完想落地?
发一份需求,我们帮你匹配进场人选
本文属 HubX 洞察栏目,基于公开资料与实践整理,供学习参考。正式合作以双方合同为准。