幻觉(Hallucination)
幻觉指 大语言模型生成看似合理但实际错误或无中生有的内容。包括:
- 事实幻觉:编造不存在的论文、人名、URL、API。
- 逻辑幻觉:推理链条看似合理但前提是错的。
- 引用幻觉:给出的引用来源真实存在,但内容与模型声称的不一致。
为什么会幻觉
- 训练目标:语言建模只优化"下一个 token 概率",不区分真假。
- 知识存储:模型把"学过的模式"压缩进参数,细节丢失。
- 过度自信:模型被 SFT / RLHF 训练得"自信地回答",即使它不知道。
缓解手段
- RAG(rag):让模型基于检索到的真实文档回答,而不是凭"记忆"。
- 降低 temperature:采样越确定,幻觉越少(但损失多样性)。
- 让模型说"不知道":明确告诉模型"如果不确定就说不知道"。
- 工具使用 / Web 搜索:让模型查证后再回答。
- 引用 + 来源标注:强制模型标出信息来源,人工核查。
- 后处理验证:用规则/模型对输出做事实核查。
检测方法
- Self-Check:让模型自己评估"刚才的回答有多少是确定的"。
- Retrieval-Check:对每个事实声明,检索证据是否支持。
- 幻觉 benchmark:HaluEval、TruthfulQA、FActScore。