LLM 中的外源性幻觉
1200 words
6 minutes
LLM 中的外源性幻觉
LLM 中的外源性幻觉
作者:Lilian Weng(翁丽莲 · OpenAI VP of AI)
发布:2024年7月7日 · Lil’Log(阅读约 29 分钟)
原文链接:https://lilianweng.github.io/posts/2024-07-07-hallucination/
LLM 的”幻觉”通常指模型生成不忠实、捏造、不一致或无意义的内容。本文把幻觉问题缩小到模型输出被捏造且没有依据(既不在提供的上下文中,也不在世界知识中)的情况。
两种幻觉
| 类型 | 定义 | 例子 |
|---|---|---|
| 上下文幻觉 | 模型输出与上下文中的来源内容不一致 | 摘要里包含了原文没有的信息 |
| 外源性幻觉 | 模型输出与外部世界知识冲突 | 声称某事件发生在错误的时间 |
幻觉的成因
预训练数据问题
- 不完整知识:训练语料中没有包含某些实体或关系
- 知识过时:训练数据的时效性问题,模型不知道最新信息
- 数据偏差:某些高频信息被过度学习,低频知识被压制
- 错误信息:预训练数据本身包含大量互联网上的错误内容
微调阶段引入新知识
当模型在微调中学习新知识时,可能会出现”知识冲突”:
- 新旧知识混淆:新学的内容与预训练时的记忆出现矛盾
- 微调数据过拟合:过度强调特定格式的微调数据,牺牲了泛化能力
- 知识更新困难:模型存储的知识高度耦合,局部更新可能影响其他知识
幻觉检测方法
1. 检索增强评估
利用外部知识库(如 Wikipedia)检索与模型输出相关的内容,检查输出是否与检索结果一致。
2. 基于采样的检测
同一个提示词多次采样:
- 如果多个采样回答高度不一致,高概率存在幻觉
- 语义熵(Semantic Entropy):衡量模型在语义层面上的不确定性,不确定性越高,幻觉风险越大
3. 未知知识的校准
模型应该知道”自己不知道什么”:
- SelfCheckGPT:让模型用不同的采样生成多个回答,检查它们之间的一致性,再用 NLI(自然语言推理)模型检测是否互相矛盾
- 训练”我不知道”:在训练中教模型对不确定的问题回答”我不知道”
4. 间接查询
不直接问”X 是真的吗”,而是问一些间接的、相关的问题。如果模型的间接回答与主回答矛盾,说明存在幻觉。
抗幻觉方法
RAG(检索增强生成)→ 编辑与归因
RAG 是目前最主流的抗幻觉方案:
- 检索相关文档作为上下文
- 让模型基于检索结果生成回答
- 要求模型给出每个陈述的来源引用
进阶版包括:
- 事后编辑:先生成回答,再通过检索修改其中不准确的部分
- 归因检查:让模型在陈述后附上引用,再检查引用是否确实支持该陈述
链式操作
通过多步验证减少幻觉:
- 将复杂问题分解为多个子问题
- 逐一回答子问题,每个回答都尽力确保准确性
- 最后综合所有子回答形成最终答案
采样方法
- 多数投票:多次采样,选择出现频率最高的答案
- 置信度裁剪:当模型对自己输出不确定时,裁剪掉低置信度的部分
- 对比解码:对比两个不同模型的输出差异,捕捉不稳定的生成内容
微调提升事实性
- 直接偏好优化(DPO):让模型偏好事实性更高的回答
- 事实性奖励建模:训练奖励模型来区分事实正确和错误的输出
- 知识编辑(Knowledge Editing):精确修改模型中某个事实的内部表示
归因微调
关键思想:模型不仅要生成正确答案,还应该学会归因——即指出它是从哪个来源知道这个信息的。
- 引用训练(Citation Training):教模型在输出中附上可验证的引用来源
- 源链接生成:不仅在内部归因,还输出用户可点击验证的源链接
评估基准
| 基准 | 测试内容 |
|---|---|
| TruthfulQA | 测试模型是否容易被常见误解误导 |
| HaluEval | 专门的幻觉检测数据集 |
| FActScore | 逐句检测事实准确性 |
| RAGTruth | 在 RAG 场景中检测忠实度 |
Lilian Weng 的这篇文章是 2024 年 LLM 幻觉领域最权威的技术综述之一,系统性地覆盖了成因→检测→防治的完整链路。
Share Article
If this article helped you, please share it with others!
Related Posts Smart
1
AI 外文信息源推荐清单
外部精选 这份清单不是终点,而是起点。
2
LLM 驱动的自主 Agent 系统
外部精选 作者:Lilian Weng(翁丽莲 · OpenAI VP of AI)
3
"Agency > Intelligence"——能动性大于智力
外部精选 作者:Andrej Karpathy(@karpathy)
4
LLM 的对抗攻击(Adversarial Attacks on LLMs)
外部精选 作者:Lilian Weng(翁丽莲 · OpenAI VP of AI)
5
20+ 个 Agent Skills、仓库与市场,值得收藏
外部精选 作者:Bilgin Ibryam
Random Posts Random