经典大模型arXiv:2005.11401
RAG:先检索,再生成
Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
Patrick Lewis, Ethan Perez, Aleksandra Piktus, Fabio Petroni, Vladimir Karpukhin, Naman Goyal, Heinrich Küttler, Mike Lewis, Wen-tau Yih, Tim Rocktäschel, Sebastian Riedel, Douwe Kiela
NeurIPS · 2020
14k 引用 · 1.6k 阅读 · 0 收藏
摘要
把稠密检索器和生成模型接在一起,让参数记忆与外部文档同时参与知识密集型任务。
Combines a dense retriever with a seq2seq generator so that parametric memory and non-parametric documents are used together.
提要
RAG承认语言模型记不住全世界,于是把世界放回文档库里。它把稠密检索器与序列生成模型接成一体,让参数记忆与外部文档共同支撑知识密集型任务。
01背景与动机
大型语言模型通常把世界知识压缩进参数权重,但事实会过时,完整重新预训练的成本极高。知识密集型自然语言处理任务往往要求答案有据可查且便于更新,仅依赖冻结的参数记忆很难同时保证覆盖广度与信息时效。
为此,该工作提出可微分的检索—生成管线,让外部非参数文档与模型参数记忆共同参与推理。知识更新可以主要发生在文档库中,而不必为每一次事实变化重训整个生成模型,从而降低维护成本,并让答案来源更易追溯。
02核心方法
系统采用类似DPR的稠密检索器,把查询映射到向量空间,从大规模文档库中取出相关段落作为证据。检索得到的段落构成非参数记忆,与生成器参数记忆并列,为后续写作提供可替换、可更新的外部依据。
生成端采用BART或T5一类序列到序列模型,以检索到的段落为条件生成最终答案。训练过程中检索与生成可以端到端配合,使模型学会在参数内知识与外部文档之间权衡取舍,并在需要时依据文档组织表述与引用。

03结果与证据
该方法表明,把稠密检索与条件生成接成一条可训练管线后,模型能在开放域问答等知识密集型任务上同时利用参数记忆与外部文档。与只依赖参数的生成方式相比,答案可以附着到具体段落,从而更便于核对事实来源与表述依据。
由于外部文档库可以独立替换或增补,更新世界事实时不必重跑完整的预训练流程。这一设计为需要引用依据的应用提供了可操作路径,同时也清楚说明:生成质量的上限常常取决于检索是否找对了相关段落。

04影响与意义
RAG这一架构随后成为搜索增强问答、智能客服助手以及企业内部知识库问答的常见标准骨架。它把“先检索、再生成”固化为工程上的默认路径,使对话与问答系统能够稳定接入不断变化的业务文档、手册与网页资料。
对研究与产品落地而言,其意义在于把知识维护从反复预训练,转向维护可检索、可版本化的文档集合。参数更多负责语言组织与推理习惯,文档库负责可更新事实,二者分工使系统更易迭代,也更易审计每条答案的依据。
05局限
若检索阶段取错或取偏段落,错误证据会直接进入上下文并污染后续生成,容易得到看似流畅却站不住脚的回答。引用是否忠实于原文、是否出现张冠李戴,仍然是实际部署中必须单独约束、核查与持续监控的难点。
多跳推理往往需要串联多篇文档中的线索,而当前“一次检索、再条件生成”的主流流程在这类问题上仍显吃力。面对长文档时,段落切分、排序与定位也容易丢失必要上下文,从而限制系统在复杂知识任务上的稳定性与可靠性。
06要点
- 01知识更新应发生在库里,而不是每次预训练。
- 02生成质量的上限常常是检索质量。
- 03引用从哪里来,要能指回去。
为何入典
今天企业里一半「AI 应用」的骨架。它把幻觉问题部分转化成了检索质量问题。
标签
相关论文
BERT:双向预训练改变 NLP
BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
ReAct:推理和行动写在同一条轨迹里
ReAct: Synergizing Reasoning and Acting in Language Models
GPT-3:上下文里的少样本学习
Language Models are Few-Shot Learners
和这篇论文对话
开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。