北京大学 | GRIP:检索即生成——一种具有自触发信息规划的统一框架

· 2026-08-19 18:30 · 2 阅读

原创 王昌坤 2026-08-19 18:30 四川

本文最重要的启示是:让模型训练时看到的序列语法与系统运行时执行的工具协议一致,工具使用才能从提示约定变成模型策略的一部分。

原文标题:Retrieval as Generation: A Unified Framework with Self-Triggered Information Planning
原文作者:Bo Li, Mingda Wang, Gexiang Fang, Shikun Zhang, Wei Ye
原文链接:https://aclanthology.org/2026.acl-long.196/
发表会议:ACL 2026
笔记作者:王昌坤@安全学术圈
主编:黄诚@安全学术圈

1 研究背景

检索增强生成(Retrieval-Augmented Generation,RAG)让大语言模型能够调用外部知识库,缓解幻觉并补充事实性知识。但"何时检索、用什么查询检索、何时停止检索"这三个关键决策,传统上由外部的控制器、启发式阈值或代理循环决定,与语言模型自身的解码状态相互分离。查询改写、证据整合与终止判断往往被拆成多个独立阶段,难以用统一目标学习,也难以判断一次检索失败究竟是过早检索、查询不准还是停止过晚。

现有动态检索方法(如 Self-RAG、DRAGIN、GainRAG)尝试根据不确定性触发新检索,但仍依赖手工阈值或外部分类器。本文关注的问题是:能否把检索控制表达为语言模型自己的序列决策,使检索与推理沿同一条轨迹协同演化。

论文提出 GRIP(Generation-guided Retrieval and Information Planning),把检索触发、查询改写与停止决策统一为单条自回归轨迹中的可训练生成动作,并在五个问答基准上超越了最强开放基线、逼近 GPT-4o。

2 核心方法与框架

2.1 自触发信息规划与控制符

GRIP 的核心是把工具调用协议嵌入序列,而非让独立模块在模型外部读取置信度后做决定。它扩展了模型的输出空间,引入四个控制符:

  • [INTERMEDIARY]:开始生成当前已知的中间状态;

  • [RETRIEVE]:请求外部检索,并在其后生成查询;

  • [ANSWER]:开始生成最终答案;

  • [SOLVED]:终止当前轨迹。

这样,模型在同一条自回归轨迹中自己决定何时检索、如何改写查询、何时终止,构成"自触发信息规划"循环。外部检索器仍然存在并负责从语料库返回文档,模型只负责生成调用时机与调用参数——所谓"检索即生成",指的是检索控制成为生成动作,而非把检索器内化进语言模型。

2.2 四类结构化训练轨迹

为了让模型学会"信息是否充分"这一判断,论文没有只训练最终答案,而是根据内部知识与外部证据是否充分,构造了四类行为轨迹:

类型

信息状态

目标轨迹

教授的能力

Type-α

内部知识足够

[ANSWER] → [SOLVED]

不检索即可直接回答

Type-β

只有部分或含噪答案

[INTERMEDIARY] → [RETRIEVE]

识别信息不足并发起检索

Type-γ

内部知识与基础检索都不足

多轮中间状态与新查询

面向剩余缺口改写查询

Type-θ

检索材料覆盖答案但仍需筛选

从中间状态转向最终回答

在噪声证据中完成答案压缩

其中 Type-γ 使用 GPT-4o-mini 根据当前问题、中间答案和已有文档生成更有针对性的后续查询,属于有监督的行为轨迹合成。

2.3 两阶段训练

训练分两阶段:

  1. 监督微调(SFT):用 4 万条样本全参数微调,标准自回归交叉熵,学习同时包含自然语言与控制符的目标序列,建立基本控制语法。

  2. 规则奖励强化学习(RL):用 5000 条样本基于 DAPO 训练,总奖励为答案忠实度奖励与控制准确度奖励之和。答案奖励用 BLEU 衡量,控制奖励奖励正确的控制符模式。

实验显示,强化学习的主要作用不是创造问答能力,而是减少获得充分证据后的冗余检索——去掉 RL 后平均检索次数从 1.24 升至 1.60,而最终分数仅微降。

3 实验设计与主要结果

3.1 数据集与主结果

论文在五个知识密集型问答基准上评测:HotpotQA(多跳推理)、PopQA(长尾实体)、Natural Questions 与 WebQuestions(开放域事实问答)、TriviaQA(复杂事实问题),另有附录的 BioASQ 用于领域迁移。开放模型统一使用 LLaMA3-8B 骨干、维基百科语料、BM25 检索器与 top-3 段落。

主结果显示,GRIP 取得平均分 41.0,比最佳开放基线 InstructRAG 的 37.0 高 4.0 分,与 GPT-4o 的 41.4 仅差 0.4 分。

方法

类型

平均分

单次检索基线

免训练

30.8

GainRAG

训练式动态检索

34.8

R1-Searcher

深度搜索

36.0

RetRobust

鲁棒检索增强

36.6

InstructRAG

显式去噪推理

37.0

GRIP

控制符规划

41.0

GPT-4o

闭源参考

41.4

不过"接近 GPT-4o"只适用于这组问答协议与论文定义的等权平均指标,不等于通用能力、推理成本或服务体验已经等价。

3.2 动态检索与查询改写

GRIP 的检索深度具有样本与任务自适应性:多跳或长尾问题上检索更多,可内部回答的问题上检索更少。规则奖励强化学习把平均检索次数从 1.60 降至 1.24(约 22.5%),主要体现为"学会更早停止"。

查询改写实验提供了机制层面的证据:在 NQ 与 WebQ 上,GRIP 生成的查询显著提升了答案覆盖率——NQ 的 top-1 覆盖率从 8.18% 升至 13.12%,WebQ 的 top-1 覆盖率从 7.60% 升至 18.99%。这说明中间推理驱动的查询改写确实让 BM25 更容易找到包含答案的段落。

3.3 预算外推与消融

推理时允许的最大检索预算从 3 增至 10,平均分从 41.0 增至 41.8,而实际平均检索次数仅从 1.24 增至 1.62,说明模型没有完全记住固定步数,但收益明显递减。

消融实验进一步验证了方法的稳健性:教师替换(GPT-4o-mini 换 Qwen3-32B 仍有 40.3)、检索器替换(BM25/DPR/混合均稳定领先)、骨干替换(Qwen2.5-7B 上趋势一致)都表明框架不依赖闭源教师或特定检索器;领域测试在 BioASQ 上取得 54.8 的 ROUGE 与 84.4 的 F1。

4 总结

本文把大语言模型调用外部检索器的三个关键决策——何时调用、用什么查询调用、何时停止调用——压缩成统一的生成语法,用四类行为轨迹监督"信息充分性判断",再用规则奖励强化学习细化停止行为。实验表明 GRIP 在五个问答基准上以 41.0 的平均分超越最强开放基线、逼近 GPT-4o,同时把平均检索次数压到 1.24。

论文的主要局限在于任务范围仍集中在维基百科上的短答案问答,行为标签依赖人工规则与标准答案信息,奖励偏向表面匹配(BLEU)而非事实一致性。但这些问题并未削弱核心价值。本文最重要的启示是:让模型训练时看到的序列语法与系统运行时执行的工具协议一致,工具使用才能从提示约定变成模型策略的一部分。

5 主要贡献

  1. 提出"检索即生成"范式:将检索触发、查询改写与停止判断统一为单条自回归轨迹中的可训练生成动作,消除外部控制器与模型解码状态的割裂。

  2. 用四类行为轨迹监督信息充分性判断:把样本组织为直接回答、需要检索、多跳规划和答案完成四类,使"何时调用工具"本身获得明确监督。

  3. 分离答案质量与行为控制优化:SFT 先建立控制语法,规则奖励强化学习再同时优化答案忠实度与控制符准确度,实验证明 RL 的主要作用在于减少冗余检索而非创造问答能力。

  4. 从行为层面验证动态检索:除主结果外,通过检索次数、查询覆盖率、预算外推、教师/检索器/骨干替换等分析,证明性能增益确实来自可适应的检索规划。

相关资源:

安全学术圈招募队友-ing 
有兴趣加入学术圈的请联系 secdr#qq.com


阅读原文

跳转微信打开