Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning

基本信息


研究摘要

近年来,具备显式推理能力的大语言模型(Large Language Models, LLMs)在复杂推理任务上取得了令人瞩目的进展。通过让模型在给出最终答案之前生成逐步展开的思维链(chain-of-thought),研究者成功地激活了模型深层的逻辑与规划能力。与此同时,长上下文(long-context)评估也正从早期的简单检索任务向复杂的跨文档推理转变,使得具备思维能力的模型成为长上下文推理领域的天然前沿。然而,正是在这一交叉地带,本文作者识别出了一种关键但此前未被充分关注的失效模式:重复性复制(repetitive copying)。

所谓重复性复制,是指模型在处理长上下文时,倾向于将输入中的大量文本直接照搬到自身的推理轨迹中,而非真正对信息进行加工、选择与推理。这一现象并非偶发,而是普遍存在于七种前沿长上下文大模型之中,既包括专有 API 模型,也涵盖开源权重检查点。更为关键的是,随着上下文长度的增加,复制行为会愈发严重:在 GSM-Infinite 基准上,部分模型的 3-gram 重叠率(overlap rate)从 8k 上下文下的约 40% 攀升至 64k 上下文下的 70% 以上。这种复制不仅无助于解决问题,反而会挤占宝贵的推理 token 预算,导致思维长度膨胀、准确率下降。

为了理解这一行为的根源,作者进行了一项系统性的诊断分析。他们将输入文本划分为任务相关的关键证据(key evidence)与无关的干扰信息(distractor context),并分别测量模型推理轨迹与这两部分的重叠程度。结果表明,真正的问题并不在于“复制”本身,而在于“不加选择地复制”。那些能够将复制集中在关键证据上的样本,其回答正确的概率显著更高;而那些广泛复制干扰上下文的样本则更容易失败。因此,重复性复制的根本原因被归结为证据 grounding 不足(insufficient evidence grounding):模型无法有效区分相关信息与无关信息,只能通过机械搬运来缓解不确定性。

基于这一诊断,本文提出了 GEAR(Grounding Evidence-Aware Reward),一种轻量级的奖励塑形(reward shaping)方法。GEAR 在标准准确率奖励之外引入了两个互补信号:一个是 grounding reward,用于鼓励模型与关键证据产生 n-gram 重叠;另一个是 distractor penalty,用于惩罚模型对无关上下文的复制。为了让 GEAR 能够应用于自然语言文档,作者还设计了一套自动化的三阶段数据构建流程,从任意长文档中生成带有证据标注的问答对。实验表明,在三种不同规模的 Qwen3.5 模型以及五个独立基准上,GEAR 相较于仅使用准确率奖励的标准强化学习(Reinforcement Learning, RL)平均可提升多达 4.6 个百分点,并且在 128k 上下文下的增益显著高于 32k,说明证据 grounding 能力具有出色的长度泛化性。同时,GEAR 还能有效降低重复复制比例与思维长度。

这项工作的重要性在于,它揭示了长上下文推理中一个隐蔽但广泛的失效模式,并将其与证据 grounding 能力直接联系起来。随着长上下文评估逐渐从“大海捞针”式的检索转向多步推理与综合理解,准确地在庞杂语境中定位并运用相关证据,将成为衡量模型真实能力的关键维度。GEAR 以其简洁的设计和可扩展的数据流程,为这一问题提供了一个即插即用的解决方案,也为未来研究如何在 RL 训练中嵌入结构性先验提供了有益启发。

理论框架

要理解 GEAR 的理论贡献,需要将其置于两个相互交织的研究脉络之中:一是 RL with Verifiable Rewards(RLVR)在推理能力激发方面的成功,二是长上下文建模中重复生成与 grounding 问题的长期讨论。

RLVR 范式的核心洞见在于,只要存在可自动验证的奖励信号,模型就能通过强化学习自主发展出复杂的推理行为。DeepSeek-R1 的工作表明,仅凭准确率奖励,无需监督微调,模型便可涌现出长链推理能力。后续研究沿着多个方向改进这一范式:GRPO 用组相对优势估计替代独立的 Critic 网络,降低了显存开销;DAPO 引入非对称裁剪与动态采样以稳定长 CoT 训练;GSPO 则从 token 级重要性比率转向序列级重要性比率,缓解了混合专家模型(Mixture-of-Experts, MoE)中的方差问题。然而,这些工作大多聚焦于短上下文数学推理,对于长上下文场景下 RL 训练所面临的特殊挑战关注较少。

长上下文 RL 训练的相关研究近年来逐渐增多。LongRLVR 提出,在仅使用答案奖励时,模型对上下文的梯度信号会迅速消失,因此需要基于 chunk 级别 F1 分数的可验证上下文奖励;GoLongRL 从能力导向出发,构建了包含九种任务类型的异构数据集与任务级奖励归一化;LongR 引入了衡量引用信息增益的上下文密度奖励;LoongRL 则通过在短上下文多跳 QA 上填充干扰信息来构造长上下文训练数据。与这些工作相比,本文的理论视角更为聚焦:它将问题锁定在“重复性复制”这一具体行为上,并通过区分关键证据与干扰信息来解释该行为的成因。这一视角的转换至关重要——它意味着解决方案不需要引入复杂的外部检索器或 verifier,而只需在奖励设计中显式编码“复制什么”与“不复制什么”的偏好。

在更宏观的层面,重复生成(repetitive degeneration)在神经文本生成中早有研究。Li et al.(2023)从训练数据角度追溯重复现象,Yao et al.(2025)从模型激活特征中识别出“重复特征”,Mahaut & Franzon(2025)则指出重复可能源于不确定性与过度自信等不同机制。在推理模型领域,“过度思考”(overthinking)问题也日益受到关注,即模型生成过长的推理轨迹却并不提升准确率,Wu et al.(2025)甚至发现推理长度与准确率之间存在倒 U 型关系。本文将这两条线索连接起来,指出在长上下文场景下,过度思考的主要表现形式并非无目的的 elaboration,而是对输入文本的直接复制,并且这种行为与证据 grounding 不足密切相关。

论文的核心概念可以概括为以下三点。首先是“重复性复制”,它通过 n-gram 重叠率来量化:给定输入提示 x 和推理轨迹 y,将所有出现在 x 中的不同 n-gram 收集为查找集合 Nn(x),然后用大小为 n 的滑动窗口扫描 y,统计窗口内容落入 Nn(x) 的比例,即

Overlapn(yx)=1mn+1i=1mn+11[(yi,,yi+n1)Nn(x)].

这里 m 是推理轨迹 y 的长度,指示函数 1[] 在窗口内容与输入中的某个 n-gram 匹配时取 1。当 n 较小时(如 n=3),该指标反映整体复制体量;当 n 较大时(如 n=10),则更能捕捉长连续片段的刻意转录。

第二个核心概念是“证据 grounding 比例”。作者将输入 x 按照 ground-truth support indices 切分为关键证据 xkey 与干扰上下文 xdist,并定义 grounding ratio 为

r=Overlap10(yxkey)Overlap10(yxdist).

r 越高,说明模型的复制越集中于任务相关信息。作者通过这一指标证明:正确样本的 grounding ratio 显著高于错误样本,从而将“复制多少”的问题转化为“复制什么”的问题。

第三个核心概念是 GEAR 奖励本身。在标准准确率奖励 Racc{0,1} 的基础上,GEAR 引入了关键证据重叠奖励与干扰上下文惩罚:

R(x,y)=Racc+αOverlapn(yxkey)βOverlapn(yxdist).

其中 αβ 是非负系数,用于平衡两种信号的强度。值得注意的是,同时出现在关键证据与干扰上下文中的 n-gram 会被排除在干扰惩罚之外,以避免误伤对关键证据的合理引用。该公式的巧妙之处在于,它无需任何外部 verifier 或检索模块,完全基于已有证据标注即可计算,因而具有良好的可扩展性。

从理论假设上看,GEAR 预设了一个简单而有力的先验:在 RL 训练中,模型需要被明确告知“应当聚焦于哪些信息”。仅仅依赖最终答案的准确率奖励是不够的,因为模型可能通过大量复制输入来“掩盖”其不确定性,而这种策略在某些情况下仍可能碰巧得到正确答案,从而被错误地强化。GEAR 通过奖励与惩罚的互补设计,将“选择性 engagement”编码进优化目标,引导模型学会在长上下文中进行有目的的信息提取。当然,这一理论框架也依赖于证据标注的可用性,这正是作者开发自动化数据构建流程的原因。

技术架构

GEAR 的技术实现可以看作一个从诊断到训练再到泛化的完整闭环。整个系统由三个主要模块构成:问题诊断模块、奖励塑形模块和数据构建模块。三者相互支撑:诊断模块揭示了失效模式并定义了需要优化的目标;奖励塑形模块将诊断结果转化为可优化的 RL 信号;数据构建模块则为奖励计算提供必需的结构化监督。

在诊断阶段,作者首先需要量化“重复性复制”。为此,他们设计了基于 n-gram 的重叠率指标,并在 GSM-Infinite 这一程序化生成的长上下文数学推理基准上进行了大规模测量。GSM-Infinite 的每个问题要求 10 到 20 步连续运算,关键数值条件被分散嵌入大量数字描述中。由于该基准是程序化生成的,每个问题所依赖的字符位置(support indices)以及标准推理链都是精确已知的,因此可以精确判断模型复制的内容属于关键证据还是干扰信息。作者将上下文长度设为 8k、16k、32k 和 64k 四个档次,覆盖了从较短到极长输入的完整范围。

诊断结果直接催生了奖励塑形模块。GEAR 奖励由三个部分组成:准确率奖励 Racc、关键证据 grounding 奖励和干扰上下文惩罚。其中,grounding 奖励鼓励模型主动引用关键证据,distractor 惩罚则抑制无差别复制。这两个信号在设计上必须成对出现,单独使用任何一方都会导致失败:如果只奖励关键证据重叠,模型可能通过大量复制整个输入来提高命中关键证据的概率,从而加剧重复;如果只有干扰惩罚,模型可能干脆避免所有引用,导致 grounding 不足。GEAR 的互补设计确保了模型在“多引用关键证据”与“少引用干扰信息”之间取得平衡。

为了让 GEAR 走出合成基准、进入自然语言数据,作者提出了一个自动化的三阶段数据构建流程。第一阶段是文档分析与过滤:用语言模型分析源文档的信息特征(事实陈述、数值数据、因果关系、比较等),确定适合生成的问题类型,并过滤掉不适合 QA 的文档(如结构化数据、商品列表)。第二阶段是证据约束下的 QA 生成:将文档切分为 1024 字符的文本块,随机采样 1 到 3 个块作为约束上下文,即关键证据区域,其余部分作为干扰上下文;然后让语言模型仅依据约束上下文生成问题、1 到 3 条精确证据引用以及简洁答案。第三阶段是答案验证:用约束上下文独立重新回答问题,只有当重新推导的答案与参考答案一致时才保留该样本。这种“先选证据、再生成问题”的逆向流程确保了证据标注的自动生成,无需人工标注。

训练数据共包含 3200 个问题:1000 个来自 GSM-Infinite,1000 个来自 PhantomWiki,另有 1200 个来自 RedPajama-v2 文档的自然语言 QA。PhantomWiki 是一个构建虚构百科全书的基准,要求跨多个文章进行多跳实体追踪,与 GSM-Infinite 的数值链式推理形成互补,帮助 GEAR 学习更一般的证据 grounding 行为,而非特定任务的捷径。

在训练阶段,作者使用 GSPO(Group Sequence Policy Optimization)作为底层 RL 算法,对 Qwen3.5-9B、Qwen3.5-27B 和 Qwen3.5-35B-A3B 三种模型进行了训练。GSPO 通过序列级重要性比率来估计策略梯度,特别适合长序列生成场景。训练时 n-gram 大小取 n=3,因为较短的 n-gram 能提供更密集的奖励信号,有利于 RL 优化;而诊断分析中使用 n=10 则是为了追求更高的精确度。奖励系数设置为 α=0.1β=0.3,即对干扰复制的惩罚强于对关键证据引用的奖励,这反映了作者对“抑制无差别复制”的优先关注。训练共进行 1 个 epoch(约 100 个优化步),学习率为 2×106,batch size 为 32,rollout group size 为 8。最大提示长度为 32k token,最大生成长度为 16k token,训练数据的上下文长度均匀分布在 16k 到 32k 之间。

整个数据流可以概括为:长文档或合成问题首先经过切分与证据标注,形成带有 xkeyxdist 的训练样本;模型对提示生成推理轨迹 y;奖励函数 R(x,y) 同时评估答案正确性与复制行为的 grounding 程度;GSPO 根据组内相对优势更新模型参数。通过这一流程,模型逐渐学会在庞杂上下文中进行有选择的信息提取,而非机械搬运。

实验评估

实验评估部分围绕三个核心问题展开:GEAR 是否能提升长上下文推理性能?这种提升是否确实来自减少重复复制与改善证据 grounding?GEAR 的设计选择中哪些是不可或缺的?

作者在五个与训练数据不相交的长上下文基准上进行了评估:Ruler 是一个合成检索基准,测试多键多值提取;LongBench-v2 覆盖了多种真实长上下文理解任务;BrowseComp-LC 要求综合网页浏览中的长文档信息;GraphWalks 要求模型在文本化的图描述中跟随多跳路径并保持中间状态;AA-LCR 是一个长上下文推理基准。所有基准原生使用 128k token 上下文,作者同时报告 32k 子集和完整 128k 集的结果。由于 AA-LCR 所有实例均超过 32k,因此只出现在 128k 列中。

主要结果呈现在表 1 中。在 32k 上下文下,GEAR 相较于仅使用准确率奖励的 GSPO 平均提升分别为:Qwen3.5-9B 提升 2.8 个百分点,Qwen3.5-35B-A3B 提升 1.5 个百分点,Qwen3.5-27B 提升 2.1 个百分点。在 128k 上下文下,增益更为显著:分别提升 4.6、2.1 和 2.8 个百分点。一个特别值得注意的现象是,GEAR 的训练数据上下文长度仅为 16k 到 32k,但其在 128k(即训练分布 4 倍长度)上的改进反而更大,这表明 GEAR 学到的证据 grounding 行为具有良好的长度外推能力。

Model Method Ruler LB-v2 Bcomp-LC Graphwalks AA-LCR Avg
Qwen3.5-9B GSPO 91.5 55.9 77.7 88.9 78.5
Qwen3.5-9B GSPO+GEAR (32k) 96.4 58.6 79.1 90.9 81.3
Qwen3.5-9B GSPO (128k) 84.1 52.2 69.5 86.0 59.0 70.2
Qwen3.5-9B GSPO+GEAR (128k) 90.8 54.7 71.7 88.8 68.0 74.8
Qwen3.5-35B-A3B GSPO (32k) 93.1 60.4 75.6 91.5 80.2
Qwen3.5-35B-A3B GSPO+GEAR (32k) 96.2 61.3 75.6 95.9 82.3
Qwen3.5-35B-A3B GSPO (128k) 86.4 55.4 68.8 89.6 67.0 73.4
Qwen3.5-35B-A3B GSPO+GEAR (128k) 93.9 57.6 68.3 91.3 70.0 76.2
Qwen3.5-27B GSPO (32k) 95.5 60.4 74.9 91.5 80.6
Qwen3.5-27B GSPO+GEAR (32k) 96.5 62.2 77.7 91.8 82.1
Qwen3.5-27B GSPO (128k) 92.1 58.2 70.5 90.7 65.0 75.3
Qwen3.5-27B GSPO+GEAR (128k) 93.3 60.0 70.9 91.0 72.0 77.4

表 1:GEAR 在 32k 与 128k 上下文下的主要实验结果。所有基准均与训练数据不相交。

消融实验进一步揭示了 GEAR 两个组件的互补性。仅添加 grounding 奖励(+R_ground)而不加 distractor 惩罚时,模型性能反而普遍下降,在 128k 下某些模型跌幅高达 8.3 个百分点。这说明如果没有干扰惩罚的约束,grounding 奖励会诱导模型无差别地复制更多输入,包括大量无关内容,导致更长的思维链和更差的准确率。反之,仅使用 distractor 惩罚(α=0,β=0.3)也会使性能低于基线,因为模型缺乏指向关键证据的积极信号,可能干脆避免所有引用。只有将两者结合,模型才能学会区分相关信息与无关信息,实现稳定的性能提升。

表 2 量化了 GEAR 对重复复制与思维长度的影响。以 Qwen3.5-35B-A3B 在 32k 上下文为例,GSPO 在 Ruler 上的 token 级 3-gram 重叠率为 35.7%,思维长度为 2808 token;而仅加 grounding 奖励后,重叠率上升至 36.6%,思维长度激增至 5727 token;完整 GEAR 则将重叠率降至 27.0%,思维长度压缩至 2066 token。在 LongBench-v2 上,基座模型重叠率为 24.9%,GSPO 反而上升到 27.2%,+R_ground 进一步升至 28.5%,而 GEAR 最终降至 22.6%。这一轨迹清楚地表明,标准 RL 与单独 grounding 奖励都无法有效抑制重复复制,唯有结合 distractor 惩罚的 GEAR 才能同时降低重叠率与思维长度。

Benchmark Metric Base GSPO +R_ground +GEAR
Ruler Overlap Rate (%) 36.9 35.7 36.6 27.0
Ruler Think Length (tokens) 4290 2808 5727 2066
LongBench-v2 Overlap Rate (%) 24.9 27.2 28.5 22.6
LongBench-v2 Think Length (tokens) 5657 4677 6833 3989

表 2:GEAR 对重复复制与思维长度的影响(Qwen3.5-35B-A3B, 32k 上下文)。

表 3 的奖励系数消融进一步验证了对超参数的敏感性。当 α=0.1,β=0.3 时,Qwen3.5-9B 在 32k 下的平均分为 81.3;当 β 降至 0.1 时,平均分下降 2.9 个百分点,说明 distractor 惩罚不能过弱;当 β 升至 0.5 时,性能仅轻微下降至 80.5,显示模型对较强的惩罚具有容忍度;当 α 升至 0.3(保持 β=0.3)时,性能下降至 78.6,印证了过强的 grounding 信号会诱发无差别复制。表 4 则表明 n-gram 大小 n=3 略优于 n=5n=10,因为较短的 n-gram 提供了更密集的匹配信号,更适合 RL 优化。

综合来看,实验结果高度一致:GEAR 的性能提升并非来自某个单独技巧的简单叠加,而是来自“鼓励关键证据引用”与“抑制干扰上下文复制”之间的精细平衡。这种平衡在更长的上下文下愈发重要,因此 GEAR 在 128k 下的增益普遍高于 32k。

案例研究

为了更直观地展示 GEAR 如何改变模型的推理行为,作者提供了两个典型案例:一个是 Ruler 上的合成检索任务,另一个是 LongBench-v2 上的真实学术问答任务。

第一个案例要求模型从一长串无意义 token 中找出出现频率最高的三个编码词。基座模型(Base)的推理轨迹长达 16384 个 token,与输入的 token 级重叠率高达 97.6%,并且从未给出最终答案——它几乎将所有可用预算用于机械地复制输入文本。GSPO 训练后的模型虽然将重叠率降至 0%,看似解决了复制问题,却陷入了另一种退化:从约第 800 个 token 开始,它不断地重复单个候选词“hldjac”,直到耗尽 16k token 预算。这说明单纯的标准 RL 并不能保证模型形成有效的推理策略,而只是将重复复制的对象从“输入文本”替换为“自身生成的单一 token”。相比之下,GEAR 模型的轨迹仅有 2920 个 token,重叠率 0.6%,它以清晰的分步方式完成了预处理、计数、排序与选择,最终给出了正确答案。GEAR 用 82% 更少的思维 token 解决了同一问题。

第二个案例来自 LongBench-v2,要求模型根据两篇关于 CLIP 字体攻击(typographic attacks)的学术论文,判断四个陈述中哪一个是正确的。这个案例中没有 token 耗尽或大量复制输入的现象,所有模型都正常结束并给出了完整答案,但推理质量差异显著。基座模型在第 14855 个 token 的冗长轨迹中,虽然很早就识别出正确选项 A,却陷入了反复自我怀疑的循环,15 次出现“Wait, let me re-check...”式的冗余重审,最终反而改选了错误答案 C。GSPO 模型最终回答正确,但仍经历了 7 次类似的“Wait”循环,耗费了 9578 个 token。GEAR 模型则以 5072 个 token 完成了系统分析:它逐一评估每个选项,明确指出选项 C 在逻辑上存在缺陷(将两篇论文只在其中一篇涉及的任务上进行能力比较),从而确认 A 为正确答案,思维长度比基座模型减少 66%。

这两个案例揭示了一个更深层的问题:重复性复制与过度思考(overthinking)本质上共享同一个根源,即模型无法有效地 commitment to a conclusion,而是不断地通过生成冗余 token 来缓解不确定性。在第一个案例中,这种冗余表现为对输入文本的机械搬运;在第二个案例中,则表现为对同一证据的反复重审。GEAR 的 distractor 惩罚不仅抑制了显性的输入复制,也间接抑制了这种隐性的冗余 elaboration,使推理更加简洁、专注和可靠。

综合价值与局限

GEAR 的理论意义在于,它将长上下文推理中的重复复制问题从一种表面症状提升为一个可被形式化、可被优化的目标。在此之前,研究者通常将“重复生成”视为文本生成的一般性问题,或通过缩短推理长度来缓解“过度思考”。本文则指出,在长上下文场景下,重复复制的本质是 grounding 失败,是模型无法判断哪些信息值得被引用和加工。这一洞见为后续研究提供了一个新的概念工具:与其单纯追求减少复制,不如追求“有选择的复制”或“有根据的引用”。

从实践角度看,GEAR 的优势十分明显。它的奖励函数仅依赖 n-gram 统计与预先标注的证据区间,无需引入外部检索器、验证器或复杂的数据增强流程。这意味着它可以较容易地集成到现有的 RLVR 训练框架中,作为一种轻量级的奖励塑形方法。自动化的三阶段数据构建流程进一步降低了扩展门槛,使 GEAR 可以从任意文档语料中生成训练数据。对于需要处理长文档的法律、医疗、科研文献分析等应用场景,GEAR 提供了一条提升模型可靠性与效率的可行路径。

该论文的实验设计也颇具说服力。作者在诊断阶段使用了七种不同模型、四种上下文长度,并在训练阶段覆盖了三种模型规模与五种独立基准,结果表现出高度一致性。特别是 128k 上下文下优于 32k 的增益模式,强有力地证明了 GEAR 学到的是一种可泛化的 grounding 能力,而非对训练分布的过拟合。

然而,GEAR 也存在一些值得注意的局限。首先,它的有效性依赖于证据标注的质量。虽然作者提供了自动化的自然语言数据构建流程,但该流程本身依赖语言模型生成问题和验证答案,如果生成的问题存在歧义或验证环节出现错误,证据标注就会偏离真实分布,进而影响奖励信号的可靠性。其次,GEAR 将答案限制为单值形式(数字或实体短语),这虽然便于自动化奖励计算,但也限制了它可以处理的任务类型,例如需要开放式回答或多步论证的复杂任务。第三,论文主要基于 Qwen3.5 系列模型进行验证,尽管这些模型代表了当前开源长上下文模型的先进水平,但 GEAR 在其他架构(如 dense Transformer、MoE 变体、状态空间模型等)上的适用性仍有待进一步验证。最后,GEAR 的奖励系数与 n-gram 大小需要针对具体任务进行调优,虽然消融实验显示默认设置具有较好的鲁棒性,但在不同领域或不同上下文长度下,最优超参数可能会有所不同。

从更宏观的趋势来看,GEAR 与当前“让模型学会何时停止思考”“减少冗余推理”等研究方向相呼应,但它选择了一条更结构化的路径:不是简单地压缩推理长度,而是通过证据感知的奖励设计引导模型形成更好的信息处理策略。这一思路未来可能与检索增强生成、工具使用、结构化记忆等模块进一步结合,构建更加可靠的长上下文推理系统。

延伸阅读与思考

理解 GEAR 需要将其放在 RLVR、长上下文建模与重复生成三个交叉领域的文献网络中。在 RLVR 方向,DeepSeek-R1(Guo et al., 2025)奠定了“可验证奖励激发推理”的基础,GRPO(Shao et al., 2024)降低了训练成本,DAPO(Yu et al., 2025a)与 GSPO(Zheng et al., 2025)分别从不同角度改进了长 CoT 训练的稳定性。这些工作主要关注短上下文数学推理,而 GEAR 则把类似的思想推广到长上下文综合推理。

在长上下文 RL 训练方向,LongRLVR(Chen et al., 2026)与 GEAR 最为接近,两者都认识到仅使用答案奖励不足以保证模型有效利用上下文信息。LongRLVR 采用基于 chunk 级别 F1 的上下文奖励,而 GEAR 则进一步区分关键证据与干扰信息,在更细粒度上 shaping 复制行为。GoLongRL(Lv et al., 2026)、QwenLong(Wan et al., 2025; Shen et al., 2025)、LongR(Ping et al., 2026)和 LoongRL(Wang et al., 2025)提供了更多关于长上下文 RL 数据集构建、任务级奖励归一化、上下文密度奖励与数据增强的视角。对于希望深入了解长上下文评估的读者,Ruler(Hsieh et al., 2024)与 LongBench-v2(Bai et al., 2025)是不可或缺的基准。

在重复生成与过度思考方向,Li et al.(2023)、Yao et al.(2025)与 Mahaut & Franzon(2025)分别从数据、特征与机制角度解释了神经文本生成中的重复现象;Chen et al.(2024)与 Wu et al.(2025)则聚焦于推理模型的过度思考问题。Fang et al.(2025)进一步指出,在长上下文建模中并非所有 token 都同等重要,这一观点与 GEAR 强调“复制什么比复制多少更重要”高度一致。

未来研究方向上,GEAR 打开了几条值得探索的路径。首先,是否可以将证据 grounding 的思想推广到多轮对话、工具调用或多文档综合等更复杂的交互场景中?其次,当前的证据标注依赖于文本块级别的切分,更细粒度(如句子、命题甚至实体级别)的 grounding 是否能够带来更大的收益?第三,除了 n-gram 重叠,是否存在更语义化的 grounding 度量方式,例如基于嵌入相似度或逻辑蕴含关系的奖励?第四,GEAR 的 distractor 惩罚是否可以与现有的“减少过度思考”方法结合,形成一种更全面的推理效率优化框架?

最深层的开放问题或许是:当模型面对远超其训练长度的上下文时,它是否真正“理解”了所引用的证据,还是只是学会了在统计上更合理地搬运文本?GEAR 提供了一种让搬运行为更有纪律的方法,但长上下文推理的根本挑战仍然是信息选择、整合与抽象化能力。这项工作让我最受启发的是,它把一种看似“行为层面”的问题——重复复制——重新表述为“能力层面”的问题——证据 grounding,从而用一个简洁的奖励函数实现了显著且可解释的效果。如果要进一步探索,我会特别关注 GEAR 在需要开放式生成或多步论证任务上的表现,以及它是否能与外部检索或记忆模块协同,构建真正可扩展的长上下文智能。

Topics:

Powered by Forestry.md