DemoPSD: Disagreement-Modulated Policy Self-Distillation

基本信息


研究摘要

在大语言模型(Large Language Models, LLMs)的后训练(post-training)阶段,如何教会模型进行深度推理已成为当前人工智能研究的核心议题之一。强化学习结合可验证奖励(Reinforcement Learning with Verifiable Rewards, RLVR)作为这一方向的主流范式,虽然取得了显著成效,却面临一个根本性的瓶颈:标准的RLVR方法将整条推理轨迹(rollout)的稀疏二元奖励均匀分配给每一个生成 token,导致模型无法分辨哪些 token 真正贡献了推理的成功或失败。这种粗粒度的信用分配(credit assignment)问题严重限制了模型学习效率的提升。为了缓解这一困境,业界逐渐将目光投向了策略自蒸馏(On-Policy Self-Distillation, OPSD)这一新兴范式,即让同一个模型同时扮演教师(teacher)和学生(student)的角色:教师模型在获取到特权信息(如标准答案或已验证的推理路径)的条件下生成密集、逐 token 的监督信号,而学生模型仅基于原始问题生成推理轨迹,并学习模仿教师的分布。然而,正如近期研究所揭示的,这种看似优雅的方案隐藏着一个致命的陷阱——特权信息泄漏(privileged information leakage)。

特权信息泄漏的核心问题在于:教师模型在条件化于标准答案 y 后,其输出分布在某些 token 位置上已经不再是纯粹的可迁移推理策略,而是被答案直接塑造出的"捷径"。当学生模型被强制逐 token 匹配这种特权条件分布时,它会不自觉地编码问题与答案之间的直接关联,而非学习到可泛化的推理能力。这种泄漏在训练初期可能表现为快速收敛,因为答案相关的捷径确实能提升准确率;但随着训练深入,学生模型逐渐丧失自主探索能力,表现为策略熵(policy entropy)急剧下降,同时在跨领域测试集上性能显著退化。因此,如何在保留密集 token 级监督优势的同时,避免特权信息泄漏,构成了本文要解决的核心问题。

本文提出的 DemoPSD(Disagreement-Modulated Policy Self-Distillation)框架,其理论洞察在于重新审视蒸馏目标的本质。作者们认识到,并非所有 token 位置上的教师分布都是不可信的——只有当教师与学生之间的分布出现显著分歧时,才意味着特权信息正在扭曲教师的输出。基于这一洞察,DemoPSD 引入了一种"选择性采纳教师指导"的原则:当教师与学生的分布保持合理一致时,学生可以放心地跟随教师学习;当二者分歧显著时,系统则自动将蒸馏目标向学生自身的分布偏移,以削弱特权信息的影响。这一原则通过反向 KL 重心(reverse-KL barycenter)目标实现,该目标在教师分布与学生分布之间进行几何插值,插值的权重由每个 token 位置上的分布分歧程度自适应控制。这种方法的精妙之处在于,它并不简单地抛弃教师信号,而是根据实时的分歧度量动态调整信任程度,从而在保留密集监督与防止信息泄漏之间取得平衡。

实验结果表明,DemoPSD 在 SciKnowEval 的四个科学领域(生物学、化学、材料科学、物理学)上均显著优于标准 GRPO 和 SDPO 基线,平均在 mean@16 指标上提升 1.68 个百分点,在 best@16 指标上提升 2.82 个百分点。更重要的是,DemoPSD 在整个训练过程中保持了比 SDPO 高 33% 至 98% 的策略熵,并且在跨领域泛化测试集 GPQA Extended 上展现出稳健的持续提升能力,而 SDPO 则出现明显的早期峰值后衰退现象。这些发现表明,DemoPSD 不仅在准确率上取得优势,更从根本上保护了模型的探索能力,为解决 OPSD 中的特权信息泄漏问题提供了新的理论视角和实践路径。

理论框架

要深入理解 DemoPSD 的理论贡献,我们需要追溯其思想脉络。该工作建立在两条相互交织的研究线索之上:一是强化学习中的信用分配问题,二是知识蒸馏与自蒸馏的理论传统。在 RLVR 范式中,GRPO(Group Relative Policy Optimization)通过组内相对优势估计来优化策略,但其奖励信号仅在轨迹级别给出,无法为每个 token 提供细粒度的反馈。这种稀疏性导致模型在训练后期容易陷入低熵的确定性策略,丧失探索多样性。On-Policy Distillation(OPD)及其自蒸馏变体 OPSD 则试图引入密集监督:学生模型在自己的采样轨迹上接收来自教师模型的逐 token 分布信号。然而,Hübotter 等人在 SDPO(Self-Distilled Policy Optimization)框架中揭示了这种密集监督的暗面——当教师条件化于学生不可见的特权信息时,蒸馏目标本身携带了不可消除的互信息泄漏。

Yang 等人(2026)从理论上严格刻画了这种泄漏:在 OPSD 的设定下,学生模型永远无法完美匹配教师的条件分布,因为目标中存在着不可约的互信息间隙 I(yt;y|x,y<t)>0。这个条件互信息表明,即使在给定问题 x 和已生成前缀 y<t 的条件下,标准答案 y 仍然为预测下一个 token yt 提供了额外信息。这个间隙直接转化为梯度中的特权偏差项,迫使学生编码 xy 的捷径关联。泄漏的危险之处在于,训练初期这种偏差被有益梯度所掩盖,表现为快速奖励提升;但当学生逐渐接近教师的边际分布时,偏差项占据主导,导致模型在训练集上持续过拟合,而在分布外测试上性能衰减。

面对这一理论困境,DemoPSD 的核心创新在于将蒸馏目标从"无条件匹配教师"转变为"基于分歧的适应性匹配"。作者提出用反向 KL 散度(reverse KL divergence)而非正向 KL 来定义重心(barycenter),这是因为反向 KL 具有 mode-seeking 特性,倾向于将目标分布集中在学生与教师共同支持的模式上,而非在二者之间做平均导致的模糊扩散。具体而言,给定教师分布 πTt(v,y) 和学生分布 πSt(v),DemoPSD 的插值目标定义为:

πtargetαt(v|x,y,y^<t)(πTt(v,y))1αt(πSt(v))αt

其中 αt 是逐 token 的泄漏衰减系数(leakage attenuation coefficient),衡量该位置上教师分布受特权信息影响的程度。这个目标分布等价于以下优化问题的解:

πtargetαt=argminqΔ(V){(1αt)KL(qπTt)+αtKL(qπSt)}

这正是两个分布关于反向 KL 的加权重心,权重由分歧程度决定。该公式揭示了一个深刻的理论直觉:当分歧系数 αt 接近 0 时,目标回归为教师分布,此时学生可以充分利用教师的密集指导;当 αt 增大时,目标向学生分布偏移,保护学生的自主推理能力。这种几何混合(geometric mixture)相比算术混合的优势在于,它要求一个 token 必须同时获得教师和学生双方的支持才能获得显著的目标概率质量,从而自然抑制了仅被教师偏好但学生认为极低概率的 token。

为了量化分歧,DemoPSD 采用 Jensen-Shannon 散度(JSD)作为度量标准:

dt=JSD(πStπTt)=12KL(πStmt)+12KL(πTtmt),mt=12(πSt+πTt)

然后通过一个重标度的 sigmoid 函数将分歧映射为泄漏衰减系数:

αt=(σ(βdt)0.5)2αmax

其中 β 控制门控的灵敏度,αmax 是上限超参数。这个函数满足关键性质:f(0)=0(无分歧时完全信任教师),单调递增(分歧越大越不信任),以及饱和特性(极端分歧不会完全抛弃教师信号)。这些理论设计保证了 DemoPSD 在保持密集监督的同时,具备可控的泄漏抑制机制。

技术架构

DemoPSD 的完整技术实现是一个精心设计的训练流程,它将上述理论构想转化为可操作的算法。整个系统的核心可以概括为"检测分歧—自适应插值—稳定训练"三大环节。在实际运行时,算法首先基于当前策略模型生成一批推理轨迹,然后通过重提示(reprompting)机制构建特权上下文,接着计算逐 token 的教师-学生分歧,最后根据分歧程度构建自适应的蒸馏目标并执行梯度更新。

数据流在整个系统中呈现出清晰的双路径结构。对于每一个训练问题 x,学生路径仅接收问题文本,模型生成推理轨迹 y^πθ(|x)。教师路径则接收扩展后的上下文,其中包含问题、特权信息(标准答案或正确推理轨迹)以及学生已生成的前缀:[Question:x|Privileged:y|Student Response:y^<t]。这种设计使得同一个模型权重在两种不同上下文条件下分别输出学生分布和教师分布。值得注意的是,教师分布的计算是在学生分布计算的基础上,仅追加特权信息作为额外上下文,因此二者具有天然的关联性,这也为后续的对比分析奠定了基础。

重提示机制(reprompting mechanism)是构建特权上下文的关键工程环节。对于每个提示组,如果组内至少存在一条正确的推理轨迹,则系统随机选择其中一条作为 y 并插入教师上下文;若没有任何正确轨迹,则该提示组被跳过,不参与蒸馏。这一设计隐含了重要的工程直觉:错误轨迹中蕴含的信息可能具有误导性,只有验证为正确的推理才能作为可靠的特权信息。正如 Hübotter 等人(2026)所论证的,模型对重提示模板的语法变体并不敏感,因此 DemoPSD 采用了与 SDPO 类似的模板实现。

分歧计算模块是整个架构的核心创新点。对于每个 token 位置 t,系统提取学生模型输出的 top-k=100 个 token 索引,并计算这些 token 上教师模型和学生模型的概率分布。然后基于这两个分布计算 JSD 分歧 dt。为了数值稳定性,所有概率值被截断至 108 的下限,避免在对数计算中出现负无穷。分歧随后被映射为泄漏衰减系数 αt,最终构建几何混合的目标分布。需要强调的是,目标分布、教师分布、学生分布以及权重系数在反向传播过程中全部被 stop-gradient 处理,这意味着它们作为固定目标指导学生策略的更新,而学生策略的梯度仅通过其自身对目标分布的匹配程度流动。

在损失函数层面,DemoPSD 最小化学生分布与目标分布之间的反向 KL 散度:

LDemoPSD(θ)=ExDEy^πθ(|x)[t=1|y^|KL(πθ(|x,y^<t)stopgrad(πtargetαt(|x,y,y^<t)))]

这个损失函数的梯度具有简洁而优雅的形式:

θLDemoPSD=Ey^πθ(|x)t=1|y^|[Ey^tπθ(|x,y^<t)(1αt)logπθ(y^t|x,y^<t)πθ(y^t|x,y,y^<t)θlogπθ(y^t|x,y^<t)]

从梯度公式中可以清晰地看到,(1αt) 因子直接放缩了教师诱导的对数比率信号。在分歧较大的位置,αt 较大,(1αt) 较小,从而削弱了特权信息偏差的传播;在分歧较小的位置,(1αt) 接近 1,保留了完整的蒸馏信号。这种基于梯度的衰减机制与损失函数层面的几何插值形成了一致的理论闭环。

为了训练稳定性,DemoPSD 还引入了指数移动平均(EMA)副本。在计算分歧和目标分布时,使用一个独立的 EMA 学生模型 πθ¯,其更新率为 η=0.05。这避免了使用当前策略直接计算目标分布时可能出现的反馈循环,使得监督信号更加稳定。此外,系统采用 top-k 蒸馏来降低内存开销:仅保留学生输出的 top-100 个 token 概率进行计算,其余质量归入一个尾部桶(tail bucket),将每位置的内存复杂度从词汇表大小 O(|V|) 降至 O(k)。重要性采样比率被裁剪至 2.0,防止策略更新过程中的剧烈震荡。当特权提示长度超过最大限制(10,240 tokens)时,系统从右侧截断演示内容,保留系统前缀和用户前缀,这一设计确保了长推理轨迹场景下的训练连续性,也与 SDPO 在溢出时报错的策略形成了对比。

实验评估

DemoPSD 的实验设计围绕三个核心问题展开:该方法能否在领域内基准上提升推理准确率?它能否在训练过程中保持足够的探索熵?以及它能否在分布外任务上展现出更强的泛化能力?为了回答这些问题,作者在 SciKnowEval 的四个科学领域(生物学、化学、材料科学、物理学)上进行了系统评估,并与 GRPO 和 SDPO 两个强基线进行了严格对比。

实验采用 Qwen3-4B-Instruct 作为基础模型,这是一个中等规模的指令微调模型,足以检验训练方法的有效性而不会受到模型自身能力的过度干扰。训练数据来自 SciKnowEval 的多领域科学推理基准,其题目形式为四选一多项选择题。每个领域独立训练,分别评估。对于分布外泛化测试,作者选用了 GPQA Extended,这是一组研究生级别的科学问题,在题型、难度和风格上与 SciKnowEval 存在显著差异,从而构成了严格的泛化测试。评估时,对每个测试提示采样 16 条推理轨迹,并报告三个互补指标:mean@16(16 条轨迹的平均准确率)、maj@16(多数投票准确率)以及 best@16(最佳轨迹准确率)。这三个指标分别反映了模型的平均表现、共识一致性和探索潜力。

从领域内结果来看,DemoPSD 在所有四个领域和全部三项指标上均取得最佳表现。在表 1 中,DemoPSD 在平均 mean@16 上达到 65.10,比 SDPO 的 63.42 高出 1.68 个百分点,比 GRPO 的 60.49 高出 4.61 个百分点。这一差距在 best@16 指标上更为显著:DemoPSD 的 82.12 比 SDPO 的 79.30 高出 2.82 个百分点,比 GRPO 的 75.42 高出 6.70 个百分点。best@16 的大幅提升尤为值得关注,因为它表明 DemoPSD 通过保留更高的策略熵,使得在 16 次采样中更有机会探索到高质量的推理路径。相比之下,SDPO 虽然通过密集监督在初期获得较快进展,但其策略熵的过早崩溃限制了最终能达到的推理上限。在生物学和物理学领域,DemoPSD 相对于 SDPO 的提升最为明显,这可能反映了这些领域问题的推理路径更加多样,对策略熵的保持更为敏感。

Domain Method mean@16 maj@16 best@16
Biology GRPO 33.51 34.84 58.36
Biology SDPO 36.88 38.07 64.04
Biology DemoPSD 39.25 40.64 68.51
Chemistry GRPO 65.83 66.72 80.47
Chemistry SDPO 71.70 72.41 85.94
Chemistry DemoPSD 72.98 73.71 90.05
Material GRPO 76.32 76.50 80.24
Material SDPO 76.13 76.24 81.69
Material DemoPSD 76.53 76.71 81.79
Physics GRPO 66.31 70.52 82.59
Physics SDPO 68.98 71.88 85.51
Physics DemoPSD 71.64 74.24 88.13
Average GRPO 60.49 62.14 75.42
Average SDPO 63.42 64.65 79.30
Average DemoPSD 65.10 66.33 82.12

分布外泛化测试的结果揭示了更为深刻的差异。在 GPQA Extended 的三个领域(生物学、化学、物理学)上,SDPO 在训练初期达到最佳分布外准确率,但随后在所有三个领域均出现持续退化。以化学领域为例,SDPO 的准确率从早期的 40.45 下降至最终的 28.62,降幅超过 11 个百分点。这种退化模式与特权信息泄漏的理论预测完全一致:随着训练进行,SDPO 学生模型越来越依赖训练集内的答案捷径,丧失了处理新颖问题的推理灵活性。与之形成鲜明对比的是,DemoPSD 在整个训练过程中保持了稳定的分布外性能,并最终在平均准确率上达到 54.38,比 SDPO 的 46.47 高出 7.91 个百分点。这一结果强有力地证明了选择性采纳教师指导的策略能够有效防止领域内过拟合,从而保留模型的可迁移推理能力。

训练动态分析进一步揭示了 DemoPSD 取得优势的内在机制。表 3 显示,在训练结束时,DemoPSD 在所有领域都保持了显著高于 SDPO 的策略熵,提升幅度从 32.7%(物理学)到 98.0%(材料科学)不等。材料科学领域的极端对比尤为引人注目:SDPO 的熵降至 0.150,几乎濒临熵崩溃(entropy collapse),而 DemoPSD 仍维持在 0.297 的合理水平。这意味着 SDPO 在该领域已经退化到接近确定性输出的策略,几乎失去了探索不同推理路径的能力。与此同时,平均泄漏衰减系数 α¯t 在所有领域保持在 0.033 到 0.055 的较低水平,说明目标分布在大部分 token 上仍然接近教师分布,只有在少数高分歧位置才显著向学生偏移。这种稀疏但精准的分歧响应正是 DemoPSD 设计的精髓:它不需要全局性地削弱教师信号,而是在需要保护的特定位置上施加选择性干预。

Domain Method Entropy Δ Ent. mean α¯t mean d¯t Active %
Biology SDPO 0.602
Biology DemoPSD 0.816 +35.5% 0.055 0.046 64.8
Chemistry SDPO 0.322
Chemistry DemoPSD 0.555 +72.4% 0.036 0.037 84.0
Material SDPO 0.150
Material DemoPSD 0.297 +98.0% 0.033 0.031 68.8
Physics SDPO 0.385
Physics DemoPSD 0.511 +32.7% 0.040 0.026 90.6

在超参数敏感性方面,β 作为控制分歧响应灵敏度的关键参数,其最优值在不同领域间有所差异。材料科学和化学领域(分歧较小)倾向于较高的 β(50-100),以放大微弱的分歧信号;而生物学领域(分歧较大)则更适合较低的 β(25-70),避免过度激进的衰减。在 β[25,100] 的整个范围内,DemoPSD 始终与 SDPO 持平或更优,展现出对超参数的适度鲁棒性。所有最优配置均采用了重映射的 α 调度策略,即将 αt 约束在 [0,αmax] 范围内,确保教师分布至少保留 (1αmax) 的混合权重,从而避免了极端情况下完全丢失教师信号的风险。

综合价值与局限

从理论层面审视,DemoPSD 为 on-policy self-distillation 领域提供了一个重要的概念性突破。它首次将"教师-学生分布分歧"作为 privileged information leakage 的直接度量标准,并以此为基础构建了自适应的蒸馏目标。此前的各种缓解方法——如 RLSD 的幅度估计限制、HDPO 的悬崖提示限制、EGRSD 的熵门控、SRPO 的样本路由、DASD 的熵导向监督——虽然共享"并非所有 token 都同等可信"的直觉,但它们都依赖于间接代理(如教师熵、样本正确性、学生熵或多教师共识),而非直接测量特权信息对教师分布的影响程度。DemoPSD 通过 JSD 分歧直接度量这种影响,使得泄漏抑制更加精准和可解释。反向 KL 重心的几何混合形式也在理论上独具匠心,它避免了算术混合导致的模式平均(mode-averaging)问题,使目标分布更加锐聚焦在学生与教师共同支持的推理路径上。

从实践应用的角度,DemoPSD 的潜在价值在于它为科学推理、数学证明、代码生成等需要深度推理的领域提供了更可靠的训练方法。在这些领域,模型的探索能力直接影响其发现新颖解决方案的潜力,而特权信息泄漏导致的策略熵崩溃会严重限制这种创新潜力。DemoPSD 通过保持 35% 至 98% 的熵增益,使得模型在训练后期仍能探索多样化的推理路径,这对于需要多步推理的问题尤为关键。此外,该方法在 4B 参数规模的模型上即展现出显著优势,意味着其改进并不依赖于超大规模模型的容量冗余,而是源于训练范式的根本性优化,这使得它在资源受限的研究和工业场景中同样具有吸引力。

然而,我们也需要诚实地审视该工作的局限性。首先,DemoPSD 的超参数调优需要针对不同领域单独进行 β 的搜索,这增加了实际部署的复杂度。虽然实验显示在一定范围内方法表现鲁棒,但最优 β 的选择与领域分歧特性相关,这种依赖性可能使得自动化超参数优化成为必要。其次,理论分析中的协方差条件(Covariance Condition)——即要求特权偏差与学生对数概率正相关——虽然在自蒸馏设定中自然成立(因为教师与学生共享模型权重),但在更一般的跨模型蒸馏场景中可能需要额外的验证。此外,实验仅覆盖了四选一多项选择题形式的科学推理,对于开放式生成任务(如自由形式数学证明、长文本推理链)的有效性仍需进一步验证。

从更广泛的视角来看,DemoPSD 的意义可能超越了自蒸馏领域本身。它提出的"选择性信任"原则——即在模型训练中根据实时分歧动态调整对监督信号的采纳程度——为更广泛的人机协作学习场景提供了启示。在教师-学生框架中,当教师的判断可能受到不可观测因素扭曲时,如何让学生保持适度的批判性自主,而非盲目服从,这一原则或许可以迁移到其他需要防止信息泄漏或分布偏移的学习场景中。当然,这也引出了更深层的开放问题:如果特权信息不仅来自标准答案,还可能来自其他隐性的环境偏差(如训练数据中的注释者偏见、领域特定先验),如何设计更通用的分歧度量来检测和衰减这些更隐蔽的"泄漏"?

延伸阅读与思考

要深入理解 DemoPSD 的理论根基,有几项工作是不可或缺的起点。首先是 Hübotter 等人(2026)提出的 SDPO(Self-Distilled Policy Optimization),它首次系统地将自蒸馏框架与 RLVR 结合,建立了密集 token 级监督的基本范式。其次是 Yang 等人(2026)对自蒸馏中 privileged information leakage 的理论分析,该工作严格证明了互信息间隙的不可消除性,为后续所有缓解方法提供了问题定义。在更广泛的 on-policy distillation 领域,Agarwal 等人(2024)的 GKD 和 Gu 等人(2024)的 MiniLLM 奠定了 on-policy 训练优于 off-policy 训练的理论基础,而 Ross 等人(2011)在模仿学习中对 compounding error 的经典分析则为 OPD 的必要性提供了早期论证。

在同期竞争方法中,DASD(Zhang et al., 2026)提出的方向自适应监督与 DemoPSD 最为接近,但 DASD 根据蒸馏信号的方向而非分歧大小来调节监督强度,其响应机制相对间接。GATES(Stein et al., 2026)通过多教师共识来缓解单一教师的偏见,这种方法在教师多样性足够时有效,但计算成本更高。AMiD(Shin et al., 2026)虽然引入了 α-mixture 分布,但其应用场景是一般知识蒸馏而非特权自蒸馏。DAPO(Yu et al., 2026a)和 EntroPIC(Yang et al., 2025)从系统层面关注大规模训练中的熵稳定性,与 DemoPSD 在保持探索能力上形成互补。

展望未来,DemoPSD 开启的研究方向至少包括以下三个方面。第一,将分歧度量从 token 级扩展到更粗粒度的结构级(如短语、推理步骤或子目标),可能使得泄漏检测在更高抽象层次上发挥作用。第二,探索无超参数或自适应的超参数选择策略,如基于训练动态的 β 自动调整,以减少领域调优负担。第三,将 DemoPSD 的原则扩展到多模态推理场景,其中特权信息可能以图像、公式或代码注释的形式存在,而非纯文本答案。

最引人深思的或许是 DemoPSD 触及的一个深层哲学问题:在机器学习中,"教师"与"学生"的理想关系究竟是什么?传统的知识蒸馏假设教师总是更优的,学生应尽可能复制教师。但 DemoPSD 揭示了一个更复杂的图景:当教师拥有学生不可见的特权信息时,完全复制反而是有害的。真正的理想关系或许是"批判性继承"——学生在学习的同时保持独立的判断能力,只在判断教师信号可信时才采纳。这种视角不仅为 LLM 训练提供了新方法,也为思考人机协作、知识传递乃至教育哲学提供了有趣的隐喻。在 AGI 探索的道路上,如何让模型既善于学习又保持独立的推理能力,可能是一个比单纯的性能优化更为根本的课题。DemoPSD 用严谨的数学和扎实的实验为这一课题迈出了重要一步,但它留下的开放空间——如何设计更普适的自主判断机制,如何平衡继承与创新——可能正是未来研究最有价值的方向。

Topics:


笔记创建时间: 2026-07-06
阅读方式: L2 深度阅读

Powered by Forestry.md