DemoPSD: Disagreement-Modulated Policy Self-Distillation
基本信息
- 标题: DemoPSD: Disagreement-Modulated Policy Self-Distillation
- 第一作者: Yunhe Li (City University of Hong Kong)
- 研究团队: City University of Hong Kong, Tsinghua University, Shenzhen University of Advanced Technology, Chinese University of Hong Kong, Shenzhen
- 会议/期刊: arXiv:2607.02502v1 [cs.LG], 2026
- 代码: (未公开)
- PDF 文件: [DemoPSD](file:///C:/Users/admin/.openclaw/workspace/attachment/papers/20260706_demopsd_disagreement_modulated_policy_self_distillation.pdf)
研究摘要
在大语言模型(Large Language Models, LLMs)的后训练(post-training)阶段,如何教会模型进行深度推理已成为当前人工智能研究的核心议题之一。强化学习结合可验证奖励(Reinforcement Learning with Verifiable Rewards, RLVR)作为这一方向的主流范式,虽然取得了显著成效,却面临一个根本性的瓶颈:标准的RLVR方法将整条推理轨迹(rollout)的稀疏二元奖励均匀分配给每一个生成 token,导致模型无法分辨哪些 token 真正贡献了推理的成功或失败。这种粗粒度的信用分配(credit assignment)问题严重限制了模型学习效率的提升。为了缓解这一困境,业界逐渐将目光投向了策略自蒸馏(On-Policy Self-Distillation, OPSD)这一新兴范式,即让同一个模型同时扮演教师(teacher)和学生(student)的角色:教师模型在获取到特权信息(如标准答案或已验证的推理路径)的条件下生成密集、逐 token 的监督信号,而学生模型仅基于原始问题生成推理轨迹,并学习模仿教师的分布。然而,正如近期研究所揭示的,这种看似优雅的方案隐藏着一个致命的陷阱——特权信息泄漏(privileged information leakage)。
特权信息泄漏的核心问题在于:教师模型在条件化于标准答案
本文提出的 DemoPSD(Disagreement-Modulated Policy Self-Distillation)框架,其理论洞察在于重新审视蒸馏目标的本质。作者们认识到,并非所有 token 位置上的教师分布都是不可信的——只有当教师与学生之间的分布出现显著分歧时,才意味着特权信息正在扭曲教师的输出。基于这一洞察,DemoPSD 引入了一种"选择性采纳教师指导"的原则:当教师与学生的分布保持合理一致时,学生可以放心地跟随教师学习;当二者分歧显著时,系统则自动将蒸馏目标向学生自身的分布偏移,以削弱特权信息的影响。这一原则通过反向 KL 重心(reverse-KL barycenter)目标实现,该目标在教师分布与学生分布之间进行几何插值,插值的权重由每个 token 位置上的分布分歧程度自适应控制。这种方法的精妙之处在于,它并不简单地抛弃教师信号,而是根据实时的分歧度量动态调整信任程度,从而在保留密集监督与防止信息泄漏之间取得平衡。
实验结果表明,DemoPSD 在 SciKnowEval 的四个科学领域(生物学、化学、材料科学、物理学)上均显著优于标准 GRPO 和 SDPO 基线,平均在 mean@16 指标上提升 1.68 个百分点,在 best@16 指标上提升 2.82 个百分点。更重要的是,DemoPSD 在整个训练过程中保持了比 SDPO 高 33% 至 98% 的策略熵,并且在跨领域泛化测试集 GPQA Extended 上展现出稳健的持续提升能力,而 SDPO 则出现明显的早期峰值后衰退现象。这些发现表明,DemoPSD 不仅在准确率上取得优势,更从根本上保护了模型的探索能力,为解决 OPSD 中的特权信息泄漏问题提供了新的理论视角和实践路径。
理论框架
要深入理解 DemoPSD 的理论贡献,我们需要追溯其思想脉络。该工作建立在两条相互交织的研究线索之上:一是强化学习中的信用分配问题,二是知识蒸馏与自蒸馏的理论传统。在 RLVR 范式中,GRPO(Group Relative Policy Optimization)通过组内相对优势估计来优化策略,但其奖励信号仅在轨迹级别给出,无法为每个 token 提供细粒度的反馈。这种稀疏性导致模型在训练后期容易陷入低熵的确定性策略,丧失探索多样性。On-Policy Distillation(OPD)及其自蒸馏变体 OPSD 则试图引入密集监督:学生模型在自己的采样轨迹上接收来自教师模型的逐 token 分布信号。然而,Hübotter 等人在 SDPO(Self-Distilled Policy Optimization)框架中揭示了这种密集监督的暗面——当教师条件化于学生不可见的特权信息时,蒸馏目标本身携带了不可消除的互信息泄漏。
Yang 等人(2026)从理论上严格刻画了这种泄漏:在 OPSD 的设定下,学生模型永远无法完美匹配教师的条件分布,因为目标中存在着不可约的互信息间隙
面对这一理论困境,DemoPSD 的核心创新在于将蒸馏目标从"无条件匹配教师"转变为"基于分歧的适应性匹配"。作者提出用反向 KL 散度(reverse KL divergence)而非正向 KL 来定义重心(barycenter),这是因为反向 KL 具有 mode-seeking 特性,倾向于将目标分布集中在学生与教师共同支持的模式上,而非在二者之间做平均导致的模糊扩散。具体而言,给定教师分布
其中
这正是两个分布关于反向 KL 的加权重心,权重由分歧程度决定。该公式揭示了一个深刻的理论直觉:当分歧系数
为了量化分歧,DemoPSD 采用 Jensen-Shannon 散度(JSD)作为度量标准:
然后通过一个重标度的 sigmoid 函数将分歧映射为泄漏衰减系数:
其中
技术架构
DemoPSD 的完整技术实现是一个精心设计的训练流程,它将上述理论构想转化为可操作的算法。整个系统的核心可以概括为"检测分歧—自适应插值—稳定训练"三大环节。在实际运行时,算法首先基于当前策略模型生成一批推理轨迹,然后通过重提示(reprompting)机制构建特权上下文,接着计算逐 token 的教师-学生分歧,最后根据分歧程度构建自适应的蒸馏目标并执行梯度更新。
数据流在整个系统中呈现出清晰的双路径结构。对于每一个训练问题
重提示机制(reprompting mechanism)是构建特权上下文的关键工程环节。对于每个提示组,如果组内至少存在一条正确的推理轨迹,则系统随机选择其中一条作为
分歧计算模块是整个架构的核心创新点。对于每个 token 位置
在损失函数层面,DemoPSD 最小化学生分布与目标分布之间的反向 KL 散度:
这个损失函数的梯度具有简洁而优雅的形式:
从梯度公式中可以清晰地看到,
为了训练稳定性,DemoPSD 还引入了指数移动平均(EMA)副本。在计算分歧和目标分布时,使用一个独立的 EMA 学生模型
实验评估
DemoPSD 的实验设计围绕三个核心问题展开:该方法能否在领域内基准上提升推理准确率?它能否在训练过程中保持足够的探索熵?以及它能否在分布外任务上展现出更强的泛化能力?为了回答这些问题,作者在 SciKnowEval 的四个科学领域(生物学、化学、材料科学、物理学)上进行了系统评估,并与 GRPO 和 SDPO 两个强基线进行了严格对比。
实验采用 Qwen3-4B-Instruct 作为基础模型,这是一个中等规模的指令微调模型,足以检验训练方法的有效性而不会受到模型自身能力的过度干扰。训练数据来自 SciKnowEval 的多领域科学推理基准,其题目形式为四选一多项选择题。每个领域独立训练,分别评估。对于分布外泛化测试,作者选用了 GPQA Extended,这是一组研究生级别的科学问题,在题型、难度和风格上与 SciKnowEval 存在显著差异,从而构成了严格的泛化测试。评估时,对每个测试提示采样 16 条推理轨迹,并报告三个互补指标:mean@16(16 条轨迹的平均准确率)、maj@16(多数投票准确率)以及 best@16(最佳轨迹准确率)。这三个指标分别反映了模型的平均表现、共识一致性和探索潜力。
从领域内结果来看,DemoPSD 在所有四个领域和全部三项指标上均取得最佳表现。在表 1 中,DemoPSD 在平均 mean@16 上达到 65.10,比 SDPO 的 63.42 高出 1.68 个百分点,比 GRPO 的 60.49 高出 4.61 个百分点。这一差距在 best@16 指标上更为显著:DemoPSD 的 82.12 比 SDPO 的 79.30 高出 2.82 个百分点,比 GRPO 的 75.42 高出 6.70 个百分点。best@16 的大幅提升尤为值得关注,因为它表明 DemoPSD 通过保留更高的策略熵,使得在 16 次采样中更有机会探索到高质量的推理路径。相比之下,SDPO 虽然通过密集监督在初期获得较快进展,但其策略熵的过早崩溃限制了最终能达到的推理上限。在生物学和物理学领域,DemoPSD 相对于 SDPO 的提升最为明显,这可能反映了这些领域问题的推理路径更加多样,对策略熵的保持更为敏感。
| Domain | Method | mean@16 | maj@16 | best@16 |
|---|---|---|---|---|
| Biology | GRPO | 33.51 | 34.84 | 58.36 |
| Biology | SDPO | 36.88 | 38.07 | 64.04 |
| Biology | DemoPSD | 39.25 | 40.64 | 68.51 |
| Chemistry | GRPO | 65.83 | 66.72 | 80.47 |
| Chemistry | SDPO | 71.70 | 72.41 | 85.94 |
| Chemistry | DemoPSD | 72.98 | 73.71 | 90.05 |
| Material | GRPO | 76.32 | 76.50 | 80.24 |
| Material | SDPO | 76.13 | 76.24 | 81.69 |
| Material | DemoPSD | 76.53 | 76.71 | 81.79 |
| Physics | GRPO | 66.31 | 70.52 | 82.59 |
| Physics | SDPO | 68.98 | 71.88 | 85.51 |
| Physics | DemoPSD | 71.64 | 74.24 | 88.13 |
| Average | GRPO | 60.49 | 62.14 | 75.42 |
| Average | SDPO | 63.42 | 64.65 | 79.30 |
| Average | DemoPSD | 65.10 | 66.33 | 82.12 |
分布外泛化测试的结果揭示了更为深刻的差异。在 GPQA Extended 的三个领域(生物学、化学、物理学)上,SDPO 在训练初期达到最佳分布外准确率,但随后在所有三个领域均出现持续退化。以化学领域为例,SDPO 的准确率从早期的 40.45 下降至最终的 28.62,降幅超过 11 个百分点。这种退化模式与特权信息泄漏的理论预测完全一致:随着训练进行,SDPO 学生模型越来越依赖训练集内的答案捷径,丧失了处理新颖问题的推理灵活性。与之形成鲜明对比的是,DemoPSD 在整个训练过程中保持了稳定的分布外性能,并最终在平均准确率上达到 54.38,比 SDPO 的 46.47 高出 7.91 个百分点。这一结果强有力地证明了选择性采纳教师指导的策略能够有效防止领域内过拟合,从而保留模型的可迁移推理能力。
训练动态分析进一步揭示了 DemoPSD 取得优势的内在机制。表 3 显示,在训练结束时,DemoPSD 在所有领域都保持了显著高于 SDPO 的策略熵,提升幅度从 32.7%(物理学)到 98.0%(材料科学)不等。材料科学领域的极端对比尤为引人注目:SDPO 的熵降至 0.150,几乎濒临熵崩溃(entropy collapse),而 DemoPSD 仍维持在 0.297 的合理水平。这意味着 SDPO 在该领域已经退化到接近确定性输出的策略,几乎失去了探索不同推理路径的能力。与此同时,平均泄漏衰减系数
| Domain | Method | Entropy | mean |
mean |
Active % | |
|---|---|---|---|---|---|---|
| Biology | SDPO | 0.602 | — | — | — | — |
| Biology | DemoPSD | 0.816 | +35.5% | 0.055 | 0.046 | 64.8 |
| Chemistry | SDPO | 0.322 | — | — | — | — |
| Chemistry | DemoPSD | 0.555 | +72.4% | 0.036 | 0.037 | 84.0 |
| Material | SDPO | 0.150 | — | — | — | — |
| Material | DemoPSD | 0.297 | +98.0% | 0.033 | 0.031 | 68.8 |
| Physics | SDPO | 0.385 | — | — | — | — |
| Physics | DemoPSD | 0.511 | +32.7% | 0.040 | 0.026 | 90.6 |
在超参数敏感性方面,
综合价值与局限
从理论层面审视,DemoPSD 为 on-policy self-distillation 领域提供了一个重要的概念性突破。它首次将"教师-学生分布分歧"作为 privileged information leakage 的直接度量标准,并以此为基础构建了自适应的蒸馏目标。此前的各种缓解方法——如 RLSD 的幅度估计限制、HDPO 的悬崖提示限制、EGRSD 的熵门控、SRPO 的样本路由、DASD 的熵导向监督——虽然共享"并非所有 token 都同等可信"的直觉,但它们都依赖于间接代理(如教师熵、样本正确性、学生熵或多教师共识),而非直接测量特权信息对教师分布的影响程度。DemoPSD 通过 JSD 分歧直接度量这种影响,使得泄漏抑制更加精准和可解释。反向 KL 重心的几何混合形式也在理论上独具匠心,它避免了算术混合导致的模式平均(mode-averaging)问题,使目标分布更加锐聚焦在学生与教师共同支持的推理路径上。
从实践应用的角度,DemoPSD 的潜在价值在于它为科学推理、数学证明、代码生成等需要深度推理的领域提供了更可靠的训练方法。在这些领域,模型的探索能力直接影响其发现新颖解决方案的潜力,而特权信息泄漏导致的策略熵崩溃会严重限制这种创新潜力。DemoPSD 通过保持 35% 至 98% 的熵增益,使得模型在训练后期仍能探索多样化的推理路径,这对于需要多步推理的问题尤为关键。此外,该方法在 4B 参数规模的模型上即展现出显著优势,意味着其改进并不依赖于超大规模模型的容量冗余,而是源于训练范式的根本性优化,这使得它在资源受限的研究和工业场景中同样具有吸引力。
然而,我们也需要诚实地审视该工作的局限性。首先,DemoPSD 的超参数调优需要针对不同领域单独进行
从更广泛的视角来看,DemoPSD 的意义可能超越了自蒸馏领域本身。它提出的"选择性信任"原则——即在模型训练中根据实时分歧动态调整对监督信号的采纳程度——为更广泛的人机协作学习场景提供了启示。在教师-学生框架中,当教师的判断可能受到不可观测因素扭曲时,如何让学生保持适度的批判性自主,而非盲目服从,这一原则或许可以迁移到其他需要防止信息泄漏或分布偏移的学习场景中。当然,这也引出了更深层的开放问题:如果特权信息不仅来自标准答案,还可能来自其他隐性的环境偏差(如训练数据中的注释者偏见、领域特定先验),如何设计更通用的分歧度量来检测和衰减这些更隐蔽的"泄漏"?
延伸阅读与思考
要深入理解 DemoPSD 的理论根基,有几项工作是不可或缺的起点。首先是 Hübotter 等人(2026)提出的 SDPO(Self-Distilled Policy Optimization),它首次系统地将自蒸馏框架与 RLVR 结合,建立了密集 token 级监督的基本范式。其次是 Yang 等人(2026)对自蒸馏中 privileged information leakage 的理论分析,该工作严格证明了互信息间隙的不可消除性,为后续所有缓解方法提供了问题定义。在更广泛的 on-policy distillation 领域,Agarwal 等人(2024)的 GKD 和 Gu 等人(2024)的 MiniLLM 奠定了 on-policy 训练优于 off-policy 训练的理论基础,而 Ross 等人(2011)在模仿学习中对 compounding error 的经典分析则为 OPD 的必要性提供了早期论证。
在同期竞争方法中,DASD(Zhang et al., 2026)提出的方向自适应监督与 DemoPSD 最为接近,但 DASD 根据蒸馏信号的方向而非分歧大小来调节监督强度,其响应机制相对间接。GATES(Stein et al., 2026)通过多教师共识来缓解单一教师的偏见,这种方法在教师多样性足够时有效,但计算成本更高。AMiD(Shin et al., 2026)虽然引入了
展望未来,DemoPSD 开启的研究方向至少包括以下三个方面。第一,将分歧度量从 token 级扩展到更粗粒度的结构级(如短语、推理步骤或子目标),可能使得泄漏检测在更高抽象层次上发挥作用。第二,探索无超参数或自适应的超参数选择策略,如基于训练动态的
最引人深思的或许是 DemoPSD 触及的一个深层哲学问题:在机器学习中,"教师"与"学生"的理想关系究竟是什么?传统的知识蒸馏假设教师总是更优的,学生应尽可能复制教师。但 DemoPSD 揭示了一个更复杂的图景:当教师拥有学生不可见的特权信息时,完全复制反而是有害的。真正的理想关系或许是"批判性继承"——学生在学习的同时保持独立的判断能力,只在判断教师信号可信时才采纳。这种视角不仅为 LLM 训练提供了新方法,也为思考人机协作、知识传递乃至教育哲学提供了有趣的隐喻。在 AGI 探索的道路上,如何让模型既善于学习又保持独立的推理能力,可能是一个比单纯的性能优化更为根本的课题。DemoPSD 用严谨的数学和扎实的实验为这一课题迈出了重要一步,但它留下的开放空间——如何设计更普适的自主判断机制,如何平衡继承与创新——可能正是未来研究最有价值的方向。
Topics:
- "reinforce_learning"
- "reasoning"
- "llm"
- "self_evolving_agents"
References: - "grpo"
- "sciknoweval"
- "kl_distillation"
- "gpqa"
笔记创建时间: 2026-07-06
阅读方式: L2 深度阅读