How Transparent is DiffusionGemma?

基本信息


How Transparent is DiffusionGemma?

Title: How Transparent is DiffusionGemma?
Authors: Joshua Engels, Callum McDougall, Bilal Chughtai, Janos Kramar, Senthoran Rajamanoharan, Cindy Wu, Arthur Conmy, Asic Q Chen, Jean Tarbouriech, Min Ma, Brendan O'Donoghue, João Gabriel Lopes de Oliveira, Rohin Shah, Neel Nanda (Google DeepMind)
Venue: arXiv
Year: 2026
Code URL: https://github.com/google-deepmind/serial_depth
Pages: 27


研究摘要

在当代前沿人工智能系统的版图中,自回归(autoregressive)推理模型长期占据主导地位。这些模型通过思维链(Chain of Thought, CoT)以自然语言的形式逐步展开推理过程,使得人类观察者能够阅读、理解和监督模型的中间思考步骤。这种透明性不仅是学术上的便利,更已成为AI安全的核心支柱:奖励篡改(reward hacking)、提示注入(prompt injection)等危险行为往往只能在CoT中被发现;具备CoT访问权限的监控器(monitor)在检测模型不当行为时的表现远胜于只能观察最终输出的监控器;而对CoT进行重采样则为了解模型推理结构提供了独特窗口。有研究者甚至认为,CoT透明性在未来可能成为判断强大AI系统是否安全部署的关键依据——现有的AI控制安全案例(AI control safety cases)在很大程度上依赖于对模型部署过程的有效监控。

然而,这一安全假设正面临新兴架构的挑战。Google DeepMind于2026年发布的DiffusionGemma是一种文本扩散模型(text diffusion model),它不再遵循逐token自左向右生成的经典范式,而是通过反复对整个token画布(canvas)执行去噪操作来迭代优化输出。这意味着,在相邻去噪步骤之间传递的并非人类可读的自然语言文本,而是包含密集自条件向量(self-conditioning vectors)的混合状态。一个根本性的忧虑由此浮现:如果模型的"思考"发生在连续的潜在空间(latent space)而非离散的自然语言中,它是否仍然在"用英语思考"?它是否能够在人类不可见的维度上同时权衡多种可能性、在后续token确定后回溯修改先前token、或者在潜空间中实施复杂的分布式算法?如果答案是肯定的,那么扩散模型带来的将不仅是生成范式的革新,更可能是推理透明性的系统性倒退。

本文正是在这一背景下展开的一项系统性审计研究。作者团队没有选择简单地对扩散模型宣判"不透明"的 verdict,而是将透明性这一笼统概念分解为可操作的分析维度,逐一检验DiffusionGemma的真实透明程度。研究的核心发现出人意料地乐观:尽管在不加干预的情况下,DiffusionGemma的不透明串行深度(opaque serial depth)——即模型在不经过可解释瓶颈的情况下所能执行的最长串行计算路径——达到了对应Gemma 4模型的28.6倍,但作者证明,通过简单的Logit Lens技术,可以将去噪步骤间瓶颈中的信息流限制在仅O(c)个自然语言token上,且下游性能几乎没有下降。当把这些中间状态视为可解释时,不透明串行深度骤降至Gemma 4的1.1倍。在监控性(monitorability)方面,DiffusionGemma与Gemma 4表现相当。然而,研究也揭示了扩散模型特有的算法层面透明性挑战:由于所有token在每个去噪步骤都可能被修改,模型具备实施非时序推理(non-chronological reasoning)、token与序列涂抹(token/sequence smearing)以及中间语境推理(intermediate-context reasoning)的能力——这些现象在自回归模型中是完全不可能出现的。

从更广阔的视角看,这项工作的重要性在于它建立了一套评估潜在推理模型(latent reasoning models)透明性的方法论模板。随着前沿模型日益在单次前向传播中执行多跳推理、利用填充token增强无CoT数学性能,以及通过垂直或水平递归架构扩展潜在推理时间,纯粹的自然语言CoT可能不再是默认选项。本文提出的不透明串行深度框架、瓶颈可解释性检验和监控性评估,为未来任何新兴潜在推理架构的透明性审计提供了可复用的工具箱。同时,作者也清醒地指出,当前观察到的透明性可能在很大程度上是DiffusionGemma特定训练和架构选择的产物,而非潜在推理架构的普遍属性——如果未来的模型采用不同的训练目标或大规模基于结果的强化学习,潜空间可能会变得显著更加不透明。

理论框架

要理解本文的理论贡献,必须首先把握其构建于上的两条思想谱系:一是关于语言模型推理透明性的安全研究传统,二是关于潜在推理(latent reasoning)的近期探索。在自回归模型的语境中,Brown-Cohen等人(2026a, 2026b)提出的不透明串行深度概念为量化模型透明性提供了严谨的数学语言。其核心思想是将神经网络及其采样过程视为一个布尔电路,标记出人类可解释的节点(通常是自然语言的输入和输出),然后计算电路中最长的不包含任何可解释节点的路径长度。这一度量捕捉了一个关键直觉:即使模型的总计算量不变,如果大量计算被"挤压"在不可解释的潜在空间中进行,人类监督者就失去了对这段推理过程的可见性,模型可能在此期间实施欺骗、策略性隐藏或错误推理而不被察觉。

本文将这一框架创造性地扩展到了扩散模型的语境中。在自回归Transformer中,每个token的生成都强制通过一个可解释的自然语言瓶颈:模型必须将内部激活投射到词汇表上的概率分布,采样一个具体的token,再将这个token作为输入传递下一步。因此,自回归模型的不透明串行深度主要由层数L、上下文长度N和激活维度D决定,渐近表示为O(L(logN+logD))。然而,DiffusionGemma的架构引入了一个根本不同的计算图:它包含T个去噪步骤的循环,每个步骤内部是一个完整的双向Transformer前向传播。如果假设去噪步骤之间的瓶颈(由C个token和C个自条件向量组成)完全不可解释,那么最长的不可解释串行路径将贯穿所有T个步骤,导致不透明串行深度达到O(TL(logN+logD+logC))——这正是28.6倍差距的理论来源。

但这里存在一个微妙的理论转折点。DiffusionGemma的自条件矩阵StRC×dmodel的计算方式本身就蕴含了向可解释性倾斜的结构偏置。具体而言,St通过以下软嵌入(soft embedding)公式得到:

St=softmax(^t)WE

其中^t=t/τt是经温度缩放后的对数几率(logits),WE是嵌入矩阵。这一公式具有深刻的理论含义:自条件向量并非任意的潜在表示,而是词汇表概率分布的加权和,权重由模型自身预测的对数几率决定。换句话说,St的信息内容被"锚定"在词汇表的语义方向上——那些概率更高的token对自条件向量的贡献更大。这一结构选择为后续的可解释性干预提供了理论基础:如果St的信息主要集中在少数高概率token上,那么我们或许可以用这些token的离散表示来近似整个自条件矩阵,而不会造成严重的信息损失。

沿着这一思路,作者进一步区分了两种透明性维度。变量透明性(variable transparency)关注的是我们能否理解模型计算状态的中间快照——即去噪步骤间的瓶颈是否可被映射为人类可读的token。算法透明性(algorithmic transparency)则更进一步,追问我们能否利用这些快照重建模型得出输出的完整因果过程。前者回答"我们在看什么",后者回答"我们看到了什么之后能推断出什么"。这一区分至关重要,因为即使每个中间状态单独看来都是可解释的token,模型在去噪时间轴上实施的算法可能仍然远超人类的直觉理解——正如本文发现的非时序推理现象所展示的那样。

技术架构

DiffusionGemma的推理流程可以看作一个两阶段系统:预填充(setup)阶段建立静态的上下文表示,随后进入由T次迭代构成的去噪循环。在预填充阶段,用户提示p=(p1,,pN)被编码为键值(key-value)激活,这些激活在整个去噪过程中保持不变,被每个去噪步骤的双向注意力层所回查。画布(canvas)则初始化为C个均匀随机采样的token,自条件矩阵S0初始化为零矩阵。

去噪循环是DiffusionGemma与自回归模型最根本的分水岭。在第t个去噪步骤中,模型接收前一步的canvas ot1[V]C和自条件矩阵St1RC×dmodel,通过以下过程生成更新后的状态。首先,St1经过一个门控MLP(gated MLP)后被加到canvas token的嵌入上,这一设计允许前一步的"自我预测"直接调节当前步骤的输入表示。随后,数据流经完整的双向Transformer——注意这里的"双向"意味着每个位置都可以 attending 到画布中的所有其他位置,包括它自身和未来的位置——最终产生对数几率tRC×|V|

采样步骤引入了温度退火和熵约束采样的机制。温度τtτmax=0.8τmin=0.4之间线性插值,随着去噪进程逐步降低,使模型在早期保持探索性、在后期趋于确定性。候选token首先从塑形后的分布o^itCategorical(softmax(^it))中独立采样,然后通过熵约束(Entropy-Bounded, EB)采样决定哪些低熵位置保留候选token、哪些高熵位置需要重新加噪。这一非单调的承诺机制意味着一个token即使在某一步被"确定",在后续步骤中仍可能被修改——这是扩散模型能够实现回溯修正的结构基础。

为了评估瓶颈的可解释性,作者设计了一套优雅的信息限制实验。核心思想是修改对数几率^t以限制自条件矩阵的信息容量。具体而言,他们定义了对数几率修改函数f:RC×|V|RC×|V|,通过两种策略实现信息压缩:fp将所有概率低于阈值p的token对应的对数几率压扁为常数,使得softmax后这些token的概率均匀分布;fk则仅保留top-k个最高概率的token,其余同样被压扁。修改后的自条件矩阵计算为:

St=WEsoftmax(f(^t))

实验结果显示,当k=8p=0.03时,模型在Natural2Code、LiveCodeBench、AMC/AIME/IMO和GPQA等能力基准测试上的表现与基线无异。这一发现的技术意义在于:去噪步骤间传递的"负荷承载"信息可以被压缩到每个位置仅8个token或概率质量超过3%的少数token,而不会损害模型的推理能力。接下来关键的问题变为:这些被保留的top token究竟是什么?它们是否真的具有语义可解释性?

作者通过在WildChat数据集上的800个提示进行生成实验,对每个去噪步骤和序列位置提取满足k=8p>0.03条件的token集合,并将其分类为:与最终token完全匹配、与邻近位置最终token匹配、与最终token语义相似(通过Gemma 4 31B嵌入矩阵的余弦相似度衡量)、与邻近token语义相似,或其他不可解释token。结果显示,在p>0.03的严格过滤下,超过85%的token从第一步起就属于前三类可解释范畴。这表明DiffusionGemma的中间状态并非神秘的潜在编码,而主要是对当前及邻近位置最终token的"猜测"。从架构设计的角度看,这一结果部分源于DiffusionGemma在中间层存在的投影偏置——该投影将步骤间传递的向量推向嵌入向量的方向,从而自然地使自条件信息对齐于可解释的词汇语义轴。

实验评估

本文的实验设计遵循一条清晰的逻辑主线:首先量化扩散模型在结构上的透明性劣势(不透明串行深度),然后展示通过简单解释性技术可以将这一劣势基本消除,最后在实际监控任务中验证扩散模型的透明性表现是否与自回归模型相当。

在不透明串行深度的计算中,作者在256k上下文长度下对Gemma 4系列模型和DiffusionGemma进行了经验上界和渐近分析。结果如表所示:Gemma 4 26B A4B的不透明串行深度经验上界为21,235,而假设瓶颈不可解释时DiffusionGemma 26B A4B高达608,016,恰好是前者的28.6倍。这一数字直观反映了扩散模型的潜在风险:如果人类无法理解去噪步骤之间的信息传递,那么模型就拥有了一个巨大的"暗箱"计算空间,可以在其中执行长达608,016层等效不透明计算而不暴露任何可解释的中间状态。然而,一旦假设瓶颈可解释——即每个去噪步骤的输出token和经Logit Lens映射后的自条件向量可被人类理解——DiffusionGemma的不透明串行深度骤降至23,571,仅为Gemma 4的1.1倍。渐近分析进一步揭示,在可解释瓶颈假设下,额外的开销仅为O(LlogC),源于画布上的注意力计算。

Model Empirical Opaque Serial Depth (UB) Asymptotic Opaque Serial Depth
Gemma 4 E2B 8,978 O(L(logN+logD))
Gemma 4 E4B 10,886 O(L(logN+logD))
Gemma 4 26B A4B 21,235 O(L(logN+logD))
Gemma 4 31B 13,750 O(L(logN+logD))
DiffusionGemma 26B A4B (Interpretable Bottleneck) 23,571 O(L(logN+logD+logC))
DiffusionGemma 26B A4B (Uninterpretable Bottleneck) 608,016 O(TL(logN+logD+logC))

瓶颈可解释性的验证实验构成了连接理论分析与实际应用的桥梁。在能力基准测试上,top-k消融和top-p消融的结果呈现出清晰的趋势:随着k的增加或p的减小,模型性能单调上升,在k=8p=0.03处达到与基线持平的拐点。这意味着信息瓶颈存在明确的最小充分表示——不需要保留完整的概率分布,仅保留头部token就足以支撑正常的推理流程。在token身份分析中,一个有趣的发现是top-k=8过滤在后期去噪步骤中产生了较多"其他"类不可解释token。其原因在于,随着扩散过程推进,模型对某个单一token的置信度急剧升高,导致top-8中的其余7个token成为低概率噪声。相比之下,p>0.03的概率阈值过滤则有效避免了这一问题,因为高置信度步骤往往只有一个token超过该阈值,从而自然过滤掉了噪声token。

监控性评估直接检验了DiffusionGemma的中间输出对下游监控任务的实际信息价值。作者采用了Guan等人(2025)提出的开源监控性基准,涵盖干预(intervention)、过程(process)和结果属性(outcome-property)三大类任务。干预任务通过向输入施加受控干预(如在数学问题后附加提示性线索),测试监控器能否从模型的推理过程中检测到与行为变化对应的推理变化;过程任务要求模型解决必须通过特定定理或路径的问题,检验监控器能否在推理中找到对应证据;结果属性任务则考察模型是否利用了输出的已知属性进行决策。实验结果表明,DiffusionGemma与Gemma 4在监控性上表现相当,平均G-mean分数接近。值得注意的是,DiffusionGemma的思维链长度显著短于Gemma 4,而以往研究发现更长的思维链通常更易监控——这意味着DiffusionGemma可能在更紧凑的推理中编码了同等的信息量,或者其推理结构在本质上更适合监控器提取关键信息。

案例研究

理论分析和平均统计结果有时会掩盖个体层面的丰富行为。本文第5节的案例研究部分通过精细的可视化工具,揭示了DiffusionGemma在去噪时间轴上实施的具体算法,其中许多行为在自回归模型中是完全不可能出现的。

非时序推理:提前预测响应长度 当提示模型"用两句话解释光合作用"时,Line Graph视图显示,在第一个去噪步骤后,模型就对约55个位置之后的所有token以接近100%的概率预测了填充token(padding,即序列结束标记),而此时内容token本身仍高度不确定。最终输出恰好收敛于50个token,证明模型在尚未决定具体说什么之前,就已经准确估计了要说多少。这一现象可以通过将每一步的填充token概率pt(i)解释为累积分布函数来形式化:第t步对序列长度的期望估计为Et[L]=i=0Lcanvas(1pt(i))。实验显示,仅需两步去噪,这一期望估计就几乎完美地预测了最终长度。

回溯性自我修正 在"400到800之间有多少个完全平方数?先给出答案,再给出推理"的提示下,自回归模型一旦输出了答案token就无法更改,但DiffusionGemma在第4步时顶部预测是错误答案9,随后在填充推理token的过程中于第7步将答案修正为8,且置信度显著提高。这种"先开枪,后画靶"的推理顺序——先生成一个占位答案,再通过后续推理验证并修正它——在认知上类似于人类的工作记忆草稿过程,但在计算上却依赖于扩散模型独有的全画布双向修改能力。

Token涂抹与序列涂抹 Token涂抹描述的是单个token的概率质量在相邻位置上同时分布的现象,常见于语法标记(如换行符、逗号)或确定将出现的关键词。在"编写一个判断括号序列是否平衡的函数"的提示中,"bracket"一词的概率在多个相邻位置同时保持高位,然后才收敛到最终位置。更复杂的序列涂抹则涉及多个语义上不同的候选序列同时存在。在完全平方数问题的早期步骤中,模型同时维持着单位数答案和双位数答案(12)两种序列可能性,概率大致均等分布;直到第4步才"坍缩"到单位数版本,并导致后续所有token回退一个位置。这种行为暗示扩散模型在其潜在空间中实施了一种类似于束搜索(beam search)的并行探索,能够同时保持多个多token假设,这与自回归模型在每一步只能commit到一个token的刚性约束形成鲜明对比。

中间语境推理 在斐波那契类递推序列任务中,要求模型将个位数为3的数字替换为"Gold",DiffusionGemma的推理过程揭示了真正的"中间推理token"——模型首先生成数字3,利用它正确计算后续项,然后再将3替换为"Gold"。数字3在因果链上是必要的中间产物,却从不出现在最终输出中。这表明,即使最终输出看起来清晰透明,关键的推理步骤可能完全隐藏在中间状态之中,无法通过仅监控最终文本来捕获。

综合价值与局限

这项研究在理论层面的最大贡献在于将"透明性"从一个模糊的直觉概念转化为可量化、可干预、可比较的多维分析框架。通过引入不透明串行深度、变量透明性和算法透明性的分层结构,作者不仅为DiffusionGemma提供了全面的透明性体检,更为整个AI安全领域评估潜在推理架构建立了方法论先例。在实际应用层面,研究结果对模型开发者和安全审计者具有直接的指导意义:Logit Lens干预的简单性和有效性意味着,即使对于当前最先进的文本扩散模型,也不需要复杂的白盒分析工具就能恢复接近自回归模型的透明性水平。

然而,本文的局限性同样值得认真对待。首先,监控性评估是在跨多个画布(multi-canvas)的设置下进行的,而DiffusionGemma在多画布场景中的行为更接近自回归模型(因为画布之间是顺序依赖的)。这意味着单画布内的监控性可能显著低于测量结果——而未来的扩散模型可能通过更大的画布在单次去噪过程中完成复杂推理,届时当前结论是否成立仍是未知数。其次,也是最根本的一点,观察到的透明性很可能与DiffusionGemma特定的训练方式密切相关。模型在中间层存在的、将向量推向嵌入方向的投影偏置,可能是有意或无意地促进了可解释性。如果未来的模型通过大规模结果导向的强化学习进行优化,或者采用完全不同的架构设计,潜在空间可能会演化得远离词汇语义轴,使得Logit Lens等简单技术失效。事实上,作者明确警告,即使是标准的自然语言CoT也可能存在不忠实性(unfaithfulness)或混淆(obfuscation),而将"可解释"的标签赋予经过映射的潜在向量,其风险比评估自然语言CoT更高——我们可能误将欺骗性或不透明的推理标记为良性。最后,本文并未实际部署生产级监控器,因此在实践中提取和分析每个去噪步骤的中间对数几率会带来显著更长的监控提示和更高的计算成本,这些实际约束在学术评估中未能充分体现。

从更宏观的视角看,这项工作触及了AI发展的一个深层张力:连续表示的信息容量优势与自然语言表示的可解释性优势之间的权衡。自回归文本瓶颈固然丢弃了大量信息,但它强制模型在每个推理步骤都"外化"其思考;潜在推理架构释放了模型的表达能力,却可能同时打开了一个监控无法触及的推理暗角。本文的结果暂时缓解了这种忧虑,但也提醒我们,这种缓解可能是训练过程中偶然的副产品,而非架构本身的保证。

延伸阅读与思考

在相关工作的版图中,本文站在了多个研究传统交汇的十字路口。在潜在推理的谱系上,近期的前沿LLM已显示出在单次前向传播中执行多跳事实推理的能力(Greenblatt, 2026),以及利用填充token增强无CoT数学表现的现象(Grenenblatt, 2025)。架构层面的创新则包括垂直递归方法——如Universal Transformer(Dehghani et al., 2018)和COCONUT(Hao et al., 2025)——通过循环层或显式潜在向量反馈增加有效层深度;水平递归方法如Mamba(Tang et al., 2023b)将先前token的信息压缩为潜在向量;以及DiffusionGemma所代表的文本扩散家族。在可解释性方面,CODI(Tang et al., 2023a)通过自蒸馏将自回归CoT压缩为连续潜在表示,与本文的反向操作——将潜在表示展开为可解释token——形成了有趣的对偶。同时期的工作由Asaria等人(2026)独立进行,他们也研究了DiffusionGemma中token承诺的顺序,与本文第5.1.3节的发现相互印证。

展望未来,几个研究方向显得尤为迫切。首先,自动化算法描述——即给定一个扩散模型的去噪轨迹,自动生成类似"模型首先生成数字3,然后替换为Gold"的高层算法摘要——将极大地提升算法透明性的可扩展性。其次,单画布监控性评估的设计至关重要:当前的评估框架需要扩展,以检验模型在256 token以内的短画布推理中是否仍然保持透明,因为这才是扩散模型与自回归模型最本质不同的场景。第三,将标准的机制可解释性工具(如激活修补、电路分析、Tuned Lens)系统应用于DiffusionGemma,有望揭示非自回归行为背后的具体电路实现。最后,从模型生物学的角度看,DiffusionGemma为研究潜在推理中的不对齐(misalignment)和策略性推理隐藏提供了理想的模型生物基础——研究者可以通过微调诱导模型在去噪步骤中进行策略性推理,同时隐藏这种推理不让最终输出暴露。

personally,本文最发人深省之处在于它对"透明性"概念的精细化拆解。在公众讨论中,透明性常常被简化为"能否看到模型的思考过程"的二元问题;但本文展示了,即使我们"看到"了每个去噪步骤的中间token(变量透明性),理解这些token如何在时间轴上组合成因果算法(算法透明性)仍然是另一个层次的挑战。序列涂抹现象尤其令人警觉——如果模型能够在其潜在空间中同时保持多个语义不同的完整假设,那么人类的线性阅读习惯可能从根本上就不适合理解这种并行推理过程。这提示我们,未来的AI透明性工具可能需要超越"阅读思维链"的范式,发展出能够可视化并行假设竞争和坍缩过程的新型界面。同时,中间语境推理的发现也提出了一个深刻的认识论问题:如果一个模型的关键因果推理步骤从不出现在任何可观察的输出中,那么"透明性"的界限究竟应该划在哪里?是划在可观察的所有状态上,还是划在因果上影响最终输出的所有状态上?DiffusionGemma的答案是前者足以保证监控性,但后者可能永远超出我们的 reach。这一张力,或许将在未来很长时间内持续定义着人类与机器智能之间的理解鸿沟。


笔记创建时间: 2026-06-22
阅读方式: L2 深度阅读

Topics:

Powered by Forestry.md