CARVE: Content-Aware Recurrent with Value Efficiency for Chunk-Parallel Linear Attention
基本信息
- 标题: CARVE: Content-Aware Recurrent with Value Efficiency for Chunk-Parallel Linear Attention
- 第一作者: Sayak Dutta
- 研究团队: (独立作者)
- 发表: arXiv:2606.27292, 2026
- 类别: cs.CL, cs.AI, cs.LG, cs.NE
- 页数: 28 pages
- PDF 文件: [CARVE](file:///C:/Users/admin/.openclaw/workspace/attachment/papers/20260629_carve_content_aware_recurrent_value_efficiency.pdf)
研究摘要
序列建模领域长期面临一个根本性的权衡:模型应该记住多少上下文,以及为此付出怎样的硬件代价?Transformer 通过保留所有 token 的精确记录——以二次方的注意力矩阵——实现了强大的表达能力,但代价是训练和推理时的内存与计算开销随序列长度呈平方级增长。对于需要处理长文本的部署场景,这种开销不是工程上的不便,而是经济可行性的硬约束。与此同时,循环架构(recurrent architecture)提供了一个截然不同的交易:将过去所有上下文压缩到一个固定大小的状态矩阵
正是在这一背景下,Gated DeltaNet-2(GDN-2)应运而生,它将 delta-rule 递推中的标量遗忘门扩展为全尺寸的逐元素矩阵门,用
CARVE(Content-Aware Recurrent with Value Efficiency)的提出正是为了解决这一困境。其核心洞察是建筑性的:通过将所有的门控操作严格限制在 key 轴上,intra-chunk 的耦合矩阵将不再依赖于 value 的索引,从而恢复单一 WY-form 三角求解的合法性。在这一 key 轴约束之内,CARVE 引入了两项关键创新。第一项是内容感知的 erase 门,通过重用内核已经写入 HBM 的循环输出张量
在 1.3B 参数规模、100B token 的 FineWeb-Edu 数据集上,于 NVIDIA H100 硬件上的三种子平均实验表明,CARVE 同时在多个维度上超越了此前的最佳循环基线。WikiText 语言建模困惑度从 15.90 降至 15.72(
理论框架
要理解 CARVE 的理论根基,需要回溯 delta-rule 递推家族的思想演化。线性注意力(Linear Attention)的早期突破在于用核函数替代 softmax,将注意力的二次成本降为线性,使序列建模转化为一个线性递归
其中
WY-form 求解器(源于 Householder 变换的 WY 表示)是现代 delta-rule 模型高效训练的关键。它将长度为
在这一 key 轴约束的框架下,CARVE 建立了六个形式化理论保证。第一,Subsumption Hierarchy(Theorem 1)证明 CARVE 在 key 轴门控 delta 递推家族中严格包含所有先前成员:CARVE
第二,Lyapunov Stability(Theorem 4)表明,在最小 erase gate
由于双轴门控(erase 和 decay)的联合作用,
第三,Gradient Flow(Theorem 5)保证了梯度范数通过两个独立的门控路径被控制:
这为 CARVE 引入长程依赖时不会增加新的梯度消失问题提供了理论保证。
第四,Expressivity Separation(Theorem 7)构造了一个具体的任务——Selective Key Overwrite(SKO)——其中 CARVE 以
技术架构
CARVE 的技术架构围绕一个单一的架构原则构建:erase 只在 key 轴上操作。这一约束不是限制,而是开启了两项此前在 GDN-2 框架下无法实现的设计自由度。完整的 CARVE 状态更新方程为:
这里
从输入投影开始,CARVE 对隐藏状态
CARVE 最具巧思的技术机制在于内容感知 erase 门的实现方式。直接读取状态矩阵
这个内容信号
内容信号
在初始化时
在 write 侧,标量 write gate 的实现简洁而有效:
指数 decay 门
CARVE 的 forward pass 算法(Algorithm 1)按 chunk 顺序执行:对每个 chunk,先计算低秩内容投影
实验评估
CARVE 的实验设计遵循一个由浅入深的逻辑链条:首先验证内核数值正确性,然后确认训练吞吐量和内存,接着测试 chunkability 边界的紧致性,最后才进入语言建模和下游任务的评估。这种从硬件到软件的渐进式验证策略,确保了任何下游质量提升都可以被精确归因于架构创新,而非实现误差。
在 125M 参数配置(
训练吞吐量与内存的比较(Table 3)揭示了 CARVE 的核心效率优势。在单 H100、batch size 8、chunk size 64 的条件下,GDN-2 矩阵门基线达到 93.77K tok/s。一个内容感知精确递归的变体(绕过 WY-form,逐 token 执行)即使使用融合 Triton 反向传播,也只能达到 24.8K tok/s,比基线慢 3.8 倍——这恰恰印证了 Theorem 11 的警告:移除 value 轴依赖的尝试要么发散,要么产生定性不同的模型。CARVE 通过保留 key 轴约束,以 93.36K tok/s 的吞吐量运行在基线的 0.4% 范围内(在 5 轮交错测量的统计噪声内),同时峰值内存从 7.50GB 降至 6.54GB(-13%),mixer 参数减少 19%。这是一个典型的帕累托改进:在质量提升的同时,硬件 footprint 反而更小。
chunkability 边界的微基准测试(Table 4)进一步验证了 Theorem 11 的实证紧致性。测试在 125M 激活值上比较了不同变换方式。仅对内容读取进行 chunk 对齐的 CARVE 是可 chunk 的,偏差为 0.18% 且在
语言建模与常识推理的评估在 1.3B 参数、100B FineWeb-Edu token 的严格配置下进行:AdamW(
| 模型 | Wiki PPL↓ | LMB PPL↓ | LMB acc↑ | PIQA↑ | Hella.↑ | Wino.↑ | ARC-e↑ | ARC-c↑ | OBQA↑ | SIQA↑ | BoolQ↑ | Avg↑ |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Mamba-2 | 16.79 | 12.38 | 45.24 | 72.58 | 55.51 | 55.33 | 70.68 | 35.26 | 31.00 | 40.63 | 60.19 | 51.82 |
| GatedDeltaNet | 16.40 | 11.89 | 49.62 | 72.31 | 56.50 | 56.75 | 68.81 | 35.15 | 30.20 | 40.53 | 58.78 | 52.07 |
| KDA | 16.81 | 11.68 | 48.13 | 72.09 | 55.75 | 55.72 | 70.83 | 35.92 | 30.40 | 40.99 | 60.67 | 52.28 |
| Mamba-3 SISO | 16.30 | 12.99 | 45.06 | 72.31 | 55.58 | 56.20 | 70.45 | 34.56 | 31.00 | 41.76 | 55.90 | 51.42 |
| Mamba-3 MIMO | 16.45 | 11.66 | 47.82 | 72.36 | 56.49 | 55.78 | 72.38 | 38.07 | 30.00 | 40.89 | 57.74 | 52.39 |
| GDN-2 | 15.90 | 11.41 | 48.09 | 72.80 | 56.84 | 57.85 | 72.43 | 38.23 | 31.60 | 40.58 | 59.54 | 53.11 |
| CARVE | 15.72 | 11.27 | 48.87 | 73.15 | 57.31 | 58.12 | 73.06 | 38.74 | 32.20 | 40.91 | 60.43 | 53.74 |
| GDN-2+SWA | 15.62 | 10.43 | 50.90 | 72.20 | 58.46 | 58.56 | 71.89 | 36.69 | 33.00 | 41.50 | 62.57 | 53.97 |
| CARVE+SWA | 15.41 | 10.29 | 52.37 | 74.31 | 59.83 | 60.71 | 72.54 | 38.84 | 34.20 | 43.67 | 64.04 | 55.61 |
CARVE 在纯循环配置下以 WikiText 困惑度 15.72 领先所有循环基线,相比 GDN-2 的 15.90 有 -0.18 的改进,在三种子的统计上为
在 RULER 长上下文检索探测中(Table 8),CARVE 在所有 S-NIAH(单针检索)和 MK-NIAH(多键检索)上下文长度上均设定了新纪录。在多键干扰更严重的 MK-NIAH-1 任务上,CARVE 在 4K 上下文达到 61.8%,远超 GDN-2 的 31.8%,这直接印证了内容感知选择性擦除在状态饱和时的优势——Theorem 8 预测,当记忆超过容量时,知道哪些关联应该保留可以显著降低期望检索误差。在六项真实世界检索任务(Table 9)上,CARVE 同样领先所有基线,平均得分 31.09(循环)和 45.89(混合),相比 GDN-2 的 29.88 和 42.28 均有显著提升。在需要嘈杂关联恢复的任务(如 SWDE 和 SQuAD)上,CARVE 的循环配置优势尤为突出,这与其选择性擦除机制能够区分高价值关联和噪声的能力直接相关。
综合价值与局限
CARVE 的理论意义在于它从根本上改变了我们对门控循环架构中"选择性"的理解。在 GDN-2 之前,选择性被视为门控维度的函数——更多维度的门控意味着更精细的选择性。CARVE 证明,真正的选择性不在于门控有多少参数,而在于门控能够访问什么信息。通过让 erase 门观察已存储的内容(通过输出重用),CARVE 以极低的参数和内存成本实现了内容条件的选择性遗忘,这在概念上是一个重要的跃迁。它表明,循环架构的效率瓶颈往往不在计算而在于信息流的设计:通过重用已经存在的张量(循环输出),可以在零额外内存成本下引入此前被认为需要昂贵状态读取的功能。
从实践角度看,CARVE 的吸引力在于它提供了一个清晰的技术迁移路径。由于 CARVE 在初始化时与 GDN-2 bit-identical,且使用了完全相同的 WY-form 内核,现有的 GDN-2 代码库可以几乎无缝地迁移到 CARVE——只需增加一个低秩内容投影模块和一个标量 write 门,同时移除 value 轴的 erase 投影。在 1.3B 规模上,这种迁移带来的困惑度降低、常识推理提升、长上下文检索改善、以及内存和参数的节省,构成了一份令人信服的收益清单。对于需要部署长上下文语言模型的系统工程师来说,CARVE 在保持循环架构常数内存推理优势的同时,提供了接近 Transformer 混合模型的质量,是一个极具吸引力的选项。
然而,CARVE 的设计也并非没有局限。最诚实的限制在于内容信号的来源:它是前一个 chunk 的循环输出均值。这意味着极短序列——低于两个 chunk 长度——根本不会接收到任何内容信号。虽然 Proposition 14 证明在典型训练设置下 staleness 误差随
另一个值得思考的局限是 CARVE 与 GDN-2 的不可比较性(Proposition 2)。虽然 CARVE 在实验中全面优于 GDN-2,但这并不意味着 GDN-2 的 value-axis erase 在理论上毫无价值。GDN-2 可以表示 rank-2 的 erase 模式,而 CARVE 只能表示 rank-1 模式。在某些尚未被识别的任务上,这种更高秩的 erase 能力可能是有用的。CARVE 的胜利在于它在当前已知的评估任务(语言建模、常识推理、长上下文检索)上表现更好,同时保持了硬件效率,但这并不排除未来发现 GDN-2 更高秩 erase 有独特优势的场景。
从更广阔的视角看,CARVE 代表了循环架构设计哲学的一个转向:从"增加门控维度来提升选择性"转向"利用架构约束来解锁信息流的新维度"。这一哲学可能适用于更广泛的序列建模问题——例如,多模态设置中的选择性键覆盖(selective key overwrite)就是一个自然延伸,当后续视频帧更新先前存储的视觉对象时,内容感知门控可以精确地定位并覆盖旧关联,而不影响其他记忆。
延伸阅读与思考
CARVE 的工作建立在多个活跃研究线索的交叉点上。最直接的前身是 Gated DeltaNet(GDN)和 GDN-2(Yang et al., 2025; Hatamizadeh et al., 2026),它们将 delta rule 从标量门控推进到矩阵门控,展示了门控机制对循环模型质量的显著影响。KDA(Kimi Team, 2025)首次将门控 machinery 移到 key 轴上,为 CARVE 的 key-axis-only 约束提供了重要铺垫。在线性注意力方面,Katharopoulos et al. (2020) 的核化注意力、Schlag et al. (2021) 揭示的线性注意力与快速权重编程(fast-weight programming)之间的等价性,以及 Test-Time Training(Sun et al., 2025)和 Longhorn(Liu et al., 2025)将 delta rule 与在线学习目标联系起来的工作,共同构成了 CARVE 的理论土壤。在硬件效率方面,FlashAttention(Dao et al., 2022)和 WY 表示(Schreiber & Van Loan, 1989)直接支撑了 CARVE 的融合内核设计。
在相同的问题空间内,存在几种不同的解决哲学。状态空间模型(SSM)如 Mamba 系列(Gu & Dao, 2023; Dao & Gu, 2024; Lahoti et al., 2026)选择了结构化状态矩阵和快速并行扫描的路径,放弃了全矩阵状态以换取硬件效率。CARVE 与 SSM 是互补的:CARVE 坚持全矩阵 delta-rule 状态,但通过门控约束来保持效率。混合架构(如 Griffin、Jamba、Samba)在循环层和注意力层之间交替,利用各自的优势覆盖不同上下文范围。CARVE 的混合设计(3:1 CARVE:SWA)与这些工作一致,但 Theorem 10 提供了一个此前文献中缺失的形式化最优性保证:存在某个混合比例,使得混合架构同时实现线性训练成本、近精确局部检索和全局内容感知检索。
未来最令人期待的方向之一是多模态 CARVE。视觉序列中常见的场景更新——例如一个物体在视频中被重新识别为不同类别——正是 Selective Key Overwrite(SKO)任务的现实对应。CARVE 的内容门通过循环输出的均值来感知当前记忆状态,这种机制天然适合视觉领域,其中空间特征可以作为 key,语义特征作为 value。另一个方向是内容门的可解释性:如果我们可以理解内容投影
最后,一个深刻的开放问题是:在更大的规模(7B 参数、1T token)上,CARVE 的 -0.18 困惑度优势是会放大、缩小还是保持?如果内容感知门控的效益随模型容量增加而增长,那将强烈暗示当前大语言模型的记忆管理是一个瓶颈问题,值得在更大规模上投入工程资源。如果优势缩小,则可能意味着在充分参数化的情况下,memory-blind 门控可以通过纯粹的数据驱动学习来近似内容感知行为。这个实证问题的答案,将深刻影响我们对循环模型扩展规律的理解。
对我而言,这篇论文最引人深思的方面是它揭示了一个反直觉的设计原则:有时候,最优雅的解决方案不是增加更多机制,而是找到一个恰到好处的约束,让现有机制释放出新的能力。CARVE 的 key-axis-only 约束看似减少了自由度,实际上却解锁了内容感知和参数效率——这种"以退为进"的设计哲学,在深度学习的架构创新中或许具有更广泛的应用价值。
笔记创建时间: 2026-06-29
阅读方式: L2 深度阅读