PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning
基本信息
- 标题: PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning
- 第一作者: Alexis Fox (Duke University)
- 研究团队: duke_university
- 会议/期刊: arXiv 2026
- 代码: https://github.com/alexisfox7/PRO-LONG
- PDF 文件: [PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning](file:///C:/Users/admin/.openclaw/workspace/attachment/papers/20260724_pro_long_programmatic_memory_long_horizon_reasoning.pdf)
研究摘要
长程推理(long-horizon reasoning)是人工智能通向通用智能道路上最持久的瓶颈之一。它要求智能体在数百乃至数千个时间步内保持感知、推理与探索的连贯性,而不能像处理孤立问题那样依赖一次性输入输出。论文《PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning》正是围绕这一核心挑战展开,其研究动机直接来自于当前大型语言模型(large language model, LLM)智能体在 ARC-AGI-3 等持续学习基准上的惨淡表现:在没有专门 harness 的情况下,前沿模型几乎得零分。这一现象揭示了一个深刻问题——即使模型拥有庞大的参数规模和强大的语言理解能力,当面对需要长期积累环境信息、动态修正世界模型的任务时,它们依然难以维系跨越漫长交互序列的推理链条。
该论文提出的关键思想可以概括为:将智能体的记忆重新理解为一种程序化的外部存储(programmatic memory),而非传统的压缩摘要或向量检索库。在作者看来,智能体 context 的 engineering 本质上是在处理两类信息之间的张力:一类是 accessed context,即模型当前窗口内可以直接看到的内容;另一类是 accessible context,即通过工具可以调用的外部记忆。现有记忆系统普遍在写入(write)阶段就面临一个艰难的取舍:如果把所有信息都保留下来,后续读取(read)时就会因为信息过载而难以检索;如果提前做摘要或筛选,又可能丢失那些在当时看似无关、事后却至关重要的细节。这种保真度与可处理性之间的 tradeoff 被作者称为 fidelity–tractability tradeoff,它随着交互序列的增长而不断累积,最终成为长程推理失败的重要根源。
PRO-LONG 的核心洞见在于反其道而行之:写入阶段采用 append-all 策略,将每一次观察、动作和结果都原封不动地写入一个结构化日志(logs.txt);读取阶段则完全交给智能体的程序化能力,通过正则表达式、grep、Python 脚本等方式在日志中搜索所需信息。这一设计之所以可行,是因为近年来 coding agents 的迅速发展为智能体提供了强大的代码执行与搜索能力,使得“保留全部信息并事后程序化检索”从不可行变得可行。作者强调三大设计原则:simplicity(无需学习或启发式地决定保留什么)、losslessness(不压缩、不摘要,保持原始交互记录的完整性与真实性)、以及 maximal compatibility with coding agents(与现代 coding agents 的原生能力无缝对接)。
论文的主要贡献可以自然地嵌入到这三条原则之中。首先,作者提出了 PRO-LONG 这一极简上下文管理框架,将 programmatic memory 形式化为 append-all write 与 code-based read 的组合。其次,在 ARC-AGI-3 公开游戏集上,PRO-LONG 在 GPT-5.5、Opus 4.6、Fable 5 等前沿模型上均取得了与甚至超越现有专门 harness 的性能,同时 token 成本降低了 4.2 到 5.8 倍。具体而言,PRO-LONG 将基础 coding agent 的平均得分提升了 18.0 个百分点;在 Fable 5 上达到 97.4% 的 best@2,总成本仅 1,750 美元。最后,作者通过大量消融实验揭示,PRO-LONG 的增益主要来源于对完整日志的程序化访问,而非持久化的工作空间、手写笔记或其他辅助工具。这一发现有力地支持了“简单即有效”的设计哲学,并对当前复杂多智能体 harness 的构建方式提出了反思。
从更宏观的角度看,PRO-LONG 的实验结果具有重要的方法论意义。它表明,在适当的上下文管理支持下,前沿 LLM 能够自发地构建复杂的世界模型(world models)并执行长程规划(如广度优先搜索、回归验证),而不需要显式地教会它们这些技能。论文因此提醒我们,也许智能体研究不应过度追求越来越复杂的 prompt、子智能体架构或专用工具,而应回归到一个更基本的问题:如何让模型在合适的时间以合适的形式访问到它需要的信息。PRO-LONG 正是在这个问题上给出了一个优雅而有效的答案,也为未来长程推理研究指明了一个低成本、高兼容性的方向。
理论框架
要理解 PRO-LONG 的理论立场,需要先将其置于智能体记忆与上下文管理的研究脉络之中。传统上,LLM 智能体处理长程任务时面临的最大约束是上下文窗口(context window)的有限性。虽然现代模型的上下文窗口已经扩展到接近百万 token,但大量研究表明,随着输入长度增加,模型性能会出现明显下降,即 context rot(Hong et al., 2025)。这一发现颠覆了“窗口越大越好”的简单直觉,揭示出关键问题不在于能装下多少信息,而在于如何有效地组织、检索和利用这些信息。在此背景下,研究者们提出了多种外部记忆系统:从最早的 scratchpad 笔记(Nye et al., 2021),到分层记忆的 MemGPT(Packer et al., 2023),再到将经验转化为可检索条目的 Mem0、ReasoningBank 以及将轨迹压缩为可复用技能的 SkillRL(Xia et al., 2026)。这些系统的共同特点是在写入阶段就对信息进行某种形式的筛选、摘要或结构化,以减轻后续读取的负担。然而,正如 PRO-LONG 作者所指出的,这种策略在长程任务中存在根本性的风险:今天看似冗余的信息,可能在几十个时间步之后变得至关重要,而任何写入时的信息损失都不可逆。
与上述思路形成对照的是另一条研究线索:保留原始信息,只在需要时通过程序化方式查询。递归语言模型(recursive language models, Zhang et al., 2025)利用 REPL 让模型通过代码片段检查长输入的局部;Cao 等人(2026)则进一步展示了 coding agents 作为长上下文处理器的潜力。PRO-LONG 的理论立场正是这一思路的延伸和具象化。它明确提出,对于 coding agents 而言,最自然的记忆形态不是摘要、向量或条目,而是一个完整的、追加式的、可编程搜索的日志。这种 programmatic memory 的核心假设是:只要模型能够通过代码高效地检索,那么保留全部原始信息所带来的保真度收益,将超过检索成本的增长。
论文引入了一对核心概念:accessed context 与 accessible context。Accessed context 是模型在一次 API 调用中实际看到的内容,包括系统 prompt、当前 board 和最近的工具输出,规模通常在 100k 到 1M token 之间;accessible context 则是通过工具可以访问的外部记忆,规模可以达到 10M token 以上。PRO-LONG 的关键设计是让 accessible context 远远大于 accessed context,同时通过程序化手段在两者之间建立高效的桥梁。换句话说,模型不必一次性记住所有事情,但可以在任何时刻通过写一段代码去“回忆”任何一段历史。
在数学上,论文给出的评分公式体现了 ARC-AGI-3 对动作效率的强调。对于每个环境 e 中的第 l 个关卡,智能体使用动作数 a_{l,e} 与人类基准 h_{l,e} 之间的相对效率定义关卡得分:
这一公式意味着,如果智能体使用的动作数少于人类基准,它可以获得最高 115% 的得分;而一旦动作数超过人类基准,得分将以平方速度下降。最终整个基准得分 T 是所有环境关卡得分的加权平均,权重偏向后面的关卡:
这个公式有两个重要作用。第一,它把评估焦点从“能否通关”扩展到了“能否以接近或优于人类的效率通关”,从而强制智能体进行高效探索和规划,而非盲目尝试。第二,关卡的加权设计意味着后期更难的关卡对总分影响更大,这进一步突出了长程推理和动态学习能力的重要性。PRO-LONG 的低成本优势在这种评分机制下尤为突出:因为每个动作都对应一次模型调用或工具执行,更少的动作不仅直接提升得分,也显著降低 token 消耗。
在理论连接上,PRO-LONG 的三个设计原则相互支撑。简单性(simplicity)意味着写入阶段不需要复杂的决策模块,从而避免了额外的错误来源和训练成本;无损性(losslessness)保证了信息不会在任何写入阶段被提前丢弃,使得事后检索成为可能;与 coding agents 的兼容性(compatibility)则提供了实现无损读取的实际能力,因为代码搜索可以精确、可组合、可扩展。三者共同构成一个完整的理论闭环:如果智能体能够用代码搜索完整历史,那么它就不需要牺牲保真度来换取可处理性。这一框架也有其适用范围:它假设智能体具备足够的代码执行能力,并且任务的历史可以被结构化地记录。对于非结构化、多模态或需要复杂社交推理的任务,程序化日志是否同样有效,仍有待探索。
从算法层面看,PRO-LONG 的推理循环可以被理解为一个“感知—检索—规划—执行—记录”的迭代过程。在每一个时间步,环境执行完智能体上一批动作后,PRO-LONG 的 write 操作会自动将一个结构化条目追加到 logs.txt,包含动作编号、关卡、尝试次数、得分、智能体的计划摘要、所选动作以及结果 board。随后,智能体在读取阶段通过工具调用访问 logs.txt,利用 grep、正则、python 等工具搜索历史信息,例如分数变化、特定 board 模式、动作序列等,最终生成下一步行动计划并写入 actions.json。这个循环的核心在于,检索不是由 harness 预先设计好的,而是完全委托给模型自身的程序化推理能力。正是这种设计,使得同一个简单 harness 能够适配 ARC-AGI-3 中规则各不相同的 25 个游戏,因为模型可以根据每个游戏的具体需求,自行决定如何搜索和利用历史。
技术架构
PRO-LONG 的技术架构可以用“一个极简日志层加到一个基础 coding agent 上”来概括,但其简洁性背后蕴含着对现有复杂 harness 设计哲学的重新审视。整个系统的基础是一个标准的 coding agent:它运行在一个循环中,能够调用文件系统读写、bash 命令、python 执行等工具。在 ARC-AGI-3 的评估中,GPT 模型使用 Codex agent 框架,Claude 模型使用 Claude Code,二者都在一个沙箱容器中运行,只能使用 Python 标准库。这一基础设置本身已经比许多传统 benchmark 的参考智能体强大得多——例如 ARC-AGI-3 的官方参考智能体只能看到最近 3 到 5 个 board 状态,BALROG 智能体也只能访问最近 16 个观察。因此,作者首先建立了一个“no-log”基线:coding agent 可以访问所有标准工具,但没有 PRO-LONG 提供的结构化外部日志,只能依赖工作空间中的自我笔记和 helper 函数来维系历史记忆。
PRO-LONG 在这个基础之上只增加了一个核心组件:logs.txt。这个日志文件以追加方式记录每一次交互的关键信息。具体来说,每个日志条目包含一个头部(记录动作编号、关卡、当前尝试、得分),接着是智能体上一轮生成的计划摘要,然后是执行的动作,最后是动作带来的结果 board。日志中还包括特殊标记,如 [INITIAL BOARD STATE] 表示初始 board,[POST-ACTION BOARD STATE] 表示每次动作后的 board,以及 [frame 1/N] 到 [settled] 的动画帧序列。这些标记为智能体程序化解析提供了清晰的锚点。值得注意的是,日志不压缩、不摘要、不删除,所有原始信息都完整保留。作者报告,在部分游戏中,日志行数超过 32 万行,但检索依然可行。
数据在系统中的流动路径清晰而直接。输入首先来自 ARC-AGI-3 环境,以 64×64 的像素网格呈现,每个像素从 16 色颜色表中选取一种颜色,对应一个 ASCII 字符。在每个回合,环境将当前状态交给智能体,智能体调用工具读取 logs.txt,并可能运行 Python 脚本对日志进行解析、搜索或聚合。基于检索到的历史信息,智能体生成一段战略说明和行动计划,最终把动作序列写入 actions.json。环境依次执行这些动作,每次动作后的状态又被追加回日志,循环往复。整个流程中,智能体拥有两类主要工具:一类是用于读取和搜索日志的“感知工具”,如 read、grep、sed、awk、wc、tail、head;另一类是用于推理和规划的“程序工具”,主要是 Python 解释器。PRO-LONG 把这两种能力紧密结合起来,使得模型不仅能够“看到”历史,还能够“计算”历史。
在技术架构上,PRO-LONG 的关键创新在于它把记忆检索问题完全交给了智能体的代码能力。传统的 memory harness 往往需要在系统层面设计检索机制,比如向量数据库、关键词索引、分层记忆管理器等。这些机制虽然强大,但增加了系统复杂性和超参数调优成本,并且往往需要针对特定模型或任务进行优化。PRO-LONG 则反其道而行之,它不提供任何内置检索算法,而是把日志作为一个纯文本文件交给智能体,由智能体根据当前任务自行决定如何搜索。这一设计具有几个显著优势。第一,它最大限度地保持了信息的原始性和完整性,避免了任何写入阶段的决策损失。第二,它与现代 coding agents 的能力高度契合,因为代码搜索、正则匹配、文本处理本来就是这些智能体的“母语”。第三,它具有极强的通用性,同一个 harness 可以适用于规则完全不同的游戏,因为检索策略是由模型动态生成的。
实现细节方面,论文采用了若干重要工程选择。首先是 board 表示:所有模型都使用 64×64 的文本网格,每个像素映射为一个 ASCII 字符,颜色表在系统 prompt 中给出。这种表示虽然对视觉模型来说不够自然,但为程序化解析提供了便利。其次是动作空间:包含四个方向移动、点击特定坐标、空格/交互、撤销和重置,不同游戏可用的动作子集不同。第三是预算控制:默认配置下每个游戏最多 500 个动作,每轮最多 20 个动作。这一设置既保证了与基线的公平比较,也限制了总成本。第四是工具限制:智能体只能使用 Python 标准库,这防止了它依赖外部库来“作弊”,同时也测试了模型在受限环境下的编程能力。最后是 prompt 设计:PRO-LONG 的系统 prompt 仅约 30 行,远短于 WorldModeler 约 600 行的复杂 prompt,这进一步体现了其极简主义的设计理念。
从算法叙事的角度看,PRO-LONG 的每一个回合都像是一次小型的“调查与决策”过程。智能体首先被提示读取 logs.txt,并被提醒“以程序化方式解析日志,因为直接从 prompt 中读取完整的 64×64 board 可能引入精度误差”。然后它检查日志中最近的行动和 board,关注分数变化、计划执行情况以及新出现的模式。如果需要,它会运行 Python 脚本对日志进行更复杂的分析,例如用正则提取所有得分变化的时刻,或者用脚本回放动作序列以验证某个关于游戏规则的假设。最终,智能体输出一段战略说明和 1 到 20 个动作组成的计划。整个过程中,没有子智能体、没有共享记忆数据库、没有复杂的 orchestration,只有一个日志文件和一套标准工具。正是这种极简架构,让 PRO-LONG 在保持高性能的同时,大幅降低了 token 消耗和系统维护成本。
实验评估
论文的实验设计围绕一个核心问题展开:一个如此极简的上下文管理框架,是否真能在复杂的长程推理基准上与那些精心设计的专门 harness 相抗衡?为了回答这个问题,作者在 ARC-AGI-3 的公开游戏集上进行了系统评估。ARC-AGI-3 是该基准的第三代,包含 25 个公开游戏,每个游戏由 6 到 10 个难度递增的关卡组成,游戏规则不向智能体披露。因此,智能体必须通过探索逐步推断环境动态,并持续改进策略。这一设计使得 ARC-AGI-3 成为评估探索、目标推断和长期规划能力的理想测试场。作者选择了三种前沿模型进行测试:GPT-5.5(通过 Codex 框架)、Opus 4.6 和 Fable 5(通过 Claude Code),并对比了三个公开发布的强大 harness:WorldModeler(Rodionov, 2026,基于 GPT-5.5)、Arcgentica(Symbolica AI, 2026,基于 Opus 4.6)和 Schema(Impossible Research, 2026,基于 Opus 4.8 和 Fable 5)。
评估指标方面,除了 ARC-AGI-3 官方使用的相对人类动作效率(RHAE)得分外,作者还报告了 pass@1 和 best@k。pass@1 衡量单次独立运行的平均表现,反映了方法的可靠性;best@k 则取 k 次独立运行中的最佳得分,反映了方法在探索空间中的潜在上限。由于 ARC-AGI-3 上不同运行之间存在显著方差,作者认为同时报告这两个指标非常重要。此外,作者还引入了 billed tokens 作为成本指标,并使用统一的换算方式对不同模型家族的 token 成本进行比较,确保公平性。
主要结果令人瞩目。在 500 动作预算下,PRO-LONG 在所有三个模型家族上均比 no-log 基线提升了 15.7 到 21.0 个百分点,平均提升 18.0 个百分点。与专门 harness 相比,PRO-LONG 在 Opus 4.6 上 pass@1 达到 42.4%,超过 Arcgentica 的 39.0%;在 GPT-5.5 上 pass@1 为 41.2%,best@5 为 60.1%,接近 WorldModeler 的 45.1% pass@1;在 Fable 5 上 best@2 达到 82.1%,接近 Schema 的 84.4%。更引人注目的是成本差异:PRO-LONG 在 Codex 上达到 41.2% pass@1 时,使用的 token 仅为 WorldModeler 的 1/5.8;在 Claude Code 上达到 82.1% best@2 时,token 成本为 Schema 的 1/4.2。在更大预算下,PRO-LONG 配合 Fable 5 在 2000 动作限制下达到 94.6% pass@1 和 97.4% best@2,总成本仅 1,750 美元,而 Schema 公布的部分最佳运行成本高达 6,447 美元。
| 模型 / Harness | 指标 | 得分 (%) | 相对成本 |
|---|---|---|---|
| GPT-5.5 + WorldModeler | pass@1 | 45.1 | 基准 |
| GPT-5.5 + PRO-LONG | pass@1 | 41.2 | 5.8× 更低 |
| GPT-5.5 + PRO-LONG | best@5 | 60.1 | 1.2× 更低 |
| Opus 4.6 + Arcgentica | pass@1 | 39.0 | 基准 |
| Opus 4.6 + PRO-LONG | pass@1 | 42.4 | 更低 |
| Fable 5 + Schema | best@2 | 84.4 | 基准 |
| Fable 5 + PRO-LONG | best@2 | 82.1 | 4.2× 更低 |
| Fable 5 + PRO-LONG (2000 actions) | best@2 | 97.4 | 3×+ 更低 |
上表汇总了 PRO-LONG 与最强基线 harness 在匹配评分设置下的主要对比。从表中可以清楚地看到,PRO-LONG 在保持接近或超越顶尖 harness 性能的同时,显著降低了成本。这一结果对当前智能体研究的方法论具有启示意义:复杂的子智能体架构和专用工具并非获得高性能的唯一途径,有时候更简单的信息架构反而更有效。
消融实验进一步揭示了 PRO-LONG 性能的来源。作者在 GPT-5.5 上设计了一个“工具阶梯”(tool ladder)消融,逐步增加智能体对日志的程序化访问能力。结果显示,从仅允许读取工作空间(23.1%),到加入 grep/正则搜索(27.2%),再到加入 Python 执行(38.3%),最后加入 write/edit 工具(41.2%),性能随着程序化能力的增强而稳步提升。值得注意的是,write/edit 工具本身带来的增益相对有限,这表明 PRO-LONG 的主要优势并不来自智能体自己写笔记或保存 helper 函数,而是来自对完整日志的程序化读取和分析。
| 工具层级 | 得分 (%) |
|---|---|
| Read only | 23.1 |
| + Grep/Regex Search | 27.2 |
| + Python | 38.3 |
| + Write, Edit | 41.2 |
上表清晰地展示了程序化能力对性能的贡献。每一级工具的添加都代表智能体能够以更复杂的方式与日志交互,而性能的持续提升说明,真正驱动 PRO-LONG 的是“能否用代码有效地搜索和利用历史”,而不是“能否在工作空间中保存额外信息”。
另一项关键消融比较了“完整日志”与“仅保留最近 25 个动作”的 PRO-LONG 变体,以及 no-log 基线。结果表明,随着 best@k 中 k 的增加,完整日志与截断日志之间的差距不断扩大。这意味着完整日志不仅提高了平均性能,还扩大了“可解游戏集合”——即更多游戏至少在一次运行中被成功解决。这与作者的直觉一致:长程推理任务往往方差更高,因为探索失败模式更多样,而完整历史能够帮助智能体从失败中恢复并找到正确路径。
工作空间持久性消融也支持了同样的结论。作者比较了“保持工作空间持久”和“每次调用后清空工作空间”两种设置。对于 no-log 基线,清空工作空间导致性能下降约 4 个百分点,因为它严重依赖自我笔记和 helper 函数;而对于 PRO-LONG,清空工作空间几乎没有影响,仅下降 0.5 个百分点。这说明 PRO-LONG 已经把关键信息从易失性的工作空间笔记转移到了结构化、持久化的日志中,从而降低了系统对额外记忆机制的依赖。
| 设置 | PRO-LONG | No-Log |
|---|---|---|
| Persistent workspace | 41.2 ± 3.5 | 24.0 ± 2.0 |
| Cleared every call | 40.7 ± 3.6 | 19.9 ± 2.1 |
上表展示了工作空间持久性对两类方法的影响。PRO-LONG 对清空工作空间不敏感,而 no-log 基线则显著下降,这进一步证明了程序化日志的核心作用。
在统计可靠性方面,作者报告了基于 bootstrap 的 95% 置信区间,并多次强调 ARC-AGI-3 上运行间方差显著。这种方差可能源于智能体探索路径的多样性、模型采样的随机性以及某些游戏对初始策略的高度敏感性。因此,论文在可能的情况下同时报告 pass@1 和 best@k,并建议未来研究将缩小这两者之间的差距作为重要方向。总体来看,实验结果表明 PRO-LONG 的性能提升是稳健且有来源的,而非偶然或过度拟合特定游戏。
案例研究
论文通过几个具体游戏的案例分析,进一步阐释了程序化记忆在长程推理中的实际作用。这些案例不仅展示了 PRO-LONG 如何工作,也揭示了它在不同类型游戏中的相对优势与局限。
第一个值得关注的例子是 g50t,一个围绕“rewinding”机制设计的游戏。在这个游戏中,智能体可以通过“rewind”动作创造出“ghost clone”(幽灵克隆),这些克隆会重复智能体之前走过的路径。后期关卡要求智能体协调多个幽灵克隆的位置,让它们按住开关、触发传送门或保持门打开。由于每个关卡需要规划数十个动作,并且错误会在多个时间步后通过幽灵行为反馈回来,g50t 对长程记忆和因果推理提出了极高要求。在作者的实验中,单个 PRO-LONG 运行的日志超过 32 万行,但 GPT-5.5 仍然达到了 56.3% 的得分。这一表现远非偶然,它体现了程序化记忆的两个核心优势:一是能够精确追踪动作历史及其后果,二是能够通过代码搜索快速定位关键动作(如得分变化、幽灵生成位置)。在没有完整日志的情况下,no-log 基线很难维系这种跨多个时间步的因果链条。
另一个代表性例子是 m0r0,一个智能体需要同时控制两个方块在迷宫般环境中移动的游戏。有趣的是,虽然 PRO-LONG 的系统 prompt 并没有明确要求或鼓励智能体构建“世界模型”,但 GPT-5.5 在运行过程中自发地编写了 transition function,并随着关卡难度增加不断扩展这个模型(例如加入开关状态变量)。它还利用广度优先搜索(breadth-first search)在联合状态空间中寻找长度超过 50 个动作的路径。最终,PRO-LONG 在 m0r0 上五个运行全部获得 100% 得分,而 no-log 基线仅得 34.2%。这个案例强有力地说明,当智能体能够可靠地访问完整历史并通过代码进行推理时,它会自发地表现出复杂的规划和模型学习行为,而无需 harness 显式地诱导这些行为。
相比之下,ft09 和 cd82 等游戏则展示了程序化记忆并非在所有场景下都有巨大优势。在这些游戏中,当前 board 状态几乎完全决定了谜题动态,例如需要根据当前可见模式重新着色方块。因此,即使是只依赖当前 board 的基线也能取得较高得分,完整历史提供的额外信息相对有限。论文在图 4 中展示了 25 个游戏的得分分布,PRO-LONG 在几乎所有游戏中都达到或超过 no-log 基线,但提升幅度在游戏间差异显著。这种差异本身揭示了一个重要原则:程序化记忆的价值与任务的长程依赖强度成正比。任务越需要跨越多个动作进行推理、验证假设和修正世界模型,PRO-LONG 的优势就越明显。
工具使用统计也为案例分析提供了补充视角。作者统计了 GPT-5.5 在全部 25 个游戏中的工具调用分布。PRO-LONG 的调用中有 60.6% 是 Python 执行,20.3% 直接作用于日志文件,9.6% 用于跨回合搜索(如 grep、sed、awk),而工作空间管理和笔记写作的调用仅占 19.1%。相比之下,no-log 基线 59.2% 的调用用于工作空间管理,其中 30.3% 用于写笔记,Python 执行仅占 40.8%,且没有任何针对日志的调用。这种对比表明,PRO-LONG 智能体把认知资源主要投入到程序化分析和历史搜索上,而 no-log 基线则不得不花费大量精力维护自己创造的辅助记忆结构。换句话说,PRO-LONG 让智能体从“记忆管理”中解放出来,把更多能力用于“推理”本身。
| 工具类别 | 具体工具 | PRO-LONG | No-Log |
|---|---|---|---|
| Programmatic analysis | Python3 | 60.6% | 40.8% |
| Log parsing | 作用于 logs.txt 的工具 | 20.3% | 0.0% |
| Recent state | tail, head, cat | 10.7% | — |
| Search across turns | grep, sed, awk, wc, find, ls | 9.6% | — |
| Workspace management | 各类导航和文件操作 | 19.1% | 59.2% |
上表的工具调用分布进一步印证了前文结论。PRO-LONG 智能体大量使用日志解析和程序化搜索,而 no-log 基线则将大量调用消耗在工作空间维护和自我笔记上。这种差异从行为层面解释了为什么同样的基础模型在两种 harness 下会表现出截然不同的分析风格和性能水平。
这些案例也揭示了 PRO-LONG 的一些边界。在那些需要复杂视觉理解或精细空间推理的游戏中,文本化的 64×64 网格表示可能不够充分。例如,WorldModeler 使用了视觉输入,这在某些动画或细微颜色变化场景下可能具有优势。PRO-LONG 选择不使用视觉,部分是为了突出程序化记忆本身的作用,但也意味着它在某些视觉密集型任务上可能不如多模态 harness。此外,日志规模在某些游戏中可能超过 100k 行,虽然作者报告检索仍然可行,但如果游戏复杂度进一步增加,或者日志格式变得不那么结构化,程序化检索的效率也可能下降。这些边界提示我们,PRO-LONG 的最佳应用场景是那些历史信息丰富、规则需要通过交互推断、且可以通过文本或代码有效搜索的任务。
综合价值与局限
PRO-LONG 的理论价值在于它提出了一种重新思考智能体记忆的方式。传统上,记忆研究常常围绕“如何压缩信息”展开,而 PRO-LONG 则把问题转向“如何保留信息并高效检索”。这一视角转变具有深远意义:它不再把智能体记忆看作一个需要精心设计的记忆系统,而是看作一个可以由模型自身程序化访问的外部记录。这种转变与现代 coding agents 的兴起密切相关,也暗示了未来智能体研究可能更加关注“上下文工程”(context engineering)而非单纯的“记忆架构设计”。论文因此为我们提供了一个新的概念工具:programmatic memory,即通过代码搜索实现的无损、结构化、可扩展的外部记忆。
从实践影响来看,PRO-LONG 的最大优势在于其成本效益和模型无关性。在 ARC-AGI-3 这样一个高成本基准上,token 消耗往往是决定方法可扩展性的关键因素。PRO-LONG 以 4.2 到 5.8 倍的成本优势达到了与顶尖 harness 相当的性能,这意味着研究者可以用更少的资源进行更多实验、更充分的调优或更大规模的评估。此外,PRO-LONG 的实现极其简单:它只需要在基础 coding agent 上增加一个日志文件和相应的 prompt 说明,无需子智能体、MCP 服务器或复杂的工作流。这种简单性降低了部署门槛,也便于在其他任务或模型上快速验证。对于那些希望研究长程推理但缺乏资源构建复杂 harness 的研究者来说,PRO-LONG 提供了一个极具吸引力的起点。
论文做得特别出色的地方在于其消融实验的设计和解释。作者不仅展示了 PRO-LONG 性能好,还系统地拆解了性能来源,证明增益主要来自完整日志的程序化访问,而非其他附加机制。这种“做减法”的实验风格在当前智能体研究中尤为可贵,因为许多顶尖 harness 往往由多个复杂组件堆叠而成,难以判断哪些组件真正重要。PRO-LONG 的实验结果表明,有时候移除不必要的复杂性反而能更好地揭示问题的本质。此外,论文对运行方差的坦诚讨论也增强了结果的可信度——作者没有回避 pass@1 和 best@k 之间的显著差距,而是将其作为未来研究的重要开放问题提出。
然而,PRO-LONG 也存在一些值得注意的局限。首先,它目前只在 ARC-AGI-3 上进行了评估,这是一个特定的、基于网格的交互式谜题基准。虽然论文在引言中提到了 NetHack 等类似环境,但实际实验并未覆盖这些场景,因此 PRO-LONG 在更开放、更动态或更社会化的任务上的效果尚不清楚。其次,PRO-LONG 假设智能体具备强大的代码执行能力,并且任务历史可以被结构化记录。如果任务涉及大量多模态信息(如视频、音频、自然语言对话),文本日志可能不足以保留关键信息,程序化检索也会变得更加困难。第三,尽管 PRO-LONG 比现有 harness 便宜得多,但单次评估成本仍然不低,特别是在 Fable 5 的 2000 动作设置下,总成本达到 1,750 美元,且某些困难游戏单独就耗费近 300 美元。这意味着在大规模系统评估或产品化部署中,成本依然是一个需要考虑的因素。第四,PRO-LONG 的性能在很大程度上依赖于基础模型的代码能力。如果模型不能有效地编写和调试搜索脚本,那么完整日志的价值就无法充分发挥。因此,PRO-LONG 的成功某种程度上是“模型能力”与“上下文架构”共同作用的结果。
从更广阔的领域趋势来看,PRO-LONG 与当前“用代码扩展模型能力”的研究方向高度一致。无论是 tool use、代码解释器、还是 coding agents,核心思想都是让模型通过外部程序扩展自己的感知、记忆和推理能力。PRO-LONG 的独特贡献在于,它把这种思想应用到了记忆管理上,并展示了极简设计在长程推理中的惊人效果。它既可能启发新的 harness 设计范式,也可能促使研究者重新评估现有复杂 harness 中某些组件的必要性。未来,我们或许会看到更多“把信息完整保留、把检索交给代码”的变体,出现在机器人控制、长期对话、科学实验设计等需要长程记忆的领域。
延伸阅读与思考
要深入理解 PRO-LONG 的学术背景,读者可以从几个相关方向展开。首先是 ARC 系列本身。Chollet(2019)提出的 Abstraction and Reasoning Corpus 奠定了 ARC 的核心理念:通过少量样例评估智能体的抽象推理能力。ARC-AGI-2(Chollet et al., 2026b)将这一理念扩展到更复杂的静态任务,而 ARC-AGI-3(Chollet et al., 2026a)则进一步引入了交互式游戏,强调探索、动态学习和长期规划。这些工作共同定义了当前评估“类人智能”的重要基准。在交互式游戏方面,NetHack Learning Environment(Küttler et al., 2020)和 BALROG(Paglieri et al., 2025)也为长程智能体研究提供了重要平台,虽然 PRO-LONG 未直接在这些基准上测试,但其思想具有潜在的迁移价值。
在记忆与上下文管理方面,Nye 等人(2021)的 scratchpad 工作展示了让模型显式写出中间推理步骤的价值;Packer 等人(2023)的 MemGPT 提出了分层操作系统式记忆;Chhikara 等人(2025)的 Mem0 和 Ouyang 等人(2025)的 ReasoningBank 则关注将经验转化为可检索条目;Xia 等人(2026)的 SkillRL 进一步探索了将轨迹转化为可复用技能。这些工作代表了“写入时压缩”的研究路线。与之相对,Zhang 等人(2025)的递归语言模型和 Cao 等人(2026)关于 coding agents 作为长上下文处理器的研究,则代表了“保留原始信息、程序化查询”的路线。PRO-LONG 可以被视为后者的具体化和成功验证。
在 ARC-AGI-3 的专门 harness 方面,WorldModeler(Rodionov, 2026)强调让智能体编写并持续更新一个 Python 游戏模拟器;Schema(Impossible Research, 2026)也在 Claude Code 上采用了类似的世界模型加验证加搜索的策略;Arcgentica(Symbolica AI, 2026)则构建了一个由多个子智能体组成的复杂系统,每个子智能体负责探索、理论构建、测试或求解。这些方法的共同点是它们都试图通过显式建模游戏规则来辅助推理,而 PRO-LONG 则以更放手的方式让模型自己决定是否需要以及如何构建世界模型。三种方法的哲学差异值得比较:WorldModeler 和 Schema 更像是“教智能体如何建模”,PRO-LONG 更像是“给智能体完整历史,让它自己发现需要建模”。
未来研究方向方面,论文已经指出了几个重要方向。第一是缩小 pass@1 和 best@k 之间的差距,这可以通过强化学习、更好的探索策略或更稳定的检索策略来实现。第二是将 PRO-LONG 与其他记忆机制(如 scratchpad 笔记、压缩摘要、技能库)结合,研究它们之间的互补性。第三是探索模型与 harness 的协同训练,即让模型在学习任务的同时更好地利用程序化记忆。第四是将 PRO-LONG 推广到 ARC-AGI-3 以外的环境,如 NetHack、开放世界游戏或真实世界的长期任务。这些方向都有潜力进一步扩展程序化记忆的应用边界。
更深层次的开放问题包括:在什么条件下,保留完整历史比压缩摘要更有优势?模型自身的代码能力如何影响程序化记忆的有效性?是否存在某种“最优日志格式”或“最优检索策略”可以由 harness 自动发现?以及,当任务历史变得极其庞大(例如数百万行)时,如何保持检索的效率?这些问题不仅关乎 PRO-LONG 的改进,也关乎我们对智能体记忆本质的理解。
就我个人而言,这篇论文最令人惊讶之处在于它用一个如此简单的设计挑战了复杂 harness 的正当性。在智能体研究领域,我们常常默认“更复杂的系统会带来更好的性能”,但 PRO-LONG 提醒我们,有时候问题不在于系统不够复杂,而在于我们没有把正确的信息以正确的方式交给模型。当我看到 GPT-5.5 在 m0r0 中自发编写 transition function 并运行 BFS 时,我意识到,前沿模型的能力可能远超我们当前 harness 所允许它们展现的。PRO-LONG 的价值或许不仅在于它提升了 ARC-AGI-3 的得分,更在于它揭示了一个被低估的设计空间:如果我们信任模型并给它完整、无损、可编程访问的历史,它会比我们想象的更聪明。这既是技术上的启发,也是方法论上的反思——在追求更复杂架构之前,也许我们应该先问一问:信息是否以最佳方式流动?
笔记创建时间: 2026-07-24
阅读方式: L2 深度阅读
Topics:
- "memory_mechanism"
- "agent_architecture"
- "reasoning"
- "long_term_memory"
- "coding_agents"
- "continual_learning"
References: - "duke_university"
- "arc_agi"
- "chain_of_thought"