EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments

Metadata


一、研究摘要

自主智能体(autonomous agent)正从一次性生成正确答案的范式,迈向"在持续交互中不断自我改进"的新阶段。然而,当我们试图评估这种"自我进化"能力时,却面临一个根本性的测量困境:现有的评估方式要么将漫长的改进过程压缩成一个最终分数,要么将评估混杂在开放式的软件工程任务中,使得我们难以分辨智能体究竟是在真正地学习,还是在盲目试错、过拟合可见反馈,或是陷入了毫无意义的失败循环。EvoPolicyGym这篇论文的核心关切,正是在于为这个日益重要的能力领域建立一个可控、可诊断、可比较的评估框架。

作者们提出的核心概念是Autonomous Policy Evolution(自主策略进化)。这个概念的精髓在于:我们不把智能体当作一个静态的解题器,而是把它看作一个在与环境反复交互的过程中,不断修订自身可执行决策策略的系统。想象一个飞行员不仅要在每次飞行后调整操作手册,还要根据每次飞行的反馈重新设计手册的章节结构——这正是自主策略进化所描述的能力。论文将这一能力形式化为一个优化问题:在固定的交互预算(interaction budget)内,一个编码智能体(coding agent)反复编辑一个可执行的策略系统,提交训练回合(train episodes)获取反馈,然后基于反馈继续修订。最终评估的不是训练过程中的最佳表现,而是智能体在隐藏验证集上选出的策略在隐藏测试集上的泛化表现。

这项工作之所以重要,是因为它首次将"策略进化本身"作为被评估的对象,而非仅仅是策略的最终性能。在此之前,SWE-bench等代码智能体评估关注的是能否一次性修复软件缺陷;Reflexion和Self-Refine等自我改进系统关注的是语言层面的反思与精炼;Voyager、Eureka等工作则将自我改进扩展到了可执行工件(executable artifacts)的层面。但这些工作要么缺乏对迭代过程的系统测量,要么将评估混杂在开放式的工程任务中。EvoPolicyGym的独特贡献在于,它创造了一个封闭但富有信息量的评估环境:智能体面对的不是不断变化的软件需求,而是固定但具有挑战性的强化学习环境;它的目标不是通过单元测试,而是在有限的交互预算内最大化隐藏测试集的回报。

实验在Core16套件上进行,这是一个包含16个环境的基准,涵盖Gym/Box2D、MuJoCo、MiniGrid和机器人/驾驶任务。在128回合的交互预算下,GPT-5.5获得了最高的综合排名分数(0.891),并在全部16个环境中进入前两名。Claude Opus 4.7紧随其后(0.750),在MiniGrid家族中表现最强。这些结果本身构成了一个实用的排行榜,但论文的深层价值在于它提供了轨迹级诊断(trajectory-level diagnostics):通过分析智能体如何分配预算、如何利用反馈进行参数调优与结构综合(structural synthesis),作者们揭示了自主策略进化能力背后更深层的机制差异。这项工作不仅为当前大语言模型智能体的能力提供了量化基准,更为理解"智能体如何从稀疏的行为证据中提取洞见并转化为鲁棒的策略改进"这一根本问题提供了新的实验范式。


二、理论框架

EvoPolicyGym的理论根基深植于几个相互交织的研究传统:强化学习(Reinforcement Learning, RL)中关于策略搜索与样本效率的长期探索、代码智能体(coding agent)领域中关于工具使用与长期规划的最新进展,以及元学习(meta-learning)和自改进(self-improvement)研究中关于"学习如何学习"的思考。理解这一框架,需要我们追溯这些思想脉络,并把握论文如何将它们熔铸为一个新的评估范式。

从强化学习的视角来看,策略进化本质上是一个策略搜索问题。传统RL方法——无论是基于值函数的Q-learning,还是基于策略梯度的PPO(Proximal Policy Optimization)——都假设智能体通过参数更新(通常是梯度下降)来改进一个固定架构的策略网络。然而,EvoPolicyGym所考察的编码智能体走的是一条截然不同的道路:它不调整神经网络的权重,而是直接编辑策略的源代码,可能引入新的模块、改变控制逻辑、添加记忆结构,甚至完全重写策略的架构。这种"代码级"的策略搜索空间远比参数空间更加开放,也更加难以导航。论文的理论洞察在于,将这种代码级的策略改进形式化为一个有界优化问题(bounded optimization problem):智能体在固定的交互预算内,必须在探索新的策略结构与利用已知结构进行参数调优之间做出权衡。

论文对自主策略进化的形式化定义值得我们仔细理解。设第 i 次可见修订时,智能体观察到工作空间状态 Wi、先前提交的反馈 Fi 以及剩余预算 Bi。编码智能体 πθ(由语言模型及其工具使用框架组成)根据这些信息以及累积历史 Hi,输出工作空间补丁 ui 和服务器提交的指令 si。这一过程的数学表达为:

πθ(Wi,Fi,Bi,Hi)(ui,si,Hi+1),si{}C(Bi)

其中 si= 表示本次修订不请求训练评估,而 siC(Bi) 表示在剩余预算内请求一个有效的训练提交。工作空间的更新遵循 Wi+1=apply(Wi,ui),对应的策略系统为 Pi+1=Φ(Wi+1)。服务器操作 S 返回新的反馈 ΔFi 和消耗的回合数 ci,预算随之更新为 Bi+1=Bici

这个形式化框架的精妙之处在于,它将预算本身作为被测量的能力的一部分。智能体不仅要尽可能提高策略性能,还要在有限的交互次数内高效地做到这一点。这要求智能体具备三个层次的能力:首先是信息获取的决策——决定什么时候提交策略进行评估、用多少回合来测试;其次是探索与利用的平衡——决定是尝试全新的策略结构,还是在现有结构上调优参数;最后是从稀疏证据中学习——将有限回合的rollout反馈转化为有效的代码修改。这与传统RL中样本效率的概念形成有趣的对比:在标准RL中,样本效率关注的是算法需要多少环境交互才能收敛到好策略;而在EvoPolicyGym中,样本效率取决于一个通用的编码智能体能否在没有专门RL训练算法的情况下,仅通过代码编辑和环境反馈实现策略改进。

论文进一步引入了**可见性边界(visibility boundary)**的概念来确保评估的公平性。训练回合的反馈对智能体完全可见,包括回合摘要、轨迹记录、诊断流和错误报告;但验证集和隐藏测试集对智能体完全不可见。最终的评估流程是:当128回合的训练预算耗尽后,服务器在所有提交过的策略快照中,选择隐藏验证集上表现最好的一个,然后用这个选中的策略在隐藏测试集上进行最终评估。这意味着智能体无法直接针对测试集进行过拟合,而必须学会从有限的训练反馈中推断出能够泛化的策略改进。

这一理论框架的假设和边界同样值得审视。首先,论文假设智能体能够通过编辑Python代码来有效表达策略改进,这意味着智能体必须具备相当的编程能力;其次,环境接口遵循Gymnasium标准的reset/step模式,这虽然保证了广泛的兼容性,但也限制了那些需要非标准交互模式的环境;最后,固定的128回合预算对于某些复杂环境(如需要视觉抽象的CarRacing或需要符号规划的MiniGrid)来说可能非常紧张,这既是设计上的有意为之——以创造优化压力——也可能是某些任务上性能受限的原因。这些假设共同界定了EvoPolicyGym的适用范围:它评估的是在紧凑交互预算下,编码智能体通过代码编辑实现策略进化的能力,而非任意强化学习问题的最优解法。


三、技术架构

EvoPolicyGym的技术架构可以看作一个精心设计的"智能体-环境-评估平台"三元系统,其中每个组件都被赋予了明确的职责,而它们之间的交互边界则构成了整个评估框架的骨架。理解这个架构,需要从系统的全局视图出发,追踪数据如何在各个组件之间流动,以及关键的设计决策是如何服务于评估目标的。

系统的核心是一个沙盒化的评估平台(sandboxed platform),它扮演着"裁判"和"信息守门人"的双重角色。平台为每个评估运行准备一个初始的工作空间,其中包含一个最小化的策略入口文件 policy.py,该文件导出一个 Policy 类,具有 __init__(obs_space, action_space, env_meta)reset(episode_index)act(obs) 三个接口方法。这个极简的接口设计至关重要:它将策略系统的内部复杂性(可能包含记忆、规划器、控制器、学习参数等)与环境的运行时需求完全解耦。平台拥有真正的Gymnasium环境,负责管理环境的reset和step调用;而智能体提交的策略系统只负责将观察映射为动作。这种分离使得任何Gymnasium兼容的环境都可以通过适配器包装后纳入评估,而无需修改智能体的交互协议。

智能体与平台的交互通过一个本地HTTP服务进行。智能体可以调用 /info 查询剩余预算和协议限制,通过 /task 读取任务描述和策略契约,通过 /submit 请求可见的训练rollout。每次提交时,智能体可以指定要评估的回合索引列表(在Core16中,每次提交可以使用1-128个回合)。平台在收到有效请求后,会对当前工作空间进行快照,执行请求的训练回合,并将结果写入 feedback/submit_NNN/ 目录。反馈内容包括 summary.json(状态、回报统计、错误信息等)以及每个成功回合的 trajectory.jsonl(逐步轨迹记录)和可选的环境特定媒体(如视频帧)。重要的是,平台采用无回滚(no-rollback)语义:智能体对自己的修改负责,如果一次编辑破坏了策略,这个破坏会持续到智能体修复它为止。这模拟了真实软件开发中"活着的"工作空间,增加了决策的压力和真实感。

数据流在这个系统中遵循一个清晰的循环:智能体读取工作空间和反馈 → 编辑代码 → 决定提交策略进行评估 → 平台执行rollout并生成反馈 → 智能体读取新反馈并继续编辑。这个循环持续进行,直到128回合的预算耗尽。此时,平台进入隐藏评估阶段:它遍历所有成功提交的策略快照,在隐藏验证集(16个回合)上评估每个快照,选择验证回报最高的策略(平局时选择较晚提交的),然后将选中的策略在隐藏测试集(32个回合)上进行最终评估。这个设计确保了智能体在整个优化过程中无法接触到任何验证或测试信息,从而防止了信息泄露和过拟合。

环境层的可扩展性是架构的另一个亮点。论文的作者实现了一个适配器层,理论上支持从Classic Control、Toy Text、Box2D、MuJoCo、Atari/ALE、MiniGrid、MiniWorld、HighwayEnv、Gymnasium-Robotics到MO-Gymnasium、Browser-Gym、MiniWoB++和MetaWorld的广泛环境家族。适配器负责将环境特定的观察和动作转换为紧凑的统一模式,加载可复现的训练/验证/测试分割,并将隐藏的分割元数据保存在智能体工作空间之外。在本文的实验中,作者选择了一个经过校准的Core16子集,涵盖控制、视觉驾驶、运动、符号部分可观测性和操作任务,以确保实验的可管理性和结果的可比性。

从技术实现的角度来看,EvoPolicyGym的架构体现了"控制变量"的科学原则。它固定了交互协议、可见性边界、预算机制和工件语义,而让环境覆盖面和智能体实现自由变化。这使得不同智能体之间的比较具有意义:它们面对相同的约束,但采用不同的策略来导航搜索空间。在实验配置中,四个被评估的智能体——GPT-5.5(通过Codex harness)、Claude Opus 4.7、MiniMax-M3和DeepSeek-V4-Pro(后三者通过Claude Code harness)——都使用相同的运行级配置:Core16环境列表、128回合训练预算、每次提交1-128回合的灵活度、16个隐藏验证回合和32个隐藏测试回合。这种统一性确保了排行榜分数反映的是智能体本身的能力差异,而非评估条件的不平等。


四、实验评估

Core16实验的设计本身就是一次关于"如何科学评估自主策略进化"的方法论展示。作者们没有简单地将智能体扔进环境并比较最终分数,而是构建了一个多层次的评估体系,从聚合排行榜到轨迹级诊断,力求同时回答"哪个智能体更强"和"为什么更强"这两个问题。

实验在四个环境家族上展开:Gym/Box2D(Acrobot、ContinuousMountainCar、BipedalWalker、CarRacing)、MuJoCo(Reacher、HalfCheetah、Ant、Pusher)、MiniGrid(DoorKey、KeyCorridor、FourRooms、ObstructedMaze)以及机器人/驾驶(Parking、Roundabout、FetchPush、FetchPickAndPlace)。这种多样性是有意设计的:低维控制任务测试紧凑反馈解释能力,CarRacing增加视觉抽象挑战,MiniGrid强调持久符号状态管理,而Fetch任务要求几何相位控制。由于不同环境的回报尺度不可直接比较,论文采用了基于排名的聚合分数。对于每个环境,五个参评对象(四个智能体加一个均匀随机策略)根据隐藏测试集上的平均回报获得排名,然后转换为0-1之间的标准化分数:

sm,e=1ranke(m)1Ne1

其中 Ne=5。这种排名标准化确保了每个环境在聚合中贡献相等的权重,无论其原始回报尺度如何。

排行榜结果揭示了一个引人注目的分层格局。GPT-5.5以0.891的Core16综合分数位居榜首,获得9个环境的第一名,并且在全部16个环境中进入前两名。Claude Opus 4.7以0.750排名第二,赢得5个环境的第一名和12个环境的前两名。然而,深入分析发现不同任务家族明显偏好不同的智能体:GPT-5.5在Gym/Box2D、MuJoCo和机器人/驾驶家族中领先,而Claude Opus 4.7在MiniGrid家族中以0.938的家族分数超越了GPT-5.5的0.812。这种任务依赖的优势分布本身就是重要的发现——它表明不存在universally最强的智能体,而是不同智能体在不同类型的策略搜索空间中有不同的优势。

模型 Harness Gym/Box2D MuJoCo MiniGrid 机器人/驾驶 Core16 第一名数 前二名数
GPT-5.5 Codex 0.938 0.875 0.812 0.938 0.891 9 16
Claude Opus 4.7 Claude Code 0.812 0.750 0.938 0.500 0.750 5 12
MiniMax-M3 Claude Code 0.375 0.625 0.500 0.625 0.531 1 3
DeepSeek-V4-Pro Claude Code 0.375 0.250 0.438 0.375 0.359 1 1
随机策略 - 0.000 0.000 0.375 0.062 0.109 0 0

表:Core16排行榜。分数为基于排名的标准化分数,越高表示在该家族中越可靠。

然而,最终分数仅仅是冰山一角。论文进一步展示了后验最优验证分数轨迹(post-hoc best-so-far hidden-validation score trajectories),这些曲线追踪了在每个运行过程中,如果事后用隐藏验证集评估所有已提交的策略,最优分数如何随已消耗的预算演化。这些曲线对智能体本身是不可见的,仅用于分析。它们揭示了智能体发现高质量策略的时间模式:MiniGrid环境中常见稀疏但剧烈的跳跃,MuJoCo环境中增益更为渐进,而一些机器人/驾驶任务则在消耗了大量预算后才出现延迟改进。这些轨迹告诉我们,相似的最终分数可能来自截然不同的优化路径——有的智能体早期就发现了好策略然后进入平台期,有的则在预算后期才实现突破。

一个特别有价值的发现是关于局部胜利与全局可靠性之间的关系。MiniMax-M3和DeepSeek-V4-Pro各在一个环境中获得第一名(HalfCheetah和Roundabout),但它们的综合分数远低于前两名。这说明排行榜奖励的不是孤立的特长,而是跨环境的一致近优表现。对于研究社区而言,这是一个重要的信号:真正强大的自主策略进化能力意味着智能体能够识别任务的内在结构并构建合适的策略机制,而非偶然在某个任务上撞上好运气。


五、案例研究

聚合统计数据揭示了"什么"在发生,而案例研究则帮助我们理解"如何"发生。论文选取了两个代表性环境——CarRacing(综合主导型任务)和BipedalWalker(调优主导型任务)——来展示不同智能体在策略进化过程中的具体行为模式。

CarRacing是一个极具启发性的案例,因为它要求智能体从原始像素中构建驾驶策略,这涉及视觉感知、状态抽象和控制机制的综合构建。论文中的图7展示了四个智能体在CarRacing上的反馈利用轨迹,每一条轨迹都连接着"观察到的证据"→"智能体对失败的归因"→"策略修订"→"结果"。GPT-5.5的轨迹展示了一个典型的成功模式:当早期试验显示在急弯处奖励下降时,它识别出"对晚期弯道识别薄弱"的问题,增加了前瞻距离并合并掩码间隙;当发现智能体在草地上被困住时,它诊断出"制动过于保守",将策略切换为连续前进运动并添加更平滑的转向恢复逻辑。这些修订不是对分数变化的简单反应,而是将可见的失败归因到具体的感知或控制机制,然后针对性地修改代码结构。

相比之下,较弱智能体的轨迹揭示了两种不同的失败模式。MiniMax-M3在CarRacing上虽然进行了大量的结构编辑(如添加无路检测模式和探索性转向扫描),但性能短暂提升后进入平台期并最终退化,显示出它难以稳定地巩固有效的机制。DeepSeek-V4-Pro则陷入了局部调优的陷阱:它尝试通过微调偏移量和制动参数来改进一个简单策略,但发现这不足以解决问题后,又进行结构性重新设计,却未能产生更好的候选策略。Claude Opus 4.7的表现介于两者之间,它持续进行结构综合编辑并达到了相当高的分数,但在某些情况下也会因为过度调整而需要回滚。

BipedalWalker展示了互补的模式。这是一个调优主导型任务——一旦建立了能够产生可行步态的控制器拓扑结构,改进主要来自调整增益、阈值和分支局部参数。然而,关键洞察在于调优只有在正确的结构存在时才有用。GPT-5.5是唯一一个达到正回报步态的运行(时间线最优分数71,验证选中的隐藏测试回报48.874),它的轨迹在早期进行了一些结构综合后,进入了一个参数调优阶段来精炼步态。而Claude Opus 4.7、MiniMax-M3和DeepSeek-V4-Pro的时间线最优分数均为负数,意味着它们从未建立起可行的步态拓扑,后续的结构搅动和候选重访都未能跨越这个回报阈值。这个案例生动地说明了结构综合是参数调优的前提——如果基础机制错误,再精细的参数调整也无济于事。

论文附录中还提供了几个成功策略的代码片段,这些短小而有状态的程序极具启发性。CarRacing的最强策略将像素转换为道路掩码,追踪近、中、远三个中心点,结合前瞻曲率和边缘警告,并在视觉置信度下降时降低速度。HalfCheetah的策略存储步态参数,通过正弦振荡产生周期性运动,并根据根高度进行安全缩放。ObstructedMaze的策略从7x7的自我中心图像构建持久的世界模型,使用BFS规划路径。FetchPush的策略计算从物体到目标的推动方向,分阶段移动夹持器。这些策略的共同模式是:它们都建立了一个任务抽象,将控制器或规划器附加到该抽象上,并添加针对可见反馈暴露出的失败模式的恢复逻辑。这印证了论文的核心论点:强大的自主策略进化不仅仅是调参,更是发现任务适当的机制


六、综合价值与局限

EvoPolicyGym在自主智能体评估领域做出了几项独特而重要的贡献。从理论层面看,它将"策略进化"从一个模糊的概念提升为一个可形式化、可基准化的问题设定,明确了预算约束、可见性边界和泛化评估三个核心维度。这为未来研究提供了一个清晰的共同语言:当我们谈论"自我改进"时,我们是在谈论在有限反馈下的策略搜索,而不仅仅是最终分数的高低。从实践层面看,Core16排行榜和轨迹级诊断为社区提供了一个立即可用的评估工具,研究者可以用它来比较新的智能体架构、提示策略或工具设计。特别是结构综合与参数调优的区分,为理解智能体在不同类型任务上的行为差异提供了有价值的概念透镜。

这项工作也存在值得正视的局限性。首先,128回合的交互预算虽然创造了有意义的优化压力,但对于某些复杂环境来说可能过于紧张,这可能导致评估低估了那些需要更多探索才能展现优势的方法。其次,智能体的评估与其编码框架(harness)紧密耦合——GPT-5.5使用Codex框架,而其他模型使用Claude Code框架——论文有意将框架作为评估维度的一部分,但这意味着排行榜比较的是"模型+框架"的联合系统,而非纯模型能力。第三,结构综合与调优的区分虽然是诊断性的有力工具,但它本质上是一种后验分类:AST拓扑的变化不一定对应语义上的机制创新,两个不同的拓扑可能实现相似的行为,而一个拓扑也可能混杂了有用和有害的想法。作者诚实地承认这些诊断是"保守的代理,而非语义证明"。

从更广泛的研究趋势来看,EvoPolicyGym代表了评估范式从"结果导向"到"过程导向"的转变。它呼应了近期关于代码智能体行为分析的工作——如AgentLens和SWE-chat——这些研究都指出聚合成功率可能掩盖中间行为的复杂模式。EvoPolicyGym将这一洞察带入了策略进化领域,通过强制性的可见性边界和预算约束,创造了一个特别适合过程分析的环境。这项工作还可能对AI安全研究产生间接影响:理解智能体如何在有限反馈下修订可执行策略,有助于我们预见和监控更具自主性的系统可能的行为模式。


七、延伸阅读与思考

EvoPolicyGym建立在一系列重要前期工作之上。在代码智能体评估方面,SWE-bench(Jimenez et al., 2024)开创了执行grounded的软件工程评估,而SWE-agent(Yang et al., 2024)、OpenHands(Wang et al., 2024b)和CodeAct(Wang et al., 2024a)则展示了工具使用交互式调试的能力。长期演化评估方面,SWE-evo(Le et al., 2026)、RoadmapBench(Xu et al., 2026)和SpecBench(Hamblin et al., 2026)揭示了代码智能体在持续修改中面临的退化问题。在自改进系统方面,Reflexion(Shinn et al., 2023)和Self-Refine(Madaan et al., 2023)证明了语言级反思的有效性,而Voyager(Wang et al., 2023)、Eureka(Ma et al., 2023)、FunSearch(Romera-Paredes et al., 2024)和AlphaEvolve(Novikov et al., 2025)将这一范式扩展到了可执行工件。Frontier-Eng(Chi et al., 2026)与EvoPolicyGym最为接近,它研究有界优化下的生成工程设计,但覆盖的是更广泛的工程环境而非标准RL环境。

未来研究可能沿着几个方向延伸。首先,可以探索不同的预算制度——动态预算、渐进式预算释放或基于进步的预算奖励——来研究智能体如何适应不同的资源约束。其次,可以引入更丰富的反馈类型,如人类示范、课程学习信号或多智能体交互,来测试反馈形式对进化效率的影响。第三,更深度的机制研究可以聚焦于智能体的"心智模型":它是如何在代码中表示环境动态的?它何时选择探索新的结构,何时选择在现有结构上调优?这些问题的答案将帮助我们设计更强大的自主系统。

这个领域最深层的未解挑战或许在于开放域的策略进化。Core16是固定的、已知的环境集合,而真正的自主智能体需要面对不断变化、前所未见的任务。如何将EvoPolicyGym中获得的洞见迁移到开放域,如何在策略进化中实现跨任务的迁移学习,以及如何确保这种进化始终朝着有益的方向发展,这些都是悬而未决的根本问题。

个人而言,这篇论文最发人深省的地方在于它揭示了"聪明地失败"与"愚蠢地尝试"之间的微妙区别。在CarRacing的案例中,所有智能体都在编辑代码、都在提交策略、都在读取反馈,但GPT-5.5和Claude Opus 4.7能够将失败归因到正确的机制层面并做出针对性修订,而较弱智能体则在错误抽象层面反复折腾。这让我想到人类学习中的一个现象:专家和新手的区别不仅在于知识量,更在于"问题表征"的能力——专家能看到问题的深层结构,而新手只能看到表面特征。EvoPolicyGym的轨迹诊断恰好为我们提供了一种测量这种"问题表征能力"的窗口,这正是它超越简单排行榜的深层价值所在。

Topics:

Powered by Forestry.md