Joint Learning of Experiential Rules and Policies for Large Language Model Agents

Authors: Shicheng Ye, Chao Yu (Sun Yat-sen University)
Venue: arXiv:2506.27136 [cs.AI]
Year: 2025
Code URL: Not explicitly provided
Pages: 9


一、研究摘要

在大型语言模型(Large Language Model, LLM)驱动的智能体(agent)研究领域,一个根本性的挑战始终横亘在前:如何让智能体在复杂的多步交互环境中有效地积累和利用经验。当智能体需要在网页浏览、具身交互或工具调用等场景中完成目标时,它很少能通过单次推理就得出正确答案,而是必须在错误中探索、在反馈中调整,逐步逼近成功。然而,现有方法对这一问题的处理方式呈现出明显的二元对立——经验要么被外化为可读取、可编辑的自然语言规则(rule),以提示(prompting)的形式注入后续决策;要么被内化为模型参数的梯度更新,通过强化学习(Reinforcement Learning, RL)直接优化策略(policy)。这两种路径各有利弊:外化的规则易于解释和复用,却可能与不断演化的策略脱节;内化的参数更新虽然能全局性地改善行为,但在稀疏奖励(sparse reward)环境下往往无法对局部错误提供及时、精准的纠正。Shicheng Ye与Chao Yu的这篇工作正是瞄准了这一割裂现状,提出了联合学习框架 JERP(Joint Learning of Experiential Rules and Policies),试图在同一个训练循环中同时更新经验规则池与策略参数,从而实现两种经验利用方式的互补与协同。

该研究的理论洞察在于,智能体的交互经验实际上具有双重价值:同一批轨迹(trajectory)既可以用来计算策略梯度、更新模型参数,也可以用来提炼可复用的行为指导、修订外部规则库。如果这两条更新通道彼此隔离,规则池将因为策略的演化而逐渐失效,而策略又因为缺乏细粒度的局部指导而在重复性错误上耗费大量探索成本。JERP 的核心思想正是将规则维护与参数学习耦合到同一个训练流程中——在每一次交互 episode 结束后,采样得到的轨迹组被同时用于两个目的:一是通过组相对策略优化(Group-Relative Policy Optimization)更新 LLM 参数,二是通过与参考成功轨迹的对比反思(contrastive reflection)来增删、修改、合并经验规则。这种耦合设计使得规则池能够随策略同步演化,同时那些经过反复验证的稳定行为模式又能逐渐被吸收进模型参数之中,形成一种"外显规则引导当前决策,内化参数承载长期能力"的动态平衡。

从技术贡献来看,JERP 首先将经验规则学习从传统的离线预处理步骤转变为在线训练的内生环节。在已有的提示工程范式中,规则通常由 LLM 从一批历史交互中一次性抽取,之后静态存储;而 JERP 则让规则池在每一轮训练中都根据当前策略的表现进行动态修订。其次,JERP 引入了结构化规则编辑操作(ADD、EDIT、UPVOTE、DOWNVOTE、MERGE),使得自然语言形式的规则维护可以被自动解析和执行,从而在不牺牲可解释性的前提下实现了规则层面的"梯度下降"。第三,JERP 在理论上将规则池与策略参数统一到一个联合优化目标中,明确揭示了两者之间的耦合关系——改变参数会影响智能体对规则的理解方式,而改变规则又会改变策略所依赖的决策上下文。实验层面,JERP 在 AlfWorld 和 WebShop 两个多步交互基准上取得了超越 GRPO、RLOO、Reflexion 和 ReAct 等强基线的表现,尤其在需要长序列操作和丰富中间约束的任务类型(如 Clean、Heat、Cool、Pick2)上提升更为明显。消融实验进一步证实,持续更新规则池而非仅在初始阶段构建一次,是 JERP 获得性能优势的关键因素。这些结果表明,JERP 不仅是一个实用的训练框架,更提供了一个重新思考"经验如何在 LLM 智能体中表示与流动"的概念工具。

二、理论框架

JERP 的理论根基深植于部分可观察马尔可夫决策过程(Partially Observable Markov Decision Process, POMDP)与经验驱动的策略优化两大传统之中,但它对这两个领域进行了富有创造性的重新整合。在标准的 POMDP 框架下,智能体因无法直接观测环境的全局状态,只能依赖交互历史来做出决策。对于 LLM 智能体而言,这一历史不仅包括任务描述和过往的观察-动作序列,还可能包含从外部检索的经验知识。然而,现有文献往往将外部知识的维护视为与策略学习无关的独立模块,忽略了二者之间的深层耦合。JERP 的理论突破在于,它将经验规则池(experiential-rule pool)显式地纳入了策略优化的数学表述,从而把"规则如何影响行为"与"行为如何反馈修订规则"统一到了同一个优化问题中。

具体而言,作者将交互过程形式化为一个七元组 POMDP:E=(S,A,O,P,Ω,R,γ,T),其中 SAO 分别表示状态、动作和观察空间,P(st+1|st,at)Ω(ot+1|st,at) 分别是状态转移和观察函数,R(st,at) 为奖励函数,γ[0,1) 为折扣因子,T 为最大交互步数。由于真实状态不可见,智能体在时刻 t 只能基于交互历史 ht=(o0,a0,o1,,at1,ot) 进行决策,其中 o0 包含初始任务描述。与传统 POMDP 策略不同的是,JERP 的策略输入还包含从长期经验规则池 K(d) 中检索出的工作规则集 K^(d)。因此,时刻 t 的输入提示为:

xt=d,ht,K^(d)

其中 d 表示当前任务实例。参数化策略 πθ 据此采样动作:atπθ(|xt)。一条完整轨迹 τ 的折扣回报为:

G(τ)=t=0T1γtrt

JERP 的核心优化目标同时覆盖策略参数 θ 和经验规则池集合 K={K(d)}

J(θ,K)=Edp(d)Eτpθ(τ|d,K)[G(τ)]

这一表述的深刻之处在于,轨迹分布 pθ(τ|d,K) 同时依赖于 θK,因此改变其中任何一个都会改变智能体的行为分布。这一耦合关系正是 JERP 设计的理论基石——如果仅更新参数而规则保持不变,策略对规则的理解可能与规则本身的语义产生错位;反之,如果仅更新规则而不调整参数,新规则可能无法被当前策略有效利用。只有将二者置于同一优化目标下,才能实现协同演化。

在策略优化层面,JERP 采用了组相对策略优化的思想,具体借鉴了 GRPO(Group Relative Policy Optimization)和 GiGPO(Group-in-Group Policy Optimization)的方法论。与早期依赖独立价值模型(value model)的 PPO 不同,GRPO 通过在同一个任务实例下采样 N 条完整轨迹,利用组内奖励的均值和标准差来构造优势信号(advantage),从而避免了价值模型的训练开销和估计误差。JERP 在此基础上进一步扩展:同一组轨迹不仅用于计算策略梯度,还被用于经验规则池的更新。具体地,对于任务实例 d,从旧策略 πθold 中采样轨迹组 {τi}i=1N,计算组内奖励的均值 μd 和标准差 σd

μd=1Nj=1NR(τj),σd=1Nj=1N(R(τj)μd)2

i 条轨迹的组相对优势定义为:

Ai=R(τi)μdσd+δ

其中 δ 为防止除零的数值稳定常数。遵循 GiGPO 的策略,同一条轨迹内的所有时间步共享相同的优势值 Ai,tAi。在此基础上,参数更新目标采用带裁剪(clipping)和 KL 正则化的 GRPO 损失:

LGRPO(θ)=1Ni=1N1|τi|t=0|τi|1i,t(θ)

其中单步替代项为:

i,t(θ)=min(ρi,t(θ)Ai,t,ρ¯i,t(θ)Ai,t)βDKL(πθ(|xi,t)πref(|xi,t))

这里 ρi,t(θ)=πθ(ai,t|xi,t)πθold(ai,t|xi,t) 为重要性采样比率,ρ¯i,t(θ)=clip(ρi,t(θ),1ϵ,1+ϵ) 为裁剪后的比率,ϵ 为裁剪系数,β 为 KL 正则化系数,πref 为参考策略。这一公式组合了 TRPO/PPO 风格的信任区域约束与 GRPO 的组相对优势估计,在多步交互任务中既保证了更新的稳定性,又避免了价值模型的额外负担。

在经验规则更新层面,JERP 面临的理论挑战更为独特:规则内容以自然语言表达,无法直接用梯度下降优化。作者提出的解决方案是"对比反思"(contrastive reflection)——利用一个参数冻结的 LLM,根据当前规则池 K(d)、当前轨迹组 Td 和参考成功轨迹集 T+(d),生成结构化的规则编辑操作。这些操作包括五种基本类型:ADD(添加新规则)、EDIT(修改现有规则)、UPVOTE(提升规则效用分数)、DOWNVOTE(降低规则效用分数)和 MERGE(合并语义相近的规则)。这种设计将规则维护转化为一个离散的符号操作空间中的搜索问题,每一步更新都基于对"当前失败行为"与"历史成功行为"之间差异的反思。理论上,这相当于在规则空间中进行一种启发式的局部搜索,其目标不是最小化某个可微的损失函数,而是最大化规则池对未来决策的指导价值。这种不可微但可解释的规则更新机制,与可微的参数更新机制形成了巧妙的互补:参数更新负责在连续的语义空间中精细调整行为分布,而规则更新负责在离散的符号空间中捕捉和传递高层次的策略洞察。

三、技术架构

JERP 的技术架构可以被视为一个双环耦合系统:外环负责经验规则池的全生命周期管理,内环负责基于组相对优势的策略参数优化,而两条环路的交汇点则是每一轮交互结束后产生的轨迹数据。整个系统的数据流从任务实例的初始化开始,流经规则检索、交互执行、轨迹收集、双重更新,最终回到更新后的规则池和策略,形成一个自我增强的闭环。

在每一轮训练 episode 的起始阶段,系统首先为当前任务实例 d 构建工作规则集 K^(d)。长期经验规则池 K(d) 中的每条规则由一个文本内容 zi 和一个效用分数 si 组成。出于计算效率和上下文长度限制的考虑,系统不会将全部规则注入提示,而是按照效用分数降序选取前 k 条规则构成工作集:K^(d)=topk(K(d),k)。这一设计体现了一个重要的工程权衡:规则池可以随训练无限增长(受容量上限约束),但每次决策只能利用最相关的有限子集。在工作集内部,规则按照固定模板组织进输入提示,与任务描述和交互历史拼接成完整的决策上下文 xt。在同一个 episode 内,工作规则集保持不变,以避免时间步级别的规则重选导致的上下文震荡。

交互执行阶段遵循标准的 LLM 智能体流程:策略模型根据当前提示生成动作,环境执行动作并返回观察、奖励和终止信号,历史序列随之更新。对于每个任务实例,系统会并行采样 N 条完整轨迹构成轨迹组 Td。这里的采样策略值得注意——由于经验规则池在训练过程中不断演化,不同 episode 即便面对相同任务实例,也可能因为规则池的差异而产生不同的行为分布。这种非平稳性(non-stationarity)既是 JERP 的力量所在(规则可以及时适应新发现的问题),也是其设计难点所在(需要确保训练过程的稳定性)。

当轨迹组收集完毕后,JERP 进入双重更新阶段。第一阶段是模型参数更新,采用前述的 GRPO 目标函数。系统计算每条轨迹的累积奖励,在组内进行标准化得到优势估计,然后通过裁剪后的策略梯度更新 LoRA(Low-Rank Adaptation)参数。这里选择 LoRA 而非全参数微调是一个关键的实现决策:LoRA 通过低秩分解将可训练参数限制在较小的适配器层中,既保留了预训练 LLM 的通用语言能力,又大幅降低了 RL 训练的计算和内存开销。对于需要数百轮交互的智能体训练而言,这种参数高效微调(parameter-efficient fine-tuning)策略几乎是不可或缺的。

第二阶段是经验规则池更新,也是 JERP 最具特色的技术组件。系统首先准备一个参考成功轨迹集 T+(d),其中累积了该任务实例在训练过程中产生的所有成功轨迹(即奖励大于零的轨迹)。随后,参数冻结的 LLM 被提示执行"反思与编辑"(ReflectAndEdit)操作:它接收当前规则池、当前轨迹组(包含成功和失败的轨迹)以及参考成功轨迹,输出结构化的规则编辑列表。这些编辑操作遵循严格的语法规范,确保可以被自动解析和执行。例如,ADD 操作会引入一条全新的经验规则并赋予初始分数 s0>0;EDIT 操作会修改指定规则的文本内容但保留其原有分数;UPVOTE 和 DOWNVOTE 分别对目标规则的分数进行固定步长 δ+δ 的调整;MERGE 则将多条语义相近、功能重叠的规则合并为一条新规则,其分数取原规则中的最高分。分数低于预设阈值或经 DOWNVOTE 多次削弱后的规则将被自动剔除,从而维持规则池的容量上限和整体质量。

这种架构的精妙之处在于,两个更新阶段共享同一组轨迹数据,却实现了不同时间尺度的学习:参数更新通过梯度下降在连续的权重空间中快速调整策略,其效果体现在立即的行为分布变化上;规则更新则通过符号操作在离散的规则空间中积累结构化知识,其效果具有更强的跨 episode 迁移性和可解释性。可以类比人类学习过程:参数更新类似于通过反复练习形成的肌肉记忆或直觉反应,而规则更新则类似于通过反思总结出的显性策略原则——前者让我们更快地行动,后者让我们更明智地行动。JERP 将这两种学习机制统一到了一个计算框架中,使得智能体既能通过参数微调快速适应特定任务,又能通过规则积累沉淀可跨任务复用的经验智慧。

算法 1 完整描述了这一训练流程。外层循环遍历训练轮次,内层循环首先采样任务实例,然后构建工作规则集、收集轨迹组,依次执行参数更新和规则更新,最后将当前 episode 中的成功轨迹追加到参考集合中。整个流程的复杂度主要取决于轨迹采样的环境交互成本和 LLM 推理成本,而规则编辑的解析执行开销相对较小。值得注意的是,参考成功轨迹集的累积机制使得系统能够建立一个持续增长的成功案例库,这些案例为后续的对比反思提供了越来越丰富的参照基准,形成一种"越训练越聪明"的正反馈效应。

四、实验评估

JERP 的实验设计围绕一个核心科学问题展开:当同一批交互轨迹被同时用于参数优化和规则更新时,智能体的决策性能是否优于仅使用其中一种方式?为了回答这一问题,作者在 AlfWorld 和 WebShop 两个具有代表性的多步交互基准上进行了系统评估,并与五类基线方法进行了全面对比。

AlfWorld 是一个文本驱动的家庭环境操控模拟器,包含六种任务类型:拾取放置(Pick)、清洁后放置(Clean)、加热后放置(Heat)、冷却后放置(Cool)、在光照下观察物体(Look)以及拾取两个物体(Pick2)。这些任务要求智能体在部分可观察的环境中执行多步操作,涉及导航、物品交互和状态推理,是典型的长程决策挑战。WebShop 则模拟真实的在线购物场景,智能体需要根据用户的产品需求,通过搜索、浏览、比较和下单等操作完成购买任务,其交互更接近真实世界的信息检索与决策流程。两个环境的评估指标各有侧重:AlfWorld 采用任务成功率(success rate),WebShop 则同时报告平均得分(average score)和任务成功率。

基线方法的选择经过精心考量,覆盖了从简单提示到强化学习的完整谱系。Vanilla LLM 代表最朴素的直接提示方式,不使用任何推理脚手架、跨 episode 记忆或参数更新,其糟糕的表现(AlfWorld 成功率仅 4.1%,WebShop 仅 5.2%)确立了这些多步交互任务的难度基准。ReAct 引入了推理与行动交替进行的在线推理机制,但仍局限于单 episode 上下文。Reflexion 在 ReAct 基础上增加了跨 episode 的自然语言反思记忆,但经验始终停留在模型外部,不参与参数学习。RLOO 和 GRPO 则代表纯参数优化路径:RLOO 采用 REINFORCE 风格的策略梯度,使用留一法(leave-one-out)基线估计优势;GRPO 通过组内轨迹比较进行策略更新,无需独立的价值模型。JERP 在 GRPO 的基础上增加了经验规则池的动态维护,形成了"参数+规则"的双重学习机制。

实验结果呈现出清晰的层次结构。在 AlfWorld 上,JERP 以 61.5% 的总成功率位居第一,超越 GRPO(57.8%)和 RLOO(48.7%)。细分到各任务类型,JERP 的优势在 Clean(65.4% vs GRPO 50.7%)、Heat(67.4% vs GRPO 62.7%)、Cool(60.1% vs GRPO 51.7%)和 Pick2(42.5% vs GRPO 33.9%)上尤为显著,而在 Pick 和 Look 上略低于 GRPO。这一分布模式具有深刻的含义:Clean、Heat、Cool 和 Pick2 通常需要更长的操作序列和更复杂的中间约束管理,智能体在这些任务中更容易犯局部性、重复性的错误——恰恰是经验规则最能发挥作用的场景。相比之下,Pick 和 Look 任务相对直接,参数优化的全局性改善已经足够,额外引入规则池的边际收益较小。

在 WebShop 上,JERP 同样表现最佳,平均得分达到 79.0,成功率达到 64.1%,显著高于 RLOO(得分 71.9,成功率 57.8%)和 GRPO(得分 78.1,成功率 56.2%)。值得注意的是,GRPO 在 WebShop 上的平均得分已经接近 JERP,但成功率差距明显(56.2% vs 64.1%),这说明 JERP 的规则机制不仅提升了平均表现,更提高了任务完成的可靠性——智能体更少地陷入无法挽回的失败路径。

为了验证持续规则更新的必要性,作者设计了一个关键消融实验:构造一个仅在初始训练阶段更新一次规则池、之后保持固定的消融变体。训练曲线显示,完整版 JERP 在整个训练过程中保持更高的成功率增长,而消融变体虽然在早期受益于初始规则池,但改善速度在规则池固定后明显放缓。这一现象的理论解释在于,随着策略参数通过 RL 不断更新,智能体的行为分布发生了偏移,早期提取的规则可能逐渐失去适用性,而新的行为模式又无法被固化的规则池所捕捉。JERP 的持续规则更新机制恰好弥补了这一缺陷,使得规则池能够与策略同步演化,不断吸收新的成功经验并修正过时指导。

从统计可靠性角度看,所有实验结果均基于三次独立运行的平均值,训练曲线展示了各方法在不同任务类型上的收敛动态。GRPO 和 JERP 在早期阶段表现接近,但在中后期的 Heat、Cool、Clean 和 Pick2 任务上,JERP 的优势逐渐扩大,这与这些任务需要更多中间操作约束的特点相吻合。规则池的存在相当于为智能体提供了一个"错题本",帮助它在面对复杂、多约束的任务时避免重复踩坑,而这种局部指导正是纯参数优化方法所缺乏的。

五、综合价值与局限

JERP 的理论意义在于它提出了一种重新概念化 LLM 智能体经验学习的方式。传统观点将外部规则库和内部参数视为两条独立甚至互斥的路径,而 JERP 揭示了二者之间深刻的互补性:规则提供了可解释、可即时调用的局部指导,参数则编码了全局性的行为倾向和语义理解。将两者纳入统一的学习框架,不仅为工程实践提供了新工具,也为理解"知识如何在人工智能体中表示与流转"提供了新的理论视角。这一视角与认知科学中关于显性知识(declarative knowledge)和程序性知识(procedural knowledge)的区分形成了有趣的呼应——人类同样同时依赖可以言说的规则和内隐的技能来完成复杂任务。

从实用角度看,JERP 的潜在应用领域十分广泛。任何需要 LLM 智能体在长期交互中持续改进的场景都可能受益于这一框架,包括自动化网页操作、客户服务对话系统、科学实验设计、代码调试助手以及复杂的游戏 AI。对于那些错误代价高昂、需要避免重复失误的领域(如医疗诊断辅助、金融交易执行),可维护和可审计的经验规则池尤其具有吸引力——与纯粹的黑盒参数更新相比,规则的可读性使得人类专家能够审查、验证和干预智能体的学习过程。然而,将 JERP 部署到实际应用中也面临若干挑战:首先,规则编辑依赖于参数冻结的 LLM 的推理能力,这意味着规则质量受限于该模型的理解水平;其次,随着规则池的增长,规则之间的冲突和冗余管理将变得更加复杂,当前的简单分数机制和合并操作可能不足以应对大规模规则库;第三,规则的领域迁移性尚不明确——在 AlfWorld 上学到的规则能否迁移到 WebShop 或真实环境中,仍需要进一步验证。

该论文的优势在于问题定位精准、框架设计简洁优雅、实验验证充分。作者准确地捕捉到了现有经验学习方法中的结构性缺陷,提出的耦合学习机制既有理论深度又有实现可行性。实验覆盖了多种基线和多个任务类型,消融实验尤其有力地支撑了核心主张。然而,论文也存在一些可以改进之处。例如,规则检索目前仅按效用分数排序选取前 k 条,没有实现更细粒度的实例级相关性匹配;规则编辑的提示工程细节(如 ReflectAndEdit 的具体 prompt 设计)在正文中披露较少,影响了方法的可复现性;此外,JERP 的计算成本相较于纯 GRPO 有所增加,主要来自规则编辑阶段的额外 LLM 调用,作者并未详细报告训练时间和资源消耗的对比数据。最后,论文对规则池的理论收敛性质讨论不足——在长期的交替更新中,规则池和参数是否会收敛到某种稳定状态,还是可能陷入持续的震荡,这是一个值得深入探讨的理论问题。

六、延伸阅读与思考

JERP 的思想渊源可以追溯到多个相关研究领域。在提示工程和经验复用方面,Reflexion(Shinn et al., 2023)率先探索了将失败反思写入记忆以指导后续尝试的方法,ExpeL(Zhao et al., 2024)和 AutoGuide(Fu et al., 2024)进一步将多任务试错经验蒸馏为可复用的自然语言指令。这些方法与 JERP 共享"外化经验为规则"的核心直觉,但都将规则提取视为与策略学习分离的离线过程。在参数优化方面,InstructGPT(Ouyang et al., 2022)确立了 RLHF(Reinforcement Learning from Human Feedback)的基础范式,GRPO(Shao et al., 2024)和 GiGPO(Feng et al., 2025)则为多步交互任务中的组相对优化提供了技术基础。JERP 的独特贡献在于将这两个传统从"非此即彼"的选择题转化为"协同并进"的联合优化问题。

在替代方法谱系中,Voyager(Wang et al., 2024)选择将经验编码为可执行代码技能而非自然语言规则,这一路径在 Minecraft 等开放域环境中表现出色,但牺牲了可解释性;MemoryBank(Zhong et al., 2024)和 MemGPT(Packer et al., 2023)侧重于记忆系统的长期维护与检索机制,但没有将记忆内容直接纳入策略优化的闭环;AgentWorkflowMemory(Wang et al., 2025)和 SkillWeaver(Zheng et al., 2025)则关注工作流和技能的自动发现。与这些工作相比,JERP 更强调"规则-策略"双系统的动态耦合,而非单一维度的经验积累。

展望未来,JERP 为多个研究方向打开了大门。首先是自适应规则检索的探索——当前的 top-k 分数排序过于简化,未来可以引入基于任务语义相似度的向量检索,或为每条规则学习一个上下文相关的注意力权重。其次是规则编辑的自动化程度提升——当前依赖冻结 LLM 生成编辑操作,未来或许可以训练一个专门的小型编辑模型,以降低推理成本并提高编辑质量。第三是向多智能体交互场景的扩展——当多个智能体共享或交换经验规则时,规则池的维护和冲突解决将变得更为复杂但也更具潜力。最后是规则的可迁移性研究——如何将在某一环境或任务族中学到的规则有效迁移到新的领域,是实现通用智能体能力的关键一步。

最深的开放问题或许在于:在 LLM 智能体的长期学习过程中,经验究竟应该何时外化为规则、何时内化为参数?JERP 提供了一个同时维护两种表示的实用方案,但并未从根本上回答这一权衡的最优策略。人类认知的发展研究表明,技能和知识之间存在着复杂的转化动态——有时反复练习的显性规则会固化为内隐技能,有时技能的失误又会促使我们重新提取显性原则。为人工智能体设计类似的自适应转化机制,可能是下一代经验学习系统的核心挑战。JERP 最引人深思的方面正是它让我们意识到,LLM 智能体的"学习"不必局限于参数空间的梯度流动,而可以在符号规则与连续表示的交汇处开辟新的可能。这种跨表示空间的联合学习,或许正是通向更灵活、更可解释、更可持续进化的智能体系统的关键路径之一。


Topics:

Powered by Forestry.md