Self-Evolving World Models for LLM Agent Planning (WorldEvolver)

Title: Self-Evolving World Models for LLM Agent Planning
Authors: Xuan Zhang, Wenxuan Zhang, See-Kiong Ng, Yang Deng
Venue: arXiv:2606.30639v1
Year: 2026
Pages: 20


1. 研究摘要 (Research Summary)

在大型语言模型(LLM)智能体的研究中,一个长期存在的张力体现在记忆与预见之间:智能体既需要回顾过去的经验来指导当前决策,又需要前瞻未来的可能性以避免盲目行动。WorldEvolver 这篇论文正是从这一张力出发,提出了一个根本性的洞察——世界模型(world model)所提供的预见能力(foresight)并非静态可靠,而是会随着部署环境的变化而退化,因此必须通过自演化机制在测试时持续修正其推理上下文。

论文的核心问题可以概括为:当 LLM 智能体依赖世界模型预测行动后果时,不可靠的预见不仅无法帮助决策,反而可能误导甚至损害下游行动选择。作者通过初步的 oracle 实验揭示了一个令人警醒的现象:在 ALFWorld 和 ScienceWorld 环境中,向 ReAct 智能体提供噪声预见(noisy foresight)时的行动准确率,反而低于不提供任何预见的情况。这一发现直接挑战了"世界模型必然有益"的隐含假设,表明预见的有用性是有条件的,而非绝对的。

针对这一问题,作者提出了 WORLDEVOLVER——一个训练自由的自演化世界模型框架。其核心创新在于将演化聚焦于外部记忆内容而非模型参数:在保持下游智能体策略和所有模型参数冻结的前提下,通过三种互补机制在部署时持续修正世界模型的上下文。这三种机制分别是: episodic memory(情节记忆),通过检索式模拟利用已执行的真实行动转换;semantic memory(语义记忆),从预测-观测不匹配中提取持久的启发式规则;以及 selective foresight(选择性预见),在将预测整合入智能体推理上下文之前过滤低置信度的预测。

实验结果充分验证了这一设计哲学的有效性。在 Word2World 基准测试上,WORLDEVOLVER 在三种不同骨干模型(Gemma-4-26B-A4B、Qwen3.5-9B、Gemma-4-31B)上均取得了最高的预测准确率,在 ALFWorld 和 ScienceWorld 上的 Exact Match 分别达到了 52.88% 和 51.55%(Gemma-4-26B-A4B),显著优于 RAWM-φ 的 20.06% 和 14.93%。在下游智能体规划任务中,WORLDEVOLVER 同样 consistently 优于其他世界模型基线方法,证明了测试时记忆修正能够同时提升预测保真度和规划性能。

从更广阔的视角看,这项工作的重要意义在于它重新定义了世界模型与智能体之间的关系。传统范式将世界模型视为一个固定的预测器,而 WORLDEVOLVER 将其转变为一个持续演化的、可审计的上下文系统。这种非参数化的适应性策略避免了在线梯度更新所带来的计算开销和副作用(如灾难性遗忘),同时利用了部署环境中自然产生的稀疏反馈信号。对于需要在动态环境中长期运行的 LLM 智能体而言,这一框架提供了一条既实用又高效的进化路径。

2. 理论框架 (Theoretical Framework)

WORLDEVOLVER 的理论根基深深植根于认知神经科学中关于记忆系统的经典区分,以及强化学习中模型化方法的长期探索。Tulving 于 1972 年提出的情节记忆与语义记忆的双系统理论,为这一框架提供了直接的生物学灵感。情节记忆记录具体的时空事件——"我在哪里、做了什么、发生了什么";语义记忆则存储抽象的可重用知识——"一般情形下,这类行动会产生什么后果"。WORLDEVOLVER 将这一认知科学洞见系统性地转化为计算架构,使得世界模型能够同时利用具体经验的精确性和抽象规则的泛化性。

在强化学习的谱系中,WORLDEVOLVER 继承了模型化强化学习(model-based RL)的核心思想:学习环境的转移模型以支持规划。Ha 和 Schmidhuber 于 2018 年提出的 World Models 框架开创性地展示了学习的环境模型如何赋能智能体在想象中的训练。然而,传统的模型化方法通常假设环境模型是固定的,或通过梯度更新进行参数化调整。WORLDEVOLVER 的理论创新在于提出了一种非参数化的测试时适应范式:不是通过更新模型权重 Wθ 来修正预测,而是通过动态调整模型所依赖的外部记忆上下文 Mt=(MtE,MtS) 来改进预测质量。

论文将任务形式化为部分可观测的交互过程 (S,A,O,T),其中 S 是环境状态空间,A 是行动空间,O 是观测空间,T:S×AS 是转移函数。在时间步 t,智能体无法直接观测隐藏状态,而是获得文本交互状态 st=(o1,a1,...,ot1,at1,ot)。智能体策略 πθ 基于当前状态生成行动 atπθ(|st),而世界模型则预测未来 K 步的观测:

(o^t+1,...,o^t+K)Wθ(|st,at)

WORLDEVOLVER 的核心目标是在保持策略 πθ 和世界模型 Wθ 参数冻结的前提下,通过部署时的持续演化来改进预测 o^t+1。这一目标之所以可行,基于一个关键的理论假设:预测-观测不匹配(prediction-observation mismatch)蕴含着可解释的修正信息,而这些信息可以通过提示级别的证据(prompt-level evidence)来编码,无需触及模型参数。

在语义记忆的构建中,论文引入了因子化状态空间(factorized state space)的概念来比较预测与观测。不同于简单的字符串匹配,作者采用映射函数 g 将原始观测文本转换为三元组集合(如 (fridge1, is, open)),从而判断两个观测是否描述了相同的对象、关系和行动。这一设计体现了对文本世界模型特殊性的深刻理解:在文本环境中,"相同的世界状态"不等于"相同的表面字符串",而需要在语义层面进行结构化比较。基于这种因子化比较,预测 zt+1 和实际观测 z^t+1 之间的差异可以被 LLM critic 转化为文本形式的修正规则,而不是被当作模型权重的梯度信号。

选择性预见机制则建立在一个更广泛的理论认识之上:即使预测质量可以通过记忆提升,低置信度的预见仍可能损害决策。这呼应了 Janner 等人在 2019 年关于"何时信任模型"的研究,以及模型化强化学习中关于选择性信任学习推演(learned rollouts)的经典结论。WORLDEVOLVER 中的置信度计算采用了几何平均 token 概率:

qt=exp(t)=exp(1ni=1nlogpθ(yi|y<i,st,at,Mt))

其中 t 是预测序列的平均对数概率,qt(0,1] 是标准化的置信度分数。当 qtτ 时预测被传递给智能体,否则智能体接收空信号 。这种基于置信度的弃权机制(abstention mechanism)本质上是将世界模型定位为一个有自知之明的顾问:只在确信时发言,不确定时保持沉默。

3. 技术架构 (Technical Architecture)

WORLDEVOLVER 的技术架构可以被视为一个围绕"冻结核心 + 动态记忆"原则构建的系统。其核心设计选择是在保持世界模型和智能体策略参数完全冻结的前提下,通过非参数化的记忆存储和检索机制来实现预测能力的持续进化。这种架构选择带来了几个关键优势:避免了在线微调大语言模型所需的高昂计算成本,规避了梯度更新可能引发的灾难性遗忘和过度编辑问题,并且使得所有修正过程都是可解释、可审计的。

系统的数据流从一次典型的交互周期开始。当智能体处于状态 st 并考虑行动 at 时,WORLDEVOLVER 首先激活情节记忆检索模块。情节记忆 MtE 存储了所有已执行的转换 (oi,ai,oi+1),采用基于行动 token Jaccard 相似度的检索策略。给定候选行动 at 和检索大小 kME,系统检索最相似的 past transitions:

ME,kME(at)=TopKkME{(oi,ai,oi+1)MtEsim(at,ai)}

这种基于行动相似度的检索策略与 RAWM-φ 的基于完整状态-行动文本的检索形成鲜明对比,后者可能因为长而重复的状态描述而稀释行动信号。检索到的转换被渲染为自然语言文本,注入世界模型的提示上下文,为预测提供具体的历史类比。

在情节记忆提供 exploitation 能力的同时,语义记忆 MtS 负责 exploration 维度的知识积累。语义记忆的核心是一个规则-证据对的集合 MtS={(ri,ei)}i=1|MtS|,其中每条规则 ri 是一个文本形式的启发式规则(如"检查物体不会移动它"),eiR 是关联的证据分数。这些规则并非预先设计,而是从预测-观测不匹配中动态提取的。当世界模型对实际执行的行动 at 产生预测 o^t+1,而实际观测为 ot+1 时,如果因子化比较显示 zt+1z^t+1,LLM critic 将分析这一不匹配并生成候选规则。每条规则的证据分数通过在线验证进行更新:如果后续观测支持该规则,分数增加 1/|MtS|;如果矛盾,则减少相同数值。只有证据分数 ei>0 的规则才会被保留在语义记忆中。

语义记忆更新采用 mini-batch 策略,每积累 kMS 个不匹配案例后进行一次规则集的聚合修订。这种批处理策略既降低了 LLM critic 的调用频率,又允许规则提取过程考虑多个不匹配之间的共性和差异,从而产生更 generalizable 的持久知识。语义记忆的作用方式也颇具巧思:在世界模型的提示中,这些规则被渲染为"框架公理和持久性规则"(Frame Axioms and Persistence Rules),世界模型被指示"不要预测规则所声称不会改变的属性"。这种设计将语义记忆从一种主动的知识注入机制转变为一种约束性的过滤器,有效地抑制了世界模型产生虚假变化预测的倾向。

选择性预见模块作为系统的最后一道防线,确保只有足够可靠的预测才能影响智能体决策。其实现方式简洁而有效:基于世界模型生成预测时的 token 概率计算几何平均置信度 qt,并与阈值 τ 进行比较。如果置信度不足,智能体接收不到任何预见信号,相当于退化为无世界模型的标准决策模式。这一设计的精妙之处在于它承认了世界模型的局限性,并通过一种优雅的方式将其限制在能力边界之内。实验表明,选择性预见对于较弱的骨干模型(如 Gemma-4-26B-A4B)带来的收益尤为显著,因为这类模型的预测不确定性更高,更需要谨慎的过滤机制。

整个系统的闭环更新流程在 Algorithm 1 中得到了清晰的形式化。该算法展示了一个关键的设计考量:当实际执行的行动 at 与用于初始预测的草稿行动 at(0) 不同时,系统会重新查询世界模型以确保语义记忆从正确行动的不匹配中学习。这种对齐机制确保了学习信号与执行行为的一致性,避免了"用错误行动的经验来修正预测"的偏差累积。

4. 实验评估 (Experimental Evaluation)

WORLDEVOLVER 的实验设计围绕两个互补维度展开:世界模型预测准确性(衡量世界模型本身与真实环境转换的对齐程度)和智能体规划成功率(衡量这些预测信号对下游任务完成的实际帮助)。这种双层评估框架不仅验证了系统在技术层面的有效性,也揭示了世界模型预测与智能体规划之间复杂而微妙的相互作用。

实验在两个控制化的长程文本环境 ALFWorld 和 ScienceWorld 中进行,采用 Word2World 基准测试提供转换数据集。预测评估指标包含三个互补维度:Exact Match(精确字符串匹配,衡量表面一致性)、Token F1(词元级别的重叠度,衡量词汇相似性)和 Cosine Similarity(基于嵌入向量的语义相似度,衡量深层语义一致性)。规划评估则采用 AgentBoard 框架,通过 Success Rate(在允许交互预算内完成任务的成功率)衡量,并采用 best-of-5 聚合策略减少随机性影响。

在世界模型预测实验中,基线方法包括零样本提示(Zero-Shot)、基于离线检索的 RAWM-φ 和基于自适应想象的 ITP-I。结果呈现出清晰而一致的模式:

方法 ALFWorld ExactMatch ALFWorld TokenF1 ScienceWorld ExactMatch ScienceWorld TokenF1
Zero-Shot 3.60 35.48 0.41 16.42
RAWM-φ 20.06 48.13 14.93 27.31
ITP-I 1.46 32.48 0.39 11.50
WorldEvolver (w/o M_E) 7.53 38.08 2.71 19.29
WorldEvolver (w/o M_S) 47.16 72.61 34.65 46.93
WorldEvolver 52.88 76.75 51.55 62.43

表1:Gemma-4-26B-A4B 上的世界模型预测准确率(%)。w/o M_E 表示去除情节记忆,w/o M_S 表示去除语义记忆。

消融实验揭示了两种记忆机制的互补角色。语义记忆单独使用时带来了温和但一致的增益,而情节记忆单独使用时提供了显著更强的改进,甚至在 ALFWorld 上超过了 RAWM-φ——尽管 RAWM-φ 可以预先访问完整的部署轨迹库,而情节记忆仅积累在线观测。这一差距暗示了检索质量强烈依赖于检索键的设计:RAWM-φ 基于完整状态-行动文本进行相似度计算,而 WORLDEVOLVER 的情节记忆采用更聚焦的行动 token Jaccard 相似度,从而避免了长状态描述对行动信号的稀释效应。当两种记忆机制结合时,系统在三个评估指标和两个环境上均达到了最佳性能,证明了经验性检索与抽象规则约束之间的协同效应。

在智能体规划实验中,结果呈现出更为复杂的图景。与世界模型预测不同,提升规划成功率面临着更大的挑战:

智能体 环境 w/o WM RAWM-φ ITP-I WorldEvolver w/o F_t WorldEvolver w/ F_t
ReAct ALFWorld 23.88 22.39 25.37 24.63 26.12
ReAct ScienceWorld 44.44 43.33 34.44 46.67 52.22
ReflAct ALFWorld 26.12 20.15 23.13 24.63 27.61
ReflAct ScienceWorld 42.22 41.11 37.78 48.89 50.00

表2:Gemma-4-26B-A4B 上的智能体规划成功率(%)。w/ F_t 表示使用选择性预见。

这些数据揭示了几个重要发现。首先,世界模型方法并不总是优于无世界模型基线:RAWM-φ 和 ITP-I 在多个设置中反而低于无预见基线,进一步证实了错误对齐的预见可能损害行动选择。其次,WORLDEVOLVER 在所有八种设置中均是最强的世界模型方法,选择性预见在每种设置中都匹配或超越了无过滤变体。第三,改进的幅度因环境、智能体类型和任务难度而异。在 ScienceWorld 上,由于任务更复杂、状态空间更大,世界模型预见提供了更显著的增益;而在 ALFWorld 的某些已近乎饱和的任务类型(如 PICK)上,改进空间有限。

在线持续学习分析(图4)展示了部署时记忆积累的动态效益。随着试验次数从 1 增加到 5,WORLDEVOLVER 的累积成功率曲线持续优于基线,表明情节记忆和语义记忆在同环境内的跨任务累积确实能够提升后续重新规划的效果。这种在线学习特性对于需要长期部署的智能体尤为重要,因为它意味着系统能够从自身的交互历史中持续改进,而无需人工干预或离线重训练。

超参数分析(图5)表明情节记忆检索规模 kME 是系统性能的主导因素:将检索规模从 1 增加到 5 可以带来 16.8-23.5 个百分点的 Exact Match 提升,而语义记忆批大小 kMS 的选择则相对不敏感。这一发现为实际部署提供了实用指导:应优先保证足够的情节记忆检索深度,而语义记忆的批处理可以采用保守的设置。运行时间分析显示,WORLDEVOLVER 的额外计算开销是适度的——在 Gemma-4-26B-A4B 上,每转换评估时间从 Zero-Shot 的 1.05 秒增加到 1.48 秒,远低于 ITP-I 的 1.42 秒所对应的性能水平,表明额外的计算主要用于有效的检索和规则条件化,而非冗长的想象推演。

5. 案例研究 (Case Studies)

虽然论文正文未提供详细的单步交互走查,但我们可以从实验设计和提示模板中推断出 WORLDEVOLVER 在实际运行中的典型行为模式。考虑一个 ALFWorld 场景:智能体需要完成"将苹果放入冰箱"的任务。当智能体面对"厨房台面上有一个苹果"的观测并考虑执行"拿起苹果"的行动时,WORLDEVOLVER 的处理流程如下:

情节记忆检索阶段,系统从已积累的转换中检索与"take"行动最相似的历史经验。假设之前执行过"从台面拿起杯子",这一转换将被检索并注入提示:"State: 在厨房台面上有一个杯子。Action: 拿起杯子。Observation: 你拿起了杯子。"这一具体案例为当前预测提供了直接的类比基础:如果拿起杯子的结果是获得杯子,那么拿起苹果的结果可能是获得苹果。

语义记忆约束阶段,系统检查已积累的持久规则。假设从之前的错误中已学习到"检查物体不会移动它"(examine.object_location)这一规则,当世界模型生成预测时,该规则会抑制任何关于"拿起行动导致物体位置改变"的虚假预测。这种约束机制特别有助于避免世界模型过度推测——例如,预测"拿起苹果"会导致"苹果出现在地板上"之类的无根据变化。

置信度过滤阶段,如果世界模型对"你拿起了苹果"这一预测的置信度 qt 高于阈值 τ,该预测被传递给 ReAct 智能体作为预见。智能体因此可以在实际执行行动前确认该行动的预期效果,从而更有信心地推进任务。如果置信度不足,智能体将仅依赖自身的策略推理,避免被不可靠的预测误导。

这种设计使得 WORLDEVOLVER 在以下情境中表现尤为出色:当环境转换具有可重复的结构模式(如"打开容器→放入物体→关闭容器"),情节记忆能够积累大量相关转换,提供丰富的预测类比;当环境存在稳定的物理约束(如"固体物体不能穿透其他固体物体"),语义记忆能够提取这些规则并过滤违反物理常识的预测。相反,在需要高度创造性或非常规推理的任务中,如果历史经验过于稀疏,情节记忆和语义记忆的效益可能受限,这正是 State Change 任务类型在所有方法上表现均不佳的原因——这类任务涉及复杂的因果链,难以通过简单转换或局部规则来刻画。

6. 综合价值与局限 (Synthesis — Value and Limitations)

从理论角度看,WORLDEVOLVER 最重要的贡献在于它将世界模型的适应性问题重新框架为一个记忆工程问题,而非参数优化问题。这一视角转变具有深远的意义:它意味着世界模型的可靠性可以通过精心设计的外部记忆结构来系统性地提升,而无需承担在线微调大语言模型所带来的计算成本和稳定性风险。同时,这种非参数化适应策略使得所有修正过程都是可解释和可审计的——每一条语义规则都携带着证据分数,每一次情节检索都可以被追溯和验证。

在实践层面,WORLDEVOLVER 为部署 LLM 智能体提供了一种轻量级的持续改进机制。对于需要在动态环境中长期运行的智能体(如客户服务机器人、个人助理、科学实验助手),这种测试时演化能力尤为宝贵。系统能够从稀疏的步级反馈中自动提取和积累知识,无需人工标注数据集或离线重训练周期。此外,由于所有记忆更新都是提示级别的,系统可以轻松地与任何现有的 LLM 后端集成,无需修改模型架构或训练流程。

然而,这项研究也存在若干值得关注的局限。首先,实验范围局限于两个文本环境(ALFWorld 和 ScienceWorld),尚未涵盖更广泛的领域如网页导航、代码生成、机器人操作或多模态交互。这些领域的观测空间可能更加复杂或连续,对因子化状态比较和规则提取提出了新的挑战。其次,选择性预见的置信度估计依赖于生成时的 token 概率,这在某些封闭 API(如早期版本的 GPT 系列)中可能不可用。虽然作者提到自一致性或学习校准模型可以作为替代方案,但这些替代方案的实证有效性尚未得到验证。此外,当前置信度-准确率的相关性假设(图11 支持这一假设)可能在不同环境或骨干模型间变化,需要更鲁棒的自适应过滤机制。

从更批判性的视角来看,语义记忆提取的 mini-batch 策略虽然降低了计算开销,但也引入了延迟——规则只能在不匹配积累到一定数量后才能更新。在快速变化的环境中,这种延迟可能意味着系统无法及时响应新出现的环境动态。同时,基于因子化三元组的观测比较虽然比字符串匹配更语义化,但仍可能无法捕捉某些微妙的上下文依赖关系,例如"在冰箱中冷却苹果"与"在烤箱中加热苹果"涉及相同的三元组类型(物体、位置、状态),但物理约束截然不同。

7. 延伸阅读与思考 (Further Reading and Reflection)

WORLDEVOLVER 的理论谱系可以追溯至多个重要的研究方向。在认知科学层面,Tulving 关于情节记忆与语义记忆的经典区分(1972)为双记忆架构提供了直接的生物学灵感。在强化学习领域,Ha 和 Schmidhuber 的 World Models(2018)以及后续 Hafner 等人在 Dreamer 系列中的工作,建立了学习环境模型以支持规划的核心范式。在语言智能体领域,ReAct(Yao et al., 2023)展示了推理与行动协同的有效性,而 Reflexion(Shinn et al., 2023)和 Voyager(Wang et al., 2024a)则探索了通过语言反馈和自我改进来增强智能体的途径。

与 WORLDEVOLVER 最接近的相关工作包括:RAWM(Yang et al., 2025)通过检索增强的世界模型学习来改进预测,但依赖离线收集的轨迹库和固定的检索机制;Imagine-then-Plan(Liu et al., 2026)提出了自适应想象范围的选择,但将适应发生在智能体规划层面而非世界模型层面;Ding 等人(2026)和 Yu 等人(2026)探索了通过自监督强化学习或在线课程来演化世界模型,但这些方法需要参数更新,与 WORLDEVOLVER 的训练自由哲学形成对比。在完全无梯度更新的方向上,WALL-E 2.0(Zhou et al., 2025)和 TRAD(Zhou et al., 2024)展示了神经符号学习和逐步检索在增强 LLM 智能体中的潜力,但专注于智能体策略而非世界模型本身。

展望未来,几个方向值得深入探索。首先是将 WORLDEVOLVER 扩展到多模态环境,其中观测不仅包含文本,还包括图像、音频或传感器数据。在这种情况下,因子化状态表示需要扩展到视觉场景图或对象关系图,语义记忆可能需要提取跨模态的物理约束规则。其次是动态置信度阈值的自适应学习,使得系统能够根据环境特性和当前任务自动调整 qt 的过滤标准,而非使用固定的超参数。第三是语义记忆与情节记忆的深度交互——目前两者在很大程度上是独立运作的,未来可以探索从情节记忆中自动发现适合抽象为语义规则的模式,或者利用语义规则来指导更有针对性的情节检索。

personally,这篇论文最令人深思的方面是它提出了一种关于"智能体如何学习"的根本性反思。当前的主流范式将学习等同于参数更新,但 WORLDEVOLVER 提醒我们,学习也可以发生在上下文层面——通过精心设计的记忆结构和检索机制,系统可以从经验中提取知识而无需改变自身的权重。这类似于人类认知中"知道如何回忆"与"知道什么"之间的区分:有时候,提升表现的关键不是拥有更多知识,而是更有效地组织和访问已有知识。对于追求高效、可解释和可持续的 LLM 智能体部署而言,这一哲学提供了极具吸引力的替代路径。

一个开放的问题是:在何种条件下,上下文级别的适应足以应对环境变化,而何时必须诉诸参数级别的更新?WORLDEVOLVER 在文本环境上的成功表明,对于结构化、规则化的环境,非参数化适应可能出人意料地有效。然而,对于需要全新概念形成或深层表征重构的环境,参数更新可能仍然不可或缺。理解这一边界——即上下文适应与参数适应之间的权衡——可能是未来智能体设计中最具理论价值和实践意义的问题之一。

Topics:

Powered by Forestry.md