SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep Research
基本信息
- 标题: SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep Research
- 第一作者: Pu Ning (Tsinghua University)
- 研究团队: Tsinghua University, Peking University, Ant Group, Renmin University of China
- 会议/期刊: arXiv, June 2026
- 代码: https://search-swarm.github.io
- PDF 文件: [SearchSwarm](file:///C:/Users/admin/.openclaw/workspace/attachment/papers/20260610_searchswarm_delegation_intelligence_agentic_llm_long_horizon_research.pdf)
研究摘要
大型语言模型(Large Language Models, LLMs)正日益被部署为能够处理复杂现实世界任务的智能体(Agent),然而,一个根本性的张力始终存在:这些任务的上下文需求可以无限增长,而模型的上下文窗口(Context Window)却天然有限。这种矛盾在深度研究(Deep Research)这类长程(Long-Horizon)任务中表现得尤为尖锐——智能体需要在多轮交互中持续搜索、推理与综合,每一步工具调用都会膨胀其工作记忆,最终不可避免地撞向上下文容量的天花板。传统应对策略——无论是被动地在超出阈值后压缩历史记录,还是按固定规则丢弃部分观测——本质上都是缺乏先验规划的亡羊补牢:它们等到上下文预算耗尽才开始压缩,或以机械方式删除过去的信息,无法区分哪些内容对后续推理至关重要。
这篇论文的出发点正是要突破这种被动式的困境。作者们提出了一种更为积极主动的上下文管理范式:主智能体(Main Agent)预先对任务进行分解,将子任务分派给子智能体(Sub-Agent),并仅接收这些子智能体返回的浓缩结果。这一范式看似简单,其执行却远非易事——它要求智能体具备一种作者称之为"委托智能"(Delegation Intelligence)的能力,即能够判断何时、将何种任务、以何种方式委托给子智能体,并将返回的结果有机地整合到持续进行的工作流中。然而,这种能力在自然语料中极为稀缺:日常文本鲜少展现显式的多智能体协调模式,因此传统的预训练或通用微调几乎无法让模型内建这种能力。在开源社区中,如何系统性地合成此类训练数据并让模型习得委托智能,此前几乎是一片空白。
SearchSwarm 正是针对这一空白做出的开创性探索。作者们设计了一套精巧的"马具"(Harness)——由精心设计的系统提示(System Prompt)与工具接口构成的引导框架——在推理阶段激发模型高质量的委托行为。这套马具包含四项核心设计原则:鼓励委托、撰写全面的任务简报(Comprehensive Briefing)、保持核心判断权在主智能体手中、以及要求基于引证的报告(Citation-Grounded Reporting)。在马具的引导下,模型执行深度研究任务,生成完整的交互轨迹;这些轨迹天然编码了正确的委托决策——何时分解任务、如何界定子任务范围、如何向子智能体提供恰当上下文。随后,作者将这些轨迹过滤并用作监督微调(Supervised Fine-Tuning, SFT)数据,将委托行为内化为模型权重。最终得到的模型 SearchSwarm-30B-A3B 在 BrowseComp 上取得 68.1 分、BrowseComp-ZH 上 73.3 分、GAIA 上 82.5 分、xbench-DeepSearch 上 80.8 分,在所有同规模模型中均为最佳成绩,甚至可与参数量大十倍以上的前沿系统一较高下。更为关键的是,这一训练过程中习得的结构化研究模式能够泛化到单智能体设置和开放式深度研究任务中,表明委托智能的训练收益超越了委托范式本身。作者开源了马具、模型权重和训练数据,为后续研究奠定了坚实基础。
理论框架
要理解 SearchSwarm 的理论根基,需要首先将其置于认知科学与人工智能的交叉脉络中审视。委托(Delegation)作为人类管理复杂性的基本策略,其思想渊源可追溯至 Herbert Simon 的有限理性理论(Bounded Rationality)与 Daniel Kahneman 的认知资源限制研究。人类的个体认知资源是有限的,而现实世界任务的复杂度往往远超任何单一个体的处理能力;通过将子任务委托给他人并整合其结果,人类得以协作完成远超个体能力上限的工作。有效的委托绝非简单的任务转发——委托者必须判断何时委托、如何界定子任务范围、提供何种上下文以确保受托者能独立工作,以及如何将返回的结果整合进整体工作流。Castelfranchi 与 Falcone 在 1998 年即已开始构建面向智能体系统的委托理论,将这些人类认知策略形式化为可计算框架。
对于 LLM 智能体而言,上下文窗口(Context Window)构成了一个类似人类工作记忆容量的资源约束。当任务的信息需求超出单一上下文的承载能力时,模型同样需要委托机制:将子任务卸载到独立的智能体实例,仅接收浓缩后的结果。这种类比并非牵强附会——上下文中的每一个 Token 都承载着推理资源,而多轮信息检索恰恰是那种"消耗大量 Token 但认知深度较浅"的工作。SearchSwarm 的理论洞察在于,将委托重新框定为一种主动的、智能的上下文管理(Context Management),而非被动地在容量耗尽后压缩或截断。这种视角的转变具有深远意义:它意味着上下文管理不再是事后补救的工程技术,而是前置规划的智能行为。
作者采用 ReAct(Reasoning + Acting)框架作为交互组织的理论骨架。在这一框架下,每一步交互由三个组件构成:思考(Thought)
其中
最终答案由累积的证据生成:
委托动作在形式化中表现为一个特殊的工具调用:当
该子轨迹在完全独立的上下文中执行,仅条件于
主智能体只能看到最终报告,子轨迹的中间步骤对其完全不可见。这种设计形成了一个信息瓶颈:从主智能体到子智能体是精心筛选的简报,从子智能体回到主智能体是浓缩的报告。这实质上构成了模型自我生成的、内容感知的压缩(Content-Aware Compression),替代了固定规则的截断或摘要。
值得注意的是,作者强调这一机制在本质上是单智能体(Single-Agent)上下文管理,而非真正的多智能体系统(Multi-Agent System):子智能体由同一个模型在独立、全新的上下文中调用,而非额外的或独立的模型。简报与报告均由模型自身生成,而非由固定规则确定。因此,与以往上下文管理方法的比较是在平等基础上进行的——唯一的区别在于模型以更具智能的方式管理自身上下文,利用模型生成的简报和报告替代了固定规则的截断。
技术架构
SearchSwarm 的技术架构围绕"主智能体分发、子智能体执行"(Main-Distributes, Sub-Executes)范式展开,整个系统可以视为一个精心编排的推理与委托的交响乐章。主智能体是整个研究的指挥者,它接收用户查询,配备标准的搜索工具(Search、网页访问 Visit、谷歌学术 Google Scholar、Python 代码执行)以及核心的委托工具 call_sub_agent。每个子智能体则运行在独立的上下文中,拥有相同的标准工具但无权访问 call_sub_agent,从而将委托限制在单一层级,防止无限递归导致的系统失控。
马具(Harness)是 SearchSwarm 技术架构的灵魂,它由工具集与系统提示(System Prompt)共同构成,分别为主智能体和子智能体设定了行为准则。四项核心设计原则如同四条支柱,支撑起整个委托体系。
第一条支柱是"鼓励委托"(Encouraging Delegation)。由于主智能体的上下文是有限的,它在原始搜索和网页访问输出上花费的每一个 Token 都直接与它本应执行的规划、验证和综合任务争夺资源。多步信息检索正是那种消耗大量 Token 但认知深度较浅的工作——可能需要很多轮次才能浮现一个事实。马具因此明确引导主智能体将这类工作交给子智能体,后者在自己的上下文中支付探索成本,仅返回浓缩结果,从而让主智能体的有限注意力集中于高层协调。主智能体仅在子任务足够浅层、委托开销大于节省的上下文时,才亲自执行。
第二条支柱是"全面简报"(Comprehensive Briefing)。子智能体在全新上下文中启动,对先前的调查进展一无所知。简报是子智能体接收上下文的唯一通道,其质量直接决定子智能体的有效性。若简报仅包含简单任务指令,子智能体往往会漫无目的地搜索或重复调查主智能体已确认的事实,产出无法推进整体研究的结果。因此,马具要求主智能体将每个简报写得如同向一位新加入调查的协作者介绍任务:除了子任务描述,还需说明该子任务对整体问题为何重要、已确立的事实有哪些、尚不确定之处何在、哪些方向已尝试或排除。这种对齐确保子智能体的输出最大限度地贡献于整体研究。
第三条支柱是"主智能体保留核心判断"(Main Agent Retains Core Judgment)。主智能体是唯一拥有跨所有子任务完整视角的实体,也只有它能判断子智能体的发现是否与其他发现及整体证据图景一致。若不加审视地信任子智能体报告,错误将传播和累积,破坏整体推理的连贯性。马具因此要求子智能体专注于收集证据和检验具体假设,而所有方向性决策——包括 pursue 哪个假设、何时终止调查、如何裁决相互冲突的报告——均由主智能体独立做出。
第四条支柱是"基于引证的报告"(Citation-Grounded Reporting)。在委托架构下,主智能体无法观测子智能体的中间执行过程。若子智能体报告不附带来源引证,主智能体将无法区分有据可依的结论与幻觉或误解。因此,马具要求子智能体报告为每个重要结论附上内联引证(Inline Citation),指向具体来源 URL,使主智能体能够验证报告发现的可靠性。主智能体的最终回答同样包含内联引证,为用户提供从来源到结论的端到端可追溯性。
数据流穿越这个架构时经历了精心的提纯过程。用户查询进入主智能体的上下文,主智能体进行推理后可能选择委托:它生成一份简报,触发 call_sub_agent。该简报被送入一个全新上下文中的子智能体,子智能体在其独立环境中执行多轮工具交互,最终生成一份带有引证的报告返回主智能体。主智能体将这份报告作为新的观测纳入自己的推理循环,可能基于此继续委托、验证或直接综合。整个过程如同一个信息蒸馏塔:原始查询在顶层被分解为精炼子任务,在底层被彻底调查后浓缩为报告,再返回顶层进行最终合成。
训练阶段同样体现了精巧的工程智慧。作者从开源的 RedSearcher 和 OpenSeeker 数据集中获取查询,让模型在马具引导下执行深度研究任务并记录完整轨迹。他们采用两种配置收集数据:第一种是单一模型同时担任主智能体和子智能体,两种角色的轨迹均被保留;第二种是用更强的模型作为主智能体、较弱的模型作为子智能体,仅保留主智能体轨迹。后者的逻辑颇具深意:不那么可靠的子智能体结果迫使主智能体对研究主线施加更严格的控制,从而产出更具深思熟虑的任务分解和更严格的结果验证的轨迹。两种配置的数据混合后形成训练集。主智能体上下文窗口设为 128K Token,子智能体为 64K。当轨迹接近上下文限制时,模型被要求立即给出最终答案——这些"被迫回答"的轨迹被保留而非丢弃,以便模型在测试时遇到相同机制时能学会给出高质量回应。过滤阶段,仅保留主智能体最终答案正确的轨迹;子智能体轨迹仅在对应主轨迹正确时才保留;过短的子智能体轨迹被降采样;包含重复相同工具调用、对不存在来源的幻觉引证、通过 Python 解释器尝试网页访问等不当行为的样本被移除。训练目标采用带环境掩码(Environment Masking)的下一个 Token 预测:在计算损失时,仅对模型输出(思考与工具调用)计算损失,所有环境返回(包括子智能体报告)均被掩码。这确保模型学习的是在给定观测上下文时产生适当推理和工具调用的策略,而非记忆环境内容。
实验评估
SearchSwarm 的实验评估设计展现了一个清晰的科学探索叙事:作者不仅想知道委托智能是否有效,还想知道它为何有效、在何种条件下有效、以及它能否泛化到训练时未曾见过的场景。评估在四个代表长程研究任务的挑战性基准上展开:BrowseComp(英文网页浏览能力)、BrowseComp-ZH(中文网页浏览能力)、GAIA(通用 AI 助理任务)以及 xbench-DeepSearch-2505。这些基准的共同特点是要求智能体在多轮交互中持续搜索、推理与综合,绝非简单的单轮问答所能解决。作者使用 DeepSeek-V4-Flash 作为评判模型,并人工验证其评判的正确性。对于 BrowseComp-ZH,则采用美团 LongCat 团队提供的修正版本。
基线比较覆盖了三个类别:闭源模型(GPT-5.2-Thinking、GPT-5、Claude-4.5-Sonnet、Claude-4.5-Opus、Gemini-3.0-Pro、Seed-2.0-Pro)、开源大模型(DeepSeek V3.2、GLM-4.7、GLM-5.0、Kimi-K2.5、LongCat-Flash-Thinking-2601、MiniMax-M2/M2.5、Step-3.5-Flash 等)以及同规模的开源轻量级模型(Tongyi DeepResearch、RedSearcher、LongSeeker、MiroThinker-1.5/1.7-mini)。这一覆盖确保了结论的全面性与可比性。
主结果(见表 1)呈现了一幅令人印象深刻的图景。SearchSwarm-30B-A3B 在所有四个基准上均取得了同规模模型中的最佳成绩:BrowseComp 68.1(超越此前该规模最佳 MiroThinker-1.7-mini 的 67.9)、BrowseComp-ZH 73.3(超越 72.3)、GAIA 82.5(超越 80.3)、xbench-DeepSearch-2505 80.8(超越 LongSeeker 的 78.0 和 Tongyi DeepResearch 的 75.0)。与未使用上下文管理的基础模型(BrowseComp 43.4)相比,训练带来的绝对提升达 24.7 分,充分展现了委托智能的巨大影响力。更令人瞩目的是,SearchSwarm 展现出与规模远大于自身的模型相抗衡的实力:在 BrowseComp 上,它与 671B-A37B 的 DeepSeek V3.2(67.6)持平,并超过 GPT-5.2-Thinking(65.8);在 GAIA 上,它超过 GPT-5(76.4)和 Seed-2.0-Pro(78.6),仅次于 Step-3.5-Flash(84.5)。这些结果强有力地表明,经过良好训练的委托智能能够让轻量级模型在长程研究任务上达到与前沿系统相媲美的性能。
| Model | Size | BrowseComp | BrowseComp-ZH | GAIA | xbench-DeepSearch-2505 |
|---|---|---|---|---|---|
| GPT-5.2-Thinking | — | 65.8 | 76.1 | — | — |
| DeepSeek V3.2 | 671B-A37B | 67.6* | 65.0* | 75.1 | 78.0 |
| Step-3.5-Flash | 196B-A11B | 69.0* | 66.9 | 84.5 | 83.7 |
| Tongyi DeepResearch | 30B-A3B | 43.4 | 46.7 | 70.9 | 75.0 |
| RedSearcher | 30B-A3B | 57.4* | 58.2* | 80.1 | — |
| LongSeeker | 30B-A3B | 61.5* | 62.5* | 77.7* | 78.0* |
| MiroThinker-1.7-mini | 30B-A3B | 67.9* | 72.3* | 80.3* | — |
| SearchSwarm (Ours) | 30B-A3B | 68.1* | 73.3* | 82.5* | 80.8* |
(注:* 表示使用了上下文管理。粗体表示同规模模型中的最佳结果。)
为了验证马具本身的有效性,作者进行了一项消融研究。在 BrowseComp 的 200 题子集上,他们比较了三种配置下的 DeepSeek V3.2:原始 Tongyi DeepResearch 框架(47.7 分)、仅增加 call_sub_agent 工具及其参数描述(50.0 分)、以及完整马具(57.7 分)。仅提供委托工具带来了小幅提升(+2.3),但包含鼓励委托、全面简报、基于引证报告等设计原则的完整马具产生了显著提升(+10.0)。模型行为分析确认,在完整马具下子智能体调用频率显著增加。这证明马具本身在激发智能委托行为方面具有实质性功效。
更令人信服的证据来自跨基础模型的迁移实验。作者将完全相同的训练数据用于微调 Qwen3-30B-A3B-Thinking-2507,该模型此前并未针对深度搜索做任何优化。在相同实验设置下,该模型在 BrowseComp 200 题子集上达到 66.5 分、BrowseComp-ZH 上 64.0 分,超过了 RedSearcher 和 LongSeeker 在各自最佳上下文管理配置下的报告结果。这一结果孤立地证明了训练数据本身的质量:即使换一个基础模型,同样的数据也能训练出强大的深度研究模型,而这正是马具作为数据合成与评估基础的价值所在。
泛化实验进一步揭示了委托智能训练的内核价值。在单智能体设置下——即禁用 call_sub_agent 工具、仅使用 128K 上下文、无任何上下文管理——SearchSwarm 在 BrowseComp 200 题子集和 BrowseComp-ZH 上分别取得 52.0 和 53.3 分,高于 Tongyi DeepResearch(43.5 和 46.5)。值得注意的是,训练数据中不包含任何不使用子智能体工具的轨迹。这一提升表明训练数据中编码的系统性问题分解、子问题的有条理解决、以及整体研究进展的维护等智能,超越了委托设置本身,即使在模型必须亲自执行所有步骤时也能受益。在开放式深度研究基准(ScholarQA-v2、HealthBench、ResearchQA、DeepResearchBench)上,SearchSwarm 在所有四项上均大幅超越基础模型,平均提升 14.2 分(64.2 vs 50.0),在开源模型中平均得分仅次于 Dr.Tulu(65.6),接近 OpenAI DeepResearch(64.9)。尤为关键的是,训练数据完全由短答案深度研究查询构成,不含任何开放式任务;其泛化能力源于两方面:委托训练教会模型将复杂问题分解为聚焦的子任务并通过子智能体并行探索多个假设,这种结构化调查过程自然迁移到开放式研究;同时,马具要求主智能体给出带引证的全面解释、子智能体给出基于检索证据的详细报告,这种对完整性和证据驱动推理的强调培养了模型生成组织良好的长篇回应的能力。
案例研究
论文附录中提供了一个极具代表性的案例,生动地展示了马具四项设计原则在实践中的运作方式。这是一个关于澳大利亚昆士兰州一条高速公路的硬约束问题——用户问题包含七个精确线索,需要同时满足:位于澳大利亚东部某州、该州州长(Premier)承诺了联邦与州对等的资金、其北部首段在 2025 年底通车、这是一条部分完工的高速公路、其牵头施工联合体此前完成了 2018 年底开工的全国性铁路升级的首段、项目最初以不同的走廊名称构想、总投资略高于 15 亿澳元。正确答案是昆士兰州的 Coomera Connector(M9)高速公路。
整个研究过程经历了两轮委托,完美诠释了"委托智能"的运作。在第一轮中,主智能体解析完线索后,并未亲自展开搜索,而是立即选择将任务扇形展开:它同时向三个子智能体分派了并行的调查任务——一个探究 2025 年底通车的北部首段高速公路,一个追踪 2018 年底开工的全国性铁路升级,一个查找项目最初的走廊名称。每个简报都写得如同向一位新加入调查的协作者介绍任务,不仅说明了调查目标,还提供了主智能体已形成的初步假设(如铁路升级可能是 Inland Rail)以及需要注意的关键方向。这种并行探索在早期阶段尤为关键——当尚无明确证据或结论时,马具强烈建议分派并行子智能体探索多个候选假设,而非基于不充分证据过早锁定单一深入方向。
三个首轮子智能体独立地汇聚到了 Coomera Connector。此时,主智能体展现了"保留核心判断"原则的关键作用:它并未直接接受收敛的答案,而是重新审视线索 5(施工联合体此前完成了铁路升级的首段),敏锐地捕捉到高速公路联合体(FHHM JV)与铁路联合体(INLink JV)并非同一实体,只有 Fulton Hogan 这一家公司同时参与了两者。此外,"州长承诺资金"的线索也尚未得到直接验证。因此,主智能体隔离了这两个承重事实,并分派第二轮子智能体进行专门验证:一个确认 Fulton Hogan 是否确实在 INLink JV 中担任牵头角色及其在 FHHM JV 中的确切地位,另一个验证昆士兰州州长是否确实承诺了 Coomera Connector 的联邦与州对等资金。
子智能体返回的报告严格遵守"基于引证的报告"原则:每个实质性结论都带有内联引证,指向具体来源。例如,关于 Fulton Hogan 在 INLink JV 中的领导地位,报告引用了该公司项目页面上的原始声明、Inland Rail 的事实说明文件、以及 BMD Construction 的新闻稿等多个独立来源。这些引证使得主智能体无需看见子智能体的中间步骤,就能验证每个事实的可靠性。最终,主智能体向用户交付的解释同样包含完整的内联引证,逐一解析七个约束条件如何通过检索证据得到满足,并明确对比和排除了四个替代候选(M12 Motorway、Coffs Harbour Bypass、West Gate Tunnel、M1 Pacific Motorway 延伸段),提供了从用户答案到原始来源的端到端可追溯性。
这个案例深刻揭示了委托智能的精髓:主智能体不是信息的被动消费者,而是研究的主动指挥者。它决定何时委托、委托什么、如何验证返回结果、何时追加验证、最终如何综合。子智能体则是专业的调查员,在各自的领域中深挖细节,但始终服务于主智能体设定的方向。两者之间的边界清晰而互补:子智能体负责收集证据和测试假设,主智能体负责裁决方向和整合全局。
综合价值与局限
SearchSwarm 的理论意义在于,它改变了我们看待智能体上下文管理问题的方式。在此之前,上下文管理主要被视为一种被动的工程技巧——截断、摘要、压缩——旨在将不断增长的历史记录塞进固定容量的窗口中。SearchSwarm 将这一问题重新概念化为一种主动的、需要智能的能力:委托智能。它提供了一套新的概念工具——马具(Harness)作为推理时引导框架、简报-报告机制作为内容感知的压缩管道、监督微调作为将行为模式内化的训练范式——这些工具为后续研究开辟了新的设计空间。这不仅仅是技术的进步,更是一种思维范式的转换:从"如何压缩更多信息"到"如何更聪明地选择保留什么信息"。
从实用角度看,SearchSwarm 的潜在影响是深远的。任何需要长程深度研究的场景——学术文献调研、市场分析、法律尽职调查、医疗信息综合——都可能受益于经过委托智能训练的模型。对于资源受限的组织而言,一个 30B-A3B 规模的模型能够达到与参数量大十倍以上的闭源系统相媲美的性能,意味着高性能深度研究能力的民主化。部署方面的要求相对明确:需要支持 128K 上下文的推理基础设施(主智能体)以及能够并行启动多个独立上下文的能力(子智能体)。作者开源了完整的马具、模型权重和训练数据,极大地降低了后续研究者复现和扩展的门槛。
然而,诚实地审视这项工作的局限同样重要。首先,委托被限制在单一层级——子智能体无权访问 call_sub_agent,这意味着无法形成递归或分层委托结构。对于某些极度复杂的任务,可能需要更深层次的分解。其次,训练数据完全依赖马具引导的轨迹,如果马具本身存在盲 spot,这些 blind spot 将被编码进训练数据并固化到模型权重中。虽然作者展示了马具的消融验证,但马具设计是否覆盖了所有重要的委托策略维度仍是一个开放问题。第三,实验中的"被迫回答"机制——当上下文接近上限时强制模型立即回答——虽然被作者保留为训练数据以提升测试时表现,但这种机制在极端情况下可能导致质量妥协。第四,模型在单智能体设置中的泛化虽令人鼓舞,但提升幅度(约 8-9 分)仍显著低于委托设置下的提升(24.7 分),说明委托架构本身仍是释放模型潜力的关键。最后,所有实验均围绕信息检索类深度研究任务展开,委托智能在代码生成、数学证明、多模态推理等其他长程任务中的有效性尚未被验证。
从更广阔的视角来看,SearchSwarm 代表了智能体 LLM 发展的一个重要趋势:从单轮问答到多轮工具使用,再到多智能体协调。它的出现与 Anthropic 的多智能体研究系统、Kimi 的 AgentSwarm、以及 WideSeek 等并行探索形成了呼应,共同指向一个共识——当单一智能体的上下文容量成为瓶颈时,智能的任务分解与协调将成为突破的关键。SearchSwarm 的独特贡献在于它提供了从马具设计到数据合成再到模型训练的完整开源配方,使这一方向不再是闭源实验室的专属领域。
延伸阅读与思考
SearchSwarm 的建立直接依赖于多个重要的前期工作。在搜索智能体领域,Tongyi DeepResearch 开创了深度研究模型的先河,为后续工作提供了基础架构和评估范式;RedSearcher 和 OpenSeeker 分别提供了可扩展的框架和完全开源的训练数据,SearchSwarm 的查询来源和基线比较直接受益于这些工作。MiroThinker 系列通过验证机制推进了研究智能体的能力边界,而 SearchSwarm 的消融实验表明其方法在该规模上取得了进一步的提升。在工具使用与推理框架方面,Yao 等人于 2022 年提出的 ReAct 框架构成了 SearchSwarm 交互组织的理论基础,将推理与行动交织的范式从概念落实为可训练的系统。在上下文管理方面,早期的被动式方法——包括 Liu 等人(2025)的轨迹压缩、Zeng 等人(2026)的截断策略、以及 MiroMind Team(2026)的摘要机制——为 SearchSwarm 提供了对比基准,也凸显了主动委托的优越性。在多智能体协调方面,Anthropic(2025a)的工程实践展示了并行子智能体的可行性,Kimi Team(2026)的 AgentSwarm 使用强化学习训练主智能体的任务分配策略,Huang 等人(2026a)的层级设计验证了主-子架构的有效性,而 Ruan 等人(2026)的 AOrchestra 框架则探索了动态子智能体创建与监督微调。SearchSwarm 的独特之处在于,它将这些分散的探索整合为一个从推理引导到数据合成再到模型训练的完整、可复现的开源配方。
对于同一问题——如何让 LLM 智能体处理长程复杂任务——存在着多种哲学路径。一种是 Scale-Up 路径:通过增大模型参数量和上下文窗口(如 GPT-5、Claude-4.7、Gemini 3.1 等)来直接提升承载能力。这一路径在绝对性能上往往领先,但代价高昂且封闭。另一种是优化路径:通过更高效的推理算法、更好的提示工程或更精巧的上下文压缩技术来榨取现有模型的潜力。SearchSwarm 代表的委托路径则是一种架构创新:它不改变模型本身的大小,而是通过智能的任务分解让多个独立执行单元协同工作,从而在固定的单模型容量约束下实现规模化的信息处理。这三条路径并非互斥——未来的前沿系统很可能同时受益于更大的模型、更长的上下文和更智能的委托架构。
SearchSwarm 开启了一系列值得探索的未来方向。递归委托是最自然的扩展:如果子智能体也能进一步委托,将形成层次化的任务分解结构,可能解决当前单层委托无法处理的极端复杂任务。多模态委托同样令人期待——将委托机制扩展到图像、视频、代码等多模态信息的检索与综合。强化学习(Reinforcement Learning)替代监督微调也是一个诱人的方向:当前使用 SFT 内化马具引导的行为,但 RL 可能让模型在探索中自主发现更优的委托策略。此外,委托智能的跨领域迁移——将在深度研究中习得的任务分解能力迁移到代码调试、科学实验设计或创意写作等其他长程任务——将极大地扩展这一范式的适用范围。
这一领域最深层的未解挑战在于:委托智能的边界在哪里?什么类型的问题天然适合分解委托,什么类型的问题需要连贯的、不可分割的推理链?当子智能体返回矛盾报告时,主智能体如何做出最优的仲裁?这些问题的答案不仅关乎技术设计,更触及对人类协作智能本身的理解。SearchSwarm 的实验显示,经过委托训练的模型在单智能体设置中也能受益,这暗示委托智能背后可能存在着更普适的问题解决策略——系统性分解、结构化调查、全局进展维护——这些策略或许独立于具体的委托架构,而是高质量推理的通用特征。如果这一直觉成立,那么委托训练的价值将远超其字面含义:它可能是在教会模型一种更根本的、可迁移的复杂问题求解能力。这或许是 SearchSwarm 最发人深省之处:我们以为在训练模型如何分配任务,实际上可能是在训练模型如何思考。
笔记创建时间: 2026-06-10
阅读方式: L2 深度阅读
Topics:
- "agent_architecture"
- "multi_agent_systems"
- "reasoning"
- "workflow_optimization"
- "reasoning_memory"
References: - "tsinghua_university"
- "pku"
- "ant_group"
- "browsecomp"
- "searchswarm"