Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy (OmniAct)
基本信息
- 标题: Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy
- 第一作者: Junhao Shi (Fudan University)
- 研究团队: fudan_university (Fudan University), Shanghai Innovation Institute, Jilin University
- 会议/期刊: arXiv 2026
- 代码: https://github.com/EmbodiedForge/RAS_interactivate_planner
- PDF 文件: [OmniAct](file:///C:/Users/admin/.openclaw/workspace/attachment/papers/20260628_omniact_omnimodal_embodied_agents.pdf)
研究摘要
在具身智能(Embodied AI)领域,一个根本性的挑战始终悬而未决:如何让机器人在真实、非结构化的家庭环境中持续可靠地运行,而不是在受控的实验室场景中演示几个孤立技能后就戛然而止。OmniAct这篇论文正是直击这一问题的核心——它试图构建的不再是"会做什么"的机器人,而是"能够持续自主生活"的物理智能体。这种从"技能展示"到"日常物理自主"的范式跃迁,标志着具身智能研究进入了一个更为务实、也更为艰难的阶段。
现有系统的困境在于,它们将世界人为地割裂了。当你对智能音箱说"帮我查一下天气,如果下午有雨就把阳台的衣服收进来,然后开灯准备下午茶"时,这句话背后的真实世界需求涉及了网络查询(Web API)、环境感知(IoT设备控制)、物理操作(机械臂抓取)和移动导航——四个在传统架构中分别由不同系统处理的能力。更糟糕的是,当前主流的视觉-语言-动作(VLA, Vision-Language-Action)模型虽然在单个操作技能上表现惊艳,但它们本质上是以开环(open-loop)方式执行动作的:一旦命令发出,系统就失去了对物理世界实际变化的感知能力。如果机械臂在抓取过程中滑脱,或者物体在搬运途中被意外碰落,系统不会知道,也不会停下来纠正,而是继续执行后续步骤,将错误像多米诺骨牌一样逐级传递。在长时程(long-horizon)部署中,这种失觉察的级联故障(cascading failure)是致命的。
OmniAct的核心理论洞察在于:持久的物理自主不需要一个更大、更复杂的端到端模型,而是需要一个层次化的异步架构,将高层规划、长程状态跟踪和实时物理验证显式地解耦为三个专门化且协作的模块。这种"分而治之"的哲学与端到端范式的"一锅炖"形成了鲜明对比。作者们认为,只有当规划器不必同时处理电机控制的细节,当记忆系统能够智能地压缩历史而非简单地拼接,当执行层能够被独立地监控和打断时,系统才能真正获得在真实世界中长时间运行的韧性。
具体而言,OmniAct贡献了三项紧密耦合的技术创新。首先是一个多模态语义规划器(Multimodal Semantic Planner),它将语音、视觉和离散状态输入统一理解为用户的意图,并在一个统一的动作空间中进行技能路由(skill routing)——这里的"技能"既包括调用IoT设备的网络命令,也包括驱动机械臂的连续控制策略。其次是自适应层次化记忆(Adaptive Hierarchical Memory),它通过事件边界驱动的压缩(event-boundary-driven compression)机制,将原始交互历史转化为带有时间戳的语义线索,使得上下文增长从线性变为次线性,从而在长时程部署中维持有界的记忆开销。最后是异步视觉抢占引擎(Asynchronous Visual Preemption Engine),它在物理执行的同时以较低频率运行一个视觉-语言模型(VLM)监控器,周期性地验证物理执行的实际效果,一旦检测到异常就立即中断执行并返回规划器重新规划。
实验结果令人信服。在40个真实世界长时程任务中,涉及UR5e机械臂和Keenon移动机器人两种形态迥异的平台,协调四种家用IoT设备和十二个虚拟API工具,OmniAct在端到端成功率上显著超越了包括SayCan、Code as Policy和RoboBrain2在内的多个强基线。特别是在最复杂的L3级别任务(涉及语音、Web API、IoT和物理执行的完整多模态编排)中,OmniAct在机械臂操作上的端到端成功率达到50.0%,在移动导航上达到54.2%,而最佳的基线方法分别只有43.8%和37.5%。更值得注意的是,OmniAct在超过100k累积交互token的长时间运行中,保持了近乎平坦的token消耗曲线,证明其记忆压缩机制确实实现了次线性扩展。尤为惊艳的是,OmniAct将一个中等规模的开源模型Qwen3-VL-30B-A3B的性能从50.0%提升到80.0%,达到了与Gemini-3.1-Pro相当的水平,这表明架构设计的清晰度能够弥补甚至超越模型规模的差距。
理论框架
OmniAct的理论根基可以追溯到具身智能领域中关于"智能需要身体"的古老争论,但其直接的学术谱系则扎根于近年来大语言模型(LLM)作为规划器(planner)的浪潮。从SayCan(Ahn et al., 2022)将语言指令落地为机器人可 affordance 的评分,到Code as Policy(Liang et al., 2023)直接生成可执行代码,再到ReAct(Yao et al., 2023)和Reflexion(Shinn et al., 2023)引入推理与行动的协同以及语言化的自我反思,这一脉络展示了一个清晰的演进:从简单的指令翻译,到带有错误修正的迭代规划,再到具有持久记忆能力的开放域探索。然而,这些系统大多停留在"网络智能体"(cyber agent)的范畴,处理的是API调用和信息检索,而非真实的物理操作。与此同时,VLA模型(如RT-2、OpenVLA、π₀)走的是另一条路——它们试图通过大规模预训练直接学习从视觉到动作的端到端映射,却缺乏推理和错误恢复能力。OmniAct的理论创新恰恰在于将这两条此前平行的脉络桥接起来:它不取代VLA,而是将其作为低层执行器纳入一个更大的闭环编排框架中。
论文的核心概念之一是"统一赛博-物理动作空间"(unified cyber-physical action space)。在传统框架中,调用一个智能灯泡的API和指挥机械臂抓取杯子被视为完全不同的操作类型:前者是离散的、确定性的、返回状态码的函数调用;后者是连续的、随机的、需要实时反馈控制的物理过程。OmniAct通过引入技能路由(skill routing)机制将二者统一:每个动作被表示为一个元组
这里
另一个理论支柱是"事件边界驱动的记忆压缩"。心理学中的事件切割理论(event segmentation theory)指出,人类感知自然地将连续经验分割为离散的有意义事件。OmniAct将这一直觉工程化:物理交互天然地在语义边界处发生分段(如"子任务完成"、"状态变化"),压缩应该在这些边界处操作,而不是在固定时间间隔或每轮对话级别进行均匀压缩。这种选择在理论上是优雅的,因为它将记忆的增长与"有意义的变化"而非"时间的流逝"绑定,从而实现了次线性扩展——在持续部署中,环境进入稳定状态的时期可以大量压缩,而剧烈变化的时期则保留更多细节。
论文还引入了"异步视觉抢占"(asynchronous visual preemption)的概念,这是对传统控制理论中闭环反馈的语义升级。在经典控制理论中,闭环反馈通过传感器数据与期望状态的偏差来修正行为,但这类反馈通常是低层次的——比如关节角度误差、位置偏差。OmniAct的抢占机制则处理的是语义层次的偏差:"目标物体是否仍然被握住?""机器人是否朝着目标前进?"这类问题无法通过传统的几何约束或碰撞检测来回答,而需要视觉-语言模型的理解能力。这种"语义闭环"与"物理开环"的并存(VLA以高频开环执行,VLM以低频语义闭环监控)构成了一种新型的混合控制架构,它承认并非所有执行细节都需要持续监控,但关键的成功/失败判定必须由独立的视觉验证来完成。
层次化记忆的理论设计也值得深究。系统将记忆分为三个层次:感觉记忆(Sensory Memory)是一个轻量的FIFO队列,保存最近视觉帧供控制策略和视觉监控器使用,与规划上下文解耦;情景记忆(Episodic Memory)通过事件边界压缩管理交互历史,记录语义内容、状态转换和动作结果;反思记忆(Reflective Memory)存储静态先验(工具模式、技能库)和动态累积的经验(失败因果分析、纠正策略)。这种分层不是简单的存储分级,而是认知功能的分离:感觉记忆服务于实时感知,情景记忆服务于时序推理,反思记忆服务于长期适应。当执行失败时,系统生成的结构化反思记录被注入后续规划的上下文,将孤立错误恢复转化为累积性适应,这种设计体现了从"反应式系统"到"学习型系统"的理论跨越。
技术架构
OmniAct的技术架构可以被理解为一个精心编排的三重奏——三个模块各自承担不同的时间尺度和认知功能,却通过严格定义的数据流和接口形成有机整体。系统整体采用事件驱动的循环架构,从多模态输入感知到技能执行,再到异步验证,最终回到规划或记忆更新,构成了一个完整的自主运作闭环。
多模态语义规划器(Multimodal Semantic Planner)位于整个系统的"大脑"位置,它实现了前述的规划策略
执行引擎采用了独特的双轨并行设计。离散型赛博命令(IoT控制、API调用)通过确定性的返回码进行验证,这是一种传统的同步闭环。而连续型物理命令则被转发给控制策略——对于机械臂操作是VLA策略,对于移动导航是基于语义地图的经典路径跟随。这里的关键创新在于第三条并行的"异步视觉监控"流:一个独立的VLM客户端以低于控制频率的周期采样视觉帧,对执行进度和物理安全进行语义级评估。这个监控器被有意设计为"无上下文"的——它不知道原始指令内容,也不接收历史推理链,仅基于时序图像序列进行判断。这种设计极大地降低了验证过程中的幻觉风险,因为监控器不会被预期结果所诱导,只能依据实际观察到的视觉证据进行判断。当监控器检测到异常(如物体滑脱、位置未变、意外遮挡)时,系统立即向VLA执行器发送中断信号,将失败情境打包并返回规划器进行重新规划。
自适应层次化记忆系统的工程实现是整个架构中最精妙的部分。感觉记忆作为最底层,是一个轻量的FIFO帧缓冲区,容量仅够支持控制策略的最近观察窗口和视觉监控器的时序分析需求,不参与规划上下文的构建。情景记忆负责处理事件边界驱动的压缩:当系统检测到语义边界(如一个子任务的自然结束、环境状态的显著变化)时,触发一个压缩过程,将自上次边界以来积累的原始观察序列转化为紧凑的关键帧摘要(keyframe summary)。这个摘要保留语义内容、状态转换和动作结果,但丢弃过程性的冗余信息——例如,如果机器人花了三十秒调整姿态最终成功抓取了一个杯子,摘要只会记录"成功抓取杯子"以及最终状态,而不会保留每一帧的微小调整。这种压缩通过专门的提示工程实现,附录中提供了详细的压缩提示模板,要求压缩模型保留时间戳、任务上下文、具体观察、工具使用、动作结果和未解决问题,同时避免将临时观察推断为持久偏好。反思记忆则存储更持久的知识结构:工具的模式定义、技能库清单,以及从失败中动态生成的因果分析和纠正策略。当视觉抢占或赛博执行器报告失败时,系统触发一个反思过程,生成结构化的根因记录和修复策略,这些记录随后被索引并在后续规划中按需检索注入。
整个系统的数据流可以这样描述:用户的多模态输入(语音+图像)进入规划器,规划器从三个记忆层次检索相关上下文,生成下一步技能调用;技能被分发到对应的执行器(赛博或物理);物理执行器同时向视觉监控器开放视觉流;监控器独立评估执行结果,如果正常则返回成功状态,如果异常则触发中断并将失败上下文注入反思记忆;规划器根据执行结果更新世界状态并继续下一轮规划。这种数据流在循环中持续运转,使得系统能够在数小时甚至更长的时间尺度上保持连贯的操作。
一个值得注意的技术细节是,OmniAct的规划器只负责高层决策,具体的物理技能实现被委托给后端执行器。机械臂的pick_and_place技能由一个在内部遥操作数据上微调的π₀风格VLA策略实现,而navigate_to则通过预构建的2D语义地图和经典路径点跟随实现。这种"高层规划+低层技能"的解耦设计使得系统能够复用现有的机器人学习成果,而不必从头训练一个端到端的通用模型,这在工程实践中是务实且高效的选择。
实验评估
OmniAct的实验设计围绕着三个核心维度展开:跨领域异构硬件的编排能力、长时程部署中的记忆效能与可扩展性,以及跨基础模型的泛化能力。这种三轴评估结构本身就体现了作者对问题复杂性的清醒认识——一个好的具身系统不仅要在特定任务上成功,还要在长时间运行中保持高效,并且能够迁移到不同的"大脑"(基础模型)上。
实验平台选择了两个结构截然不同的真实机器人:UR5e六自由度机械臂用于精确桌面操作,Keenon轮式移动机器人用于室内导航。这种选择不是随意的——它强制验证架构的跨形态泛化能力。系统还与四种家用IoT设备(智能灯、空调、环境音响、智能家居模式控制器)和十二个虚拟API工具(网络搜索、清单检索、天气查询等)进行交互,构成了一个具有代表性的家庭部署环境。任务集包含40个真实世界任务,平均分为操作和导航两类,每类按复杂度分为三个级别:L1仅涉及物理执行(如简单的抓取放置),L2增加了IoT协调或Web API查询(如先设置热水器温度再操作),L3则是完整的多模态编排(如语音查询步骤、控制灯光、执行物理操作、并用自然语言报告结果)。每个任务在变化的初始条件下重复三次,由人类评估者以二元标准裁定成功。
评估指标的设计也体现了对长时程任务特性的深刻理解。作者报告两个互补指标:子任务成功率(Sub)衡量部分正确完成的比例,而端到端成功率(E2E)则是严格的二元度量,只有完整任务完成才计为成功。二者之间的差距量化了单阶段错误在流水线中的级联程度——在长时程自主中,一个未恢复的失败可能使后续所有阶段失效,因此E2E与Sub之间的鸿沟是诊断系统韧性的关键指标。
实验结果(如图3和表1所示)揭示了一个清晰的模式:随着任务复杂度从L1到L3提升,所有基线方法都遭受了剧烈的性能滑坡,而OmniAct则保持了相对优雅的下降曲线。在最具挑战性的L3任务中,OmniAct在UR5e操作任务上达到50.0%的E2E成功率,在Keenon导航任务上达到54.2%,显著优于最佳基线(SayCan在操作上的43.8%和Code as Policy在导航上的37.5%)。子任务成功率的优势更为显著:OmniAct在L3操作任务上达到80.5%的Sub成功率,在导航上达到80.6%,而最佳基线分别为60.9%和57.9%。这一差距直接验证了异步视觉抢占和反思记忆的贡献——当VLA执行中发生失败(如抓取滑脱)时,基线方法盲目继续执行,将错误传递给下游阶段;而OmniAct检测到偏差、停止执行、并从当前状态重新规划,将灾难性失败转化为可恢复的延迟。
一个颇具启发性的结果是RoboBrain2的表现。尽管这个320亿参数的视觉-语言模型在多个具身规划基准上达到了 state-of-the-art,但在本研究的跨模态协调任务中却表现不佳。其失败主要集中在生成格式良好的API调用和维持交错赛博-物理子任务的状态上,这很可能是由于缺乏IoT领域的训练数据。这一结果有力地说明:跨模态工具协调是一种与空间场景理解根本不同的能力,它需要一个显式的编排层,而非仅仅依赖更大模型的涌现能力。
在记忆效能实验中(表1),作者构建了三种长时程场景(工具使用、家庭助手、机器人操作),每种包含超过10小时交互和40k+累积token的样本,并在其中嵌入了时间偏好冲突(如早期建立"不加糖"的持久约束,后期请求"有味道的饮品")。OmniAct的完整系统在这些场景中达到86.67%、66.67%和80.0%的约束满足率,相比最好的消融变体(EpisodicOnly或RawHistory)提升了13-20个百分点。滑动窗口(Sliding Window)虽然实现了最激进的压缩(16.3%),却灾难性地丢失了早期约束,在所有场景中几乎归零——这证明了仅仅依赖近期历史对于偏好感知的长时程智能体是完全不够的。原始历史(Raw History)虽然保留了所有信息,但由于40k+ token的体量和位置稀释效应,表现仅为中等(46.67%-66.67%),且语义冲突常常误导规划器。OmniAct的完整系统通过反思层在规划时显式呈现长期约束和失败修正策略,而不是依赖规划器从压缩的情景序列中隐式提取,从而实现了压缩与保留的优雅平衡。
长时程可扩展性实验(图4)将交互轨迹扩展到100k+ token(约270轮)。原始历史重放呈严格线性增长,到260轮时超过120k token,接近大多数基础模型的上下文窗口极限。而OmniAct的事件边界驱动压缩将每轮调用的输入token维持在4k-8k的窄带内,早期就达到平稳状态,仅随局部情节复杂度波动而非累积历史长度波动。这种近乎平坦的扩展曲线从根本上将部署持续时间与推理成本解耦,使得在任意长时程上的持续运行成为可能。
跨模型泛化实验(表2)展示了OmniAct架构的普适性。在六个不同规模的基础模型上(从Gemini-3.1-Pro到Qwen3-VL-8B),OmniAct都带来了改善。中等规模模型获益最显著:Qwen3-VL-30B-A3B从50.0%提升到80.0%(+30.0个百分点),达到了与Gemini-3.1-Pro的原始性能持平,证明OmniAct的结构化编排能够弥补甚至弥合开源模型与专有模型之间的差距。即使是最强的Gemini-3.1-Pro也从中获益(+3.3),表明层次化记忆和异步验证解决了系统性故障模式——如长时程偏好漂移和未检测的执行错误——这些问题不会因模型规模增大而自动消失。在低端,Qwen3-VL-8B的改善有限(+6.7),因为其对生成格式良好的结构化输出的能力不足,限制了多步工具调用的编排能力,这大约确立了有效集成所需的最低基线能力门槛。
| Method | Tool Use | Home Asst. | Manip. | Compress. |
|---|---|---|---|---|
| Raw History | 66.67% | 46.67% | 66.67% | 100.0% |
| Sliding Window | 13.33% | 6.67% | 6.67% | 16.3% |
| Turn Summary | 56.67% | 50.0% | 63.33% | 27.4% |
| Episodic Only | 56.67% | 46.67% | 66.67% | 21.2% |
| OmniAct (Full) | 86.67% | 66.67% | 80.0% | 24.5% |
Table 1: 长时程场景中的约束满足率与上下文压缩率
| Backbone | Raw | OmniAct | Δ |
|---|---|---|---|
| Gemini-3.1-Pro-Preview | 76.7 | 80.0 | +3.3 |
| Gemini-3-Flash-Preview | 70.0 | 76.7 | +6.7 |
| Qwen3.6-Plus | 63.3 | 80.0 | +16.7 |
| Qwen3.6-Flash | 56.7 | 73.3 | +16.6 |
| Qwen3-VL-30B-A3B | 50.0 | 80.0 | +30.0 |
| Qwen3-VL-8B | 30.0 | 36.7 | +6.7 |
Table 2: 不同基础模型上的约束满足率(%)
案例研究
为了深入理解OmniAct在真实世界中的运作方式,让我们考察一个典型的L3级别任务(完整多模态编排)在系统中的完整执行流程。以附录中提供的代表性任务为例:用户通过语音请求"查一下整理餐具的简单步骤,把灯光亮度调到80%,把碗放进篮子里,然后报告结果"。这个看似日常的家庭指令实际上包含了Web信息检索(查询整理步骤)、IoT设备控制(调节灯光)、物理操作(抓取碗并放入篮子)和自然语言报告四个异构子任务,需要跨模态的精确协调。
当这条语音指令进入系统时,多模态语义规划器首先接收转录后的文本和当前环境的视觉帧。规划器识别出这是一个复合任务,需要分解为多个子目标。通过分析当前视觉状态(如灯的位置和亮度、碗和篮子的位置)以及可用的工具模式,规划器开始生成结构化的技能调用序列。第一步可能是查询Web信息(web_search),获取整理餐具的步骤;同时,由于调节灯光和物理操作之间没有依赖关系,规划器可以并行地发出控制灯光的命令(control_light)——这种并行调度能力正是JSON输出格式所支持的。在执行物理操作(pick_and_place)时,VLA策略开始控制机械臂执行抓取轨迹,而异步视觉监控器以独立的时间线启动。监控器接收来自感觉记忆FIFO缓冲区的时序图像帧(执行前、执行中、执行后),通过视觉差异分析判断抓取是否成功。如果碗在机械臂接近后仍然停留在原位,或者抓取过程中发生了滑脱,监控器会检测到这个异常,返回失败状态并触发抢占中断。系统随后停止VLA执行,将失败上下文(包括视觉证据、预期动作和实际结果)打包,并返回给规划器。规划器现在需要从反思记忆中检索类似的失败经验——如果之前有"抓取滑脱"的记录,反思记忆中可能已经存储了诸如"降低接近速度"或"调整抓取姿态"的纠正策略。规划器将这些经验注入新的上下文,重新生成一个修正后的抓取命令。如果抓取成功,视觉监控器确认碗已放入篮子,系统进入最后阶段:通过语音(speak)向用户报告任务完成情况,包括从Web查询中获得的信息和执行结果的总结。
另一个值得关注的案例是长时程约束冲突的处理。假设系统在与用户的多轮交互中建立了"用户无糖"的持久约束,而数小时后用户请求"准备一些有味道的饮品"。此时,系统的反思记忆已经通过长期压缩提取了"无糖"作为一个稳定用户偏好(hard preference),而当前请求被识别为临时需求(current need)。当规划器处理这个任务时,相关约束从反思记忆被检索并注入上下文,规划器会理解为"有味道但不能加糖"——比如选择柠檬水或加味气泡水而非含糖饮料。这种能力在消融实验中得到了验证:原始历史方法有时会因为40k+ token的庞大规模而遗漏早期约束,滑动窗口则完全丢弃了超出最近10轮的历史信息,而OmniAct的完整系统通过反思层的显式约束呈现,成功地将早期偏好与后期请求整合。
视觉监控器在失败检测中的独立判断也提供了一个精妙的案例。在附录F描述的验证集中,包含10次成功的抓取放置和10次失败的执行(包括自然失败和人工诱导的扰动,如在执行过程中手动移除物体)。视觉监控器在没有任务上下文的情况下,仅通过比较执行前后的图像序列,判断预期物理状态是否达成。当物体在过程中被人工移除时,监控器通过观察"源位置物体消失但目标位置也未出现"的视觉证据,推断出执行失败,而不是错误地假设物体已在目标位置。这种纯粹基于视觉证据的判断——与规划器的推理意图完全隔离——正是降低幻觉和误检的关键设计。
综合价值与局限
OmniAct的理论价值在于它重新定义了具身智能研究中的几个核心张力关系。首先,它挑战了"端到端万能"的隐含假设,证明了显式模块化架构在真实世界复杂任务中的优越性。在深度学习领域,端到端训练常常被视为理想范式,因为它最大化了梯度信号的传递效率。然而,OmniAct用实验数据说明,在需要跨模态协调、长时程记忆和错误恢复的物理场景中,一个精心设计的模块化系统可以超越更大的端到端模型。这种"架构清晰度优于模型规模"的论证,为资源受限的实际部署提供了重要的理论支撑。
其次,OmniAct提出了"语义闭环"的概念,将控制理论的反馈机制从几何/运动学层面提升到了语义层面。传统的闭环控制处理的是位置误差、速度偏差等可量化的低层次变量,而语义闭环处理的是"任务是否成功"、"目标状态是否达成"这类高层次、不可直接测量的概念。这种提升不是简单的概念游戏,而是对物理自主本质的深化理解:一个机器人可以精确地按照轨迹运动,但如果它不能判断运动的结果是否符合预期,它就不是真正自主的。异步视觉抢占机制正是这一理念的工程实现,它承认高频物理控制需要开环执行,但低频语义验证必须独立进行。
从实践角度看,OmniAct的潜在影响是深远的。对于家庭服务机器人领域,它提供了一个能够协调智能家居设备和物理操作的可行架构。设想一个系统能够接收"我快回家了,把空调打开,准备晚餐,并把衣服从洗衣机拿出来"这样的指令,然后协调空调、厨房设备、机械臂和移动机器人完成这一系列跨域操作——这正是OmniAct所演示的能力。对于工业场景,异步监控和错误恢复机制可以显著降低自动化生产线上的意外停机时间。对于科研,其层次化记忆设计为长期自主智能体的记忆管理提供了新的范式。
然而,论文的局限性也在附录中被诚实地讨论。OmniAct的适应能力本质上是"不对称"的:高层规划器可以利用反思记忆围绕失败进行重新规划,但它无法改善冻结的底层VLA策略本身。当失败源于固有的运动能力限制(如机械臂无法够到某个位置,或者VLA策略从未见过某类物体的抓取方式)时,恢复受限于现有技能库。这类似于一个聪明人可以想出绕过障碍的方法,但如果他的腿本身不够长,再聪明的策略也无法让他跨过太宽的沟。要解决这个问题,需要未来的工作将技能学习与错误恢复结合起来,或者通过在线适应来更新VLA策略。
另一个局限是异步视觉监控器的延迟窗口。由于监控器以VLM推理频率运行而非控制频率,在两次监控采样之间可能存在一个时间窗口,其间错误动作继续执行且未被检测到。这在涉及易碎物体或人类附近操作的场景中构成了残余安全风险。虽然论文指出这种低频监控在工程上是必要的(因为高频VLM推理在计算上不可行),但这一权衡确实留下了改进空间——也许未来的工作可以探索更快的轻量级视觉验证器,或者将几何安全约束与语义验证结合起来。
最后,实验规模虽然令人印象深刻(40个真实世界任务,双平台,多设备),但相对于通用家庭助理可能遇到的无限任务多样性,仍属有限。系统在特定任务集上的成功是否意味着在开放域任务中的泛化能力,还需要更大规模的验证。此外,虽然OmniAct展示了跨模型泛化能力,但最低端模型(Qwen3-VL-8B)的改善有限,说明有效集成存在一个基础能力门槛,这对于希望在资源极度受限设备上部署该框架的场景是一个现实考量。
延伸阅读与思考
OmniAct的学术根基深深植根于近年来具身智能领域的多个重要脉络。最直接的前置工作是LLM作为机器人规划器的探索:SayCan(Ahn et al., 2022)通过 affordance 接地将语言指令映射到可执行技能,Code as Policy(Liang et al., 2023)展示了通过代码生成实现结构化规划,而ReAct(Yao et al., 2023)和Reflexion(Shinn et al., 2023)引入了推理与行动的协同以及语言化的自我反思。在VLA领域,RT-2(Brohan et al., 2023)将网络知识迁移到机器人控制,OpenVLA(Kim et al., 2024)提供了开源的通用策略,而π₀(Physical Intelligence, 2024/2025)通过流模型和扩散模型提升了动作生成质量。PaLM-E(Driess et al., 2023)和RoboBrain(Ji et al., 2025)则尝试将视觉-语言理解更紧密地整合到机器人系统中。OmniAct的独特之处在于不试图取代这些系统中的任何一个,而是将它们作为组件纳入一个更大的编排框架中,通过明确的责任分离实现它们无法单独达到的能力。
从更广阔的视角来看,OmniAct与多个相关研究方向形成了对话。在智能体记忆管理方面,MemGPT(Packer et al., 2023)提出了LLM作为操作系统的层次化记忆架构,OmniAct将其扩展到了物理具身领域。在工具学习(tool learning)和工具使用(tool use)方面,OmniAct将物理机器人技能与传统的API工具统一在同一个技能路由空间中,这是一种概念上的统一。在分层强化学习领域,RT-H(Belkhale et al., 2024)通过语言动作层次桥接高层指令和低层控制,OmniAct在更广泛的跨域场景中实现了类似的层次化,但增加了闭环验证和自适应记忆。
OmniAct开启的最重要的研究方向之一是如何在保持架构模块化的同时,实现模块间的协同学习。当前系统中的VLA策略是冻结的,规划器不能通过学习来改善它;记忆压缩是启发式的,而不是从数据中学到的最优策略。未来一个令人兴奋的方向是使整个系统可微分或可学习,让规划器、记忆和监控器在共同的目标下协同进化。另一个方向是将视觉监控器的语义验证能力扩展到更复杂的失败模式——目前主要处理的是抓取失败和状态未变,但真实的物理世界充满了更微妙的失败(如部分成功、属性变化、隐性依赖破坏)。
更深层次的问题在于:什么是自主智能体的"自我"?OmniAct的反思记忆在某种程度上构成了一个原始自我模型——它记录了"我曾经失败过"、"我学到的东西"、"用户的偏好"。这种基于经验的自我表征与人类的情景自传体记忆有某种同构性。沿着这个方向,未来的研究可能会探索如何让具身智能体形成更丰富的自我模型,包括对自身能力边界的认知、对不确定性的显式表示、以及对长期目标的价值积累。
OmniAct中最令我深思的是异步视觉抢占的设计哲学。它在某种程度上模拟了人类的"注意力"机制:我们并不是时时刻刻监控每一个动作的细节,而是在执行的同时,以较低的频率进行"元认知"检查——"我这样做到底对不对?"这种将执行与监控分离、将高频动作与低频验证分离的架构,不仅是一个工程上的优化,更是一种对智能本质的深刻洞察:真正的智能不是无所不能的感知,而是知道何时该深入细节、何时该放手执行的元能力。这种"有节制的注意力"可能比"全知全能的感知"更接近生物智能的运作方式。如果具身智能的最终目标是构建能够与人类共存于复杂物理世界的自主体,那么OmniAct所展示的架构智慧——清晰的责任分离、层次化的记忆、异步的闭环验证——可能是比单纯扩大模型规模更可持续的路径。
笔记创建时间: 2026-06-28
阅读方式: L2 深度阅读
Topics:
- "embodied_ai"
- "agent_architecture"
- "long_term_memory"
- "multimodal"
- "robotics"
- "reasoning"
References: - "fudan_university"
- "memgpt"