云计算百科
云计算领域专业知识百科平台

RoboHarness:面向长时程规划异构机器人策略的记忆-驱动编排

26年7月来自华为诺亚、UBC、Toronto大学、Mcgill大学和2012实验室基础模型部的论文“RoboHarness: Memory-Driven Orchestration of Heterogeneous Robot Policies for Long-Horizon Planning”。

长时程机器人任务需要多种能力,而单一策略往往无法可靠地提供所有这些能力。异构策略各具优势且互补,但要协调这些策略,必须应对不确定的能力边界及跨策略分布不匹配等挑战——现有的基于同构、预定义且适用范围固定的技能的规划方法,往往忽视了这些问题。RoboHarness,这是一个统一框架,将独立开发的机器人控制系统封装为可复用的智体技能(agentic skills)。尽管本研究中该框架是基于视觉-语言-动作模型(VLA)、强化学习(RL)策略以及任务-运动规划(TAMP)系统实现的,但其设计初衷是一个通用框架,能够兼容更广泛的机器人策略,例如导航策略、模型预测控制器和世界-动作模型。RoboHarness 利用多模态执行记忆和在线证据来刻画策略的能力边界,从而实现具备能力感知特性的任务分解与策略路由。为了确保策略交接的稳定性,该框架的“记忆桥”(Memory Bridge)模块会检索与下一阶段策略相关的执行轨迹,估算该策略的分布内状态区域,并引导机器人向该区域移动,而无需对策略进行联合重训练。在三个公开基准测试、500 个定制任务以及 135 组真实机器人实验中进行的广泛测试表明,其实现有效的能力-觉察路由与稳定的策略协调,显著提升了零样本长时程规划能力及分布外(OOD)鲁棒性。


长时程(long-horizo​​n)机器人任务要求策略能够保持指令对齐、泛化适应环境变化、维持逻辑一致性并具备抗噪鲁棒性(Garrett et al., 2020; Yang et al., 2025)。尽管近期机器人系统研究已取得显著进展(Huang et al., 2026b; Black et al., 2024; Silver et al., 2024; Ye et al., 2025),但尚无单一策略能完美满足所有要求,各种策略各有利弊。例如,视觉-语言-动作模型(VLAs)具备语义接地(semantic grounding)和开放词汇指令遵循能力(Black et al., 2024; Kim et al., 2025; Zheng et al., 2025),但在长时程一致性和几何精度方面仍存在局限。强化学习(RL)后训练可在特定训练分布内生成闭环行为(Zang et al., 2025; Intelligence et al., 2025),但在面临分布偏移或奖励函数定义不当的情况下,其适用性往往会下降。任务-运动规划(TAMP)系统提供结构化的逻辑与几何推理能力(Silver et al., 2023; Kumar et al., 2023; Liu et al., 2024; Huang et al., 2025),但其泛化能力受限于预定义的抽象概念、技能及状态表征。更广泛而言,现有策略的能力各有限制,没有哪种单一策略能为跨越多种不同能力需求的子任务的长时程任务提供通用解决方案。这促使将长时程任务执行问题构想为多种具有不同能力边界的异构策略之间的协同。

面向智体与机器人执行的“驾驭”系统(Harness Systems)。驾驭系统起源于软件与编程智体领域,其核心是将语言模型嵌入执行循环中,使其能够调用工具、代码解释器、文件系统、内存、测试工具及利用反馈信号(Yao et al., 2022; Schick et al., 2023; Shinn et al., 2023)。此类系统为工具调用、状态追踪、迭代优化以及基于中间反馈的纠错提供了外部支撑框架,随后扩展至可执行技能库、多智体协作及软件工程智体等领域(Wang et al., 2023; Wu et al., 2023; Hong et al., 2024; Wang et al., 2024; Yang et al., 2024; Wang et al., 2025; Xia et al., 2024)。近期,这一理念被引入机器人领域(Li et al., 2026b),RoboClaw,将视觉-语言-动作模型(VLA)与管理及调度系统相结合,以实现数据采集、任务执行和自我改进。与编程智体相比,机器人驾驭系统必须在物理世界的约束下运行(Xiao et al., 2026),这对底层模型提出了更高的要求。此外,机器人智体系统还面临策略异构性的挑战:不同的策略族在能力、假设、表征及执行机制上各不相同(Zhang et al., 2026; Dalal et al., 2023; Huang et al., 2026a; 2022),这使得策略的选择与协调变得复杂。因此,现有系统通常仅在固定的执行接口下组织来自同一策略族的技能,隐含地假设表征的兼容性与分布内(in-distribution)的交接(Li et al., 2026b; Xiao et al., 2026),而未明确解决异构策略的协同调度或能力边界不确定性问题。RoboHarness 旨在填补这一空白,提供一种专为异构机器人策略之间具备“能力-觉察”特性的协调而设计的驾驭系统。

长时程机器人规划与任务分解。针对长时程(long-horizo​​n)机器人规划的研究涵盖了分层规划、任务与运动规划、基于技能的规划以及基于语言模型的规划等多种方法(Silver et al., 2024; Liang et al., 2024; Athalye et al., 2024; Garrett et al., 2020; Liu et al., 2024; Oswald et al., 2024; Huang et al., 2025)。这些方法将高层指令分解为符号化动作、基础技能或子任务序列,从而降低了解决长时程操作任务的复杂度。任务与运动规划方法结合了符号化任务推理、几何可行性检查以及预先设计的抽象可复用技能(Garrett et al., 2021; Kaelbling & Lozano-Pérez, 2011)。近期基于语言模型的规划器利用语义知识和指令遵循能力,根据自然语言目标生成任务规划,并使其适应不同的任务情境(Zhao et al., 2023; Yang et al., 2025; Guan et al., 2023; Chen et al., 2024; Hu et al., 2023)。然而,这些方法大多基于同构技能或策略的假设,即各项策略具有预定义、明确且互不重叠的能力;它们隐含地假设控制权转移无需额外的中介步骤,且不同策略间的输入与输出条件是相互匹配的。因此,这些方法未能解决涉及异构策略的长时程规划问题——在此类问题中,任务分解、策略分配以及策略间的交接(handoff)必须进行联合推理。

策略链式组合与空间一致性交接。技能链式组合(Skill chaining)研究了在连接短时程策略以解决长时程任务时出现的分布偏移问题,其中相邻策略间的交接往往成为制约性能的瓶颈。既有研究通过学习起始集(Konidaris & Barto, 2009; Huang et al., 2023)、转移机制(Lee et al., 2019; Sahni et al., 2017; Mishra et al., 2023)或终止状态正则化项(Lee et al., 2021),来改善某一策略的终止状态与后续策略可执行区域之间的兼容性,从而应对这种分布不匹配问题。这些方法表明,长程任务的性能不仅取决于单个策略的可靠性,还取决于前一策略的终止状态与后一策略可执行区域之间的兼容性。然而,这些方法主要属于训练阶段的解决方案,需要额外的学习过程或策略正则化,而无法实现在线的即插即用式协同。此外,这些方法通常假设存在一个能力边界相对明确的共享策略族及既定技能集,因而未能充分解决异构策略的分解与调度问题。

本文提出一种现有规划方法尚未充分解决的规划问题:如何协同独立设计或训练的异构控制策略,以解决那些超出任何单一策略固有能力范围的长时程任务。传统的长时程规划方法通常假设存在一组适用范围固定的同构预定义技能(Liang et al., 2024; Han et al., 2024; Kaelbling & Lozano-Pérez, 2011),从而能够在具有明确技能边界的静态技能空间内进行任务分解。相比之下,异构机器人策略在架构、输入输出要求、策略假设及执行历史方面各不相同(Zhang et al., 2026; Garrett et al., 2021)。它们的适用边界往往模糊且依赖于具体情境:不同策略的适用范围可能存在重叠,而它们的相对性能也会随物体配置、视觉观测、语言指令及执行历史的变化而波动。因此,规划器必须根据策略的能力来分解任务,并确定在当前条件下哪个策略能可靠地执行各个子任务。此外,独立训练或人工设计的策略未必能直接组合:一个策略产生的终止状态可能并不处于下一个策略的可执行区域或输入分布范围内(Lee et al., 2021; 2019)。若在控制权交接时忽视这种不匹配,可能会引发分布偏移,甚至导致策略交接过程中的级联故障。

RoboHarness,是一个用于异构机器人策略且具备“能力-觉察”特性的统一规划框架。RoboHarness 将独立训练或人工设计的策略封装为可复用的智体技能模块,并辅以描述能力边界及协调特定输入输出要求的辅助模块。为了支持可靠的策略间交接,RoboHarness 引入一种名为“记忆桥(memory bridge)”的链式连接技术,该技术结合了记忆检索与空间分布学习,以保持空间一致性。这一设计使 RoboHarness 能够根据策略的适用性分解任务,并自适应地协调所选策略,从而以零样本(zero-shot)方式完成复杂的长程任务。


问题的关键在于协同执行任务分解、基于能力-觉察的策略分配以及策略间的衔接,从而确保最终的执行过程能够完成任务 I,同时使每个被选定的策略都分配到可行的子任务,并接收到符合分布(in-distribution)的输入。

RoboHarness 是一个智体编排框架,其中编码智体(coding agent)充当异构机器人策略的高层规划器与调度器。该编码智体动态调用三类辅助技能:信息理解、记忆和自我演化。它通过解读这些技能的结构化输出,来分解长时程指令、为子任务分配适宜的策略,并协调策略间的必要交接。如图1所示,这些辅助技能并不替代底层控制策略,而是为实现“具备能力-觉察特性的规划”以及跨不同执行分布的稳定策略编排,提供所需的信息、记忆和适应机制。RoboHarness 保留现有策略的原生接口,使得独立开发的策略能够进行组合,而无需联合重训练或共享动作表征。
请添加图片描述

1 理解技能

理解技能进一步解读 RoboHarness 可获取的原始输入,包括任务指令、视觉观测、估计的物体位姿、机器人状态以及中间执行结果。其目的不仅限于场景识别,而是提取与决策相关的信息,揭示当前任务状态与可用策略的能力边界之间的关系。RoboHarness 目前包含五种理解技能,并可在需要额外信息时进行扩展。不确定性评估计算滑动时间窗口内估计物体位姿的均值与方差,以衡量时间稳定性。视觉上下文评估将当前观测投影到潜空间,并将其与特定策略训练轨迹的视觉嵌入进行比较。语义上下文评估采用类似方法,将编码后的任务指令及候选子任务与各策略关联的语言描述进行比对。状态-策略兼容性评估利用“记忆桥”(Memory Bridge)重建的空间分布,对当前的末端执行器位姿和关节配置进行评分,从而判断机器人状态是否处于下一策略的分布内(in-distribution)区域。输入质量评估考察图像清晰度、曝光、噪声以及任务相关物体的可见度,以确定当前观测是否足够可靠。这些理解技能共同提供结构化的、与任务相关的证据,而这些证据仅凭原始输入往往难以可靠地推断出来。编码智体(coding agent)按需调用相关技能,并综合分析其输出结果,从而分解任务并将各子任务分配给最合适的策略。

2 记忆技能与记忆桥

记忆技能包含两个组成部分:多模态记忆管理和基于记忆的策略间桥接。

记忆管理

记忆库 M 组织为一组由节点链接构成的轨迹。轨迹 ξ = (n_1, . . . , n_L) 由 L 个按时间顺序排列的节点组成;其中每个节点 n 存储子任务指令 g(n)、观测 o(n) 和机器人状态向量 s(n),以及相应的文本嵌入和视觉嵌入。此处,d_s 表示机器人状态表征的维度,而 e_text 和 e_vis 分别表示文本编码器和视觉编码器。令 V(M) 表示存储在 M 中的所有节点的集合。给定查询子任务 g ∈ G 和观测 o ∈ O,RoboHarness 对 M 中的节点执行分层检索。

它首先检索那些存储的指令与 g 在语义上最相关的节点;随后,RoboHarness 将查询观测与 N~ 中节点的视觉嵌入进行比较,并检索出 N;将整体记忆检索函数表示为 Retrieve_M (g, o) = N,其中 N 是由上述分层文本-视觉检索过程返回的节点集合。来自这些检索的节点信息会被提供给下游的辅助技能,并用于构建“记忆桥”(Memory Bridge)。

此外,RoboHarness 还维护着全局历史统计数据,用于汇总不同任务中的策略执行结果,从而为能力评估和策略分配提供经验依据。在每次执行(rollout)结束后,关联节点轨迹与执行统计​​数据都会持续更新。

记忆桥(Memory Bridge)负责处理策略间的转换,即当策略 pi_{k_t} 产生的终止观测 o_t 不在策略 pi_k_{t+1} 所支持的输入空间 O_{k_{t+1} 内时的情况。如图2 所示,给定即将执行的子任务 g_{t+1} 和观测 o_t,RoboHarness 检索出一组相关的锚点(anchor nodes),记为 N_t = RetrieveM_+∞(g_t+1, o_t)。基于这些节点,记忆桥构建一个局部进度函数,并生成一条桥接轨迹 b_t;该轨迹引导机器人在调用 pi_{k_{t+1)} 之前,先到达一个观测值位于 O_{k_{t+1}} 范围内的交接状态。该过程包含三个阶段。
请添加图片描述

空间分布构建。设 N_t {n_{1,0}, dots, n_{K,0}},其中 K = |N_t|,n_{i,0} 表示第 i 个检索的节点;该节点被视为锚点,作为轨迹扩展和进度评分的时间参考。RoboHarness 沿着每个锚点关联的轨迹,在时间跨度 l 内向前后两个方向进行扩展。设 n_{i,j} 为与 n_{i,0} 关联且时间偏移量为 j ∈ {−l, . . . , l} 的节点。每个锚点的分值设为零,而其关联节点的分值则根据其时间偏移量确定。具体而言,RoboHarness 构建机器人状态与分值的配对 (s_{i,j}, y_{i,j}),其中s_{i,j} 是存储在 n_{i,j} 中的机器人状态,y_{i,j} 是分配给该状态的进度分值。这些配对用于训练一个轻量级进度估计器 f_{score},该估计器预测状态 s 的局部进度。设S_ret,t ={s_{i,j}} 表示扩展后的机器人状态样本集。随后,RoboHarness 构建局部支持区域 R_conf,t,该区域基于状态 s 到其最近的扩展记忆状态的距离来定义(即 R_conf,t} 限制学的进度函数,使其仅适用于由检索到的记忆提供局部支持的状态)。

空间状态评分。 RoboHarness 利用 f_score,t 来评估 R_conf,t 区域内的候选机器人状态。尽管在执行“桥接”(bridge)轨迹的过程中可能会经过该区域之外的状态,但这些状态并不被视为有效的交接目标,因为其进度估计缺乏来自所检索记忆的充分支持。在 R_conf,t 范围内,f_score,t(s) 的符号反映状态 s 相对于所检索锚点(anchors)的估计局部进度:正值表示任务进度较深,负值则表示任务进度较浅。因此,f_score,t 衡量的是相对进度,而 R_conf,t 则界定由下一阶段策略所检索的执行经验支持的、可接受的交接状态集合。

桥接轨迹生成。设 s_t 表示策略 π_k_t 执行后的机器人状态,并设 S_plan,t 表示采用的运动规划器能够从 s_t 出发并可行地连接到的状态集合。RoboHarness 选取交接目标机器人状态。“支撑约束”确保所选目标位于由检索到的记忆所表征的执行分布范围内,而“非负评分约束”则将目标限制在相对于检索到的锚点(anchors)呈现出向前进展态势的状态上。随后,RoboHarness 调用现成的运动规划策略,生成一条连接 s_t 与 s*t 的可行桥接轨迹 b_t,并在此基础上执行 pi{k, t+1}。由此产生的交接过程(连同相关的指令、视觉观测及机器人状态轨迹)会被存入记忆库 M 中;这样,其中的节点便可通过 RetrieveM 操作被检索出来,并复用于类似的策略间转换场景。

3 自我演化技能

自我演化技能利用在线执行过程中的证据,通过四种类型的更新来调整 RoboHarness。策略适配(Policy adaptation)整合现成的适配方法以扩展单个策略的能力,例如用于抓取姿态调整的 SIMPACT (Liu et al., 2026) 和用于在线学习新逻辑表示的 PDDLLM (Huang et al., 2025)。编排精炼(Harness refinement)利用编码智能体(coding agent)修改编排结构,包括任务路由策略、技能调用规则以及技能间的协作方式。参数调优(Parameter tuning)通过网格搜索调整超参数,涵盖内存检索设置、状态评分阈值及桥接接受标准。元数据更新(Metadata update)根据新观察到的成功与失败案例,修订策略能力的元数据。在仿真实验中,这四种自我演化机制均处于启用状态,但更新仅在系统遇到持续执行失败时触发,而非在每次执行尝试后都进行。在此类情况下,内存技能会检索相关的失败历史与执行证据并提供给编码智能体;随后,编码智体决定应采用策略适配、编排精炼、参数调优、元数据更新中的哪一种或几种机制。经验证的更新会被保留并跨越后续评估回合持续生效,从而使 RoboHarness 能够积累经验,并逐步适应新的任务、物体、场景及环境。

4 作为智体技能的异构策略

RoboHarness 将每种异构机器人策略封装为可调用的“智体技能”,该技能由策略本身及关联的“策略卡”(policy card)构成。每种策略保留其原生的实现方式、输入及输出,无需统一的动作表示;与此同时,策略卡记录该策略的类型、能力、接口要求、约束条件、假设前提、训练任务以及总结执行结果的历史统计数据。编码智体还能直接检查策略的实现代码,从而在元数据摘要之外,进一步推断策略的能力与兼容性。这种表示方式使得本质迥异的策略(如视觉-语言动作模型 VLA、任务与运动规划器、专用强化学习策略等)能够在规划层面进行比较与组合。随着内存中不断积累新的执行证据,RoboHarness 会持续更新每张策略卡,以细化其能力边界,并为后续的规划与策略分配提供支持。


1 实验置

仿真基准测试中的异构策略:除非另有说明,RoboHarness 配备三种能力互补且独立开发的策略:(1) 在 LIBERO-Spatial、LIBERO-Goal、LIBERO-Long 和 LIBERO-Object 上训练的开源 π0.5 检查点 (Black et al., 2025);(2) 开源 OpenVLA-OFT 检查点 (Kim et al., 2025),该检查点利用 RLinf (Zang et al., 2025) 并在 LIBERO-90 任务上通过组相对策略优化 (GRPO) (Shao et al., 2024) 进行了后训练;以及 (3) 针对预定义物体集上的几何约束抓取与放置任务而设计的 TAMP(任务与运动规划)规划器。

基准测试中的仿真评估:在三个考察 RoboHarness 不同侧面的公开基准测试上对其进行评估。LIBERO 评估通用的任务遵循性能 (Liu et al., 2023),而 LIBERO-Plus 评估分布外 (OOD) 鲁棒性以及 RoboHarness 刻画其组成策略能力边界的准确度 (Fei et al., 2025)。LIBERO-LoHo 针对零样本长程规划,其任务的平均时程(horizo​​n)约为原始 LIBERO 基准测试任务的四倍 (Huang et al., 2026a)。除了上述基准测试外,还设计 500 个涵盖 10 种任务类型的更复杂仿真任务,每项任务都需要集成多种异构策略。由于现有公开基准测试中的许多任务仅靠单一策略即可解决,因此它们无法充分评估多策略集成的鲁棒性或策略间切换的稳定性。

真实机器人实验:进一步开展135 组真实机器人实验,涵盖五类具有挑战性的任务和四种类型的干扰,每项实验均要求协同使用多种异构策略。给定可用积木和语言指令,RoboHarness 必须根据要求的结构进行推理,并生成组装计划,以构建诸如矮桥、高桥、汉字或船只等结构。一些必要的积木最初隐藏在柜子里,这就要求机器人打开柜子,探查内部物品,并取回缺失的积木。

2 基线方法

将 RoboHarness 与涵盖三种代表性方法类别的综合基线进行比较。VLA 基线包括 π0.5 (Black et al., 2025)、π0 (Black et al., 2024)、UniVLA (Bu et al., 2025)、X-VLA (Zheng et al., 2025)、OpenVLA-OFT (Kim et al., 2025) 和 GR00T-N1.5 (Bjorck et al., 2025)。进一步考察三种世界-动作模型(world-action models),包括 LingBot-VA (Li et al., 2026a)、Fast-WAM (Yuan et al., 2026) 和 Cosmos Policy (Kim et al., 2026)。此外,还纳入三种分层规划方法:H-WM (Huang et al., 2026a)、LLM-guided VLA (Shi et al., 2025) 和 logic-guided VLA (Huang et al., 2026a)。通过这些比较,RoboHarness 既与端到端策略进行了对比,也与专门针对长程决策设计的方法进行对比。评估结果基于 Huang et al. (2026a) 和 Zhang et al. (2026) 的基准测试。

赞(0)
未经允许不得转载:网硕互联帮助中心 » RoboHarness:面向长时程规划异构机器人策略的记忆-驱动编排
分享到: 更多 (0)

评论 抢沙发

评论前必须登录!