云计算百科
云计算领域专业知识百科平台

ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory论文阅读

今天分享的论文是《ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory》

原文链接:https://arxiv.org/abs/2509.25140

这是一篇谷歌的论文,关于自演化智能体的。

随着大型语言模型(LLM)智能体在现实世界中持续发挥作用的场景日益增多,它们自然会面临源源不断的任务流。然而,其关键局限在于无法从累积的交互历史中学习,导致不得不丢弃有价值的见解并重复过去的错误。本文提出ReasoningBank——一种新型记忆框架,能够从智能体自我判断的成功与失败经验中提炼可泛化的推理策略。在测试阶段,智能体从ReasoningBank中检索相关记忆以指导交互,随后将新学到的知识整合回框架中,使其能力随时间推移不断提升。基于这一强大的经验学习机制,本文进一步提出记忆感知测试时扩展(MaTTS):通过扩展智能体的交互经验,加速并丰富其学习过程。通过为每个任务分配更多计算资源,智能体可生成丰富多样的经验,为合成更高质量的记忆提供充足的对比信号;而更优质的记忆反过来又能指导更有效的扩展,最终在记忆与测试时扩展之间形成强大的协同效应。在网页浏览和软件工程基准测试中,ReasoningBank持续优于现有仅存储原始轨迹或单一成功任务流程的记忆机制,在有效性和效率上均有提升;MaTTS则进一步放大了这些优势。这些发现证实,基于记忆的经验扩展可作为智能体的新扩展维度,使智能体能够自然涌现出复杂行为并实现自进化。

大型语言模型(LLM)的快速发展极大地推动了LLM智能体的研发(Liu et al., 2025a; Wang et al., 2024)。这类智能体对于处理需要与环境进行多步交互的复杂现实任务至关重要,例如网页浏览(Gur et al., 2024)和计算机操作(Xie et al., 2024; Yang et al., 2024)。随着智能体越来越多地被部署到长期、持续运行的场景中,其在生命周期内必然会面临源源不断的任务流。然而,目前的智能体大多无法从跨任务的累积经验中学习:它们将每个任务视为独立个体,这导致其必然重复过去的错误(Yin et al., 2025)、丢弃相关问题中的有价值见解,并且缺乏使系统能力随时间提升的自进化能力(Gao et al., 2025)。这凸显了构建可从过往经验学习的记忆感知型智能体系统的必要性(Zhang et al., 2024b)。

当前关于智能体记忆的研究主要集中于存储过往交互以实现复用(Chen et al., 2025; Sun et al., 2025; Tang et al., 2025b)。尽管这类方法具有一定作用,但通常局限于利用原始轨迹(Kagaya et al., 2024; Kong et al., 2025; Zheng et al., 2024)或常见的成功流程(即工作流、步骤流程)(Fang et al., 2025; Wang et al., 2025d),并存在两个根本性缺陷: 

1. 无法提炼更高层次、可迁移的推理模式; 

2. 过度强调成功经验,大幅忽视了智能体自身失败中蕴含的宝贵教训(Zhang et al., 2024a)。 

因此,现有记忆设计往往停留在“被动记录”层面,无法为未来决策提供可执行、可泛化的指导。

为填补这一空白,本文提出ReasoningBank——一种面向智能体系统的新型记忆框架。ReasoningBank无需真值标签,仅通过智能体自身的判断,从成功和失败经验中提炼并组织记忆单元。如图1所示,该框架不仅捕获成功经验中的有效策略,还提取失败经验中的关键预防教训,并将其抽象为一组可执行的原则。整个过程以闭环形式运行:面对新任务时,智能体从ReasoningBank中检索相关记忆以指导行动;任务完成后,新经验会被分析、提炼并整合回ReasoningBank,使智能体能够持续进化并提升其策略能力。

图1展示了ReasoningBank如何生成可复用的推理策略,使记忆单元对未来任务更具迁移性。相比“无记忆”基线,该框架能让智能体在WebArena-Admin子集上实现持续进化,并获得更高的累积成功率。

以ReasoningBank这一强大的经验学习机制为基础,本文进一步研究经验扩展,旨在构建记忆与测试时扩展之间的强大协同关系。不同于通过“增加任务数量”实现广度扩展,本文聚焦于通过“深化单个任务的探索程度”实现深度扩展,并提出了记忆感知测试时扩展(MaTTS)包含并行和串行两种设置。该方法通过生成多样化的探索过程提供对比信号,使ReasoningBank能够合成更具泛化性的记忆。这一设计在记忆与测试时扩展之间形成协同效应:高质量记忆引导扩展探索向更有前景的方向推进,而生成的丰富经验又能反过来强化记忆。这种正向反馈循环表明,基于记忆的经验扩展可作为智能体的新扩展维度。

本文在网页浏览(WebArena、Mind2Web)和软件工程(SWE-Bench-Verified)等挑战性基准测试中开展了大量实验。结果表明,所提方法在有效性(相对提升最高达34.2%)和效率(交互步骤减少16.0%)上均优于基线方法。具体而言,ReasoningBank与MaTTS的协同效果最佳,是实现基于记忆的经验扩展的核心组件。

本文的贡献主要体现在三方面: 

1. 提出ReasoningBank新型记忆框架:突破现有方法仅存储原始轨迹或单一成功流程的局限,从成功和失败经验中提炼可泛化的推理策略; 

2. 提出MaTTS(记忆感知测试时扩展):构建记忆与测试时扩展之间的强大协同关系,确立“基于记忆的经验扩展”为智能体的新扩展维度; 

3. 通过大量实验验证:所提方法不仅在有效性和效率上优于现有方法,还能使智能体从失败中学习,并随时间发展出更复杂、更具涌现性的推理策略。

相关工作

LLM智能体的记忆

记忆已成为现代智能体系统的核心模块(Zhang et al., 2024b),通过利用过往信息提升系统性能(Zhang et al., 2024b)。现有记忆系统以多种形式组织和存储信息,包括纯文本(Packer et al., 2023)、潜在知识嵌入(Wang et al., 2025b)和结构化图(Chhikara et al., 2025; Li et al., 2025b; Xu et al., 2025)。除记忆内容外,这些方法通常还涉及检索机制(如语义搜索)和记忆管理策略(如更新)(Hu et al., 2025a; Tan et al., 2025)。 

近年来,随着强化学习(RL)在LLM智能体中的应用增多,RL也被用于智能体系统的记忆管理(Yu et al., 2025a; Zhou et al., 2025)。然而,现有研究大多强调个性化(Zhang et al., 2025; Zhong et al., 2024)和长上下文管理(Hu et al., 2025b; Maharana et al., 2024; Wu et al., 2025),而本文属于“从过往经验学习”这一研究方向(SU et al., 2025; Zhao et al., 2024)——这是构建自进化智能体系统的关键环节(Gao et al., 2025; Liang et al., 2024)。 

与现有仅复用成功轨迹(Tang et al., 2025a; Zheng et al., 2024)或流程化工作流(Fang et al., 2025; Liu et al., 2025b; Qian et al., 2024; Wang et al., 2025d)的研究不同,ReasoningBank存储的是高层次策略和推理提示:通过将经验抽象为可复用的推理单元,ReasoningBank不仅能让智能体从成功案例中泛化,还能从失败中学习,从而为测试时学习提供更丰富的指导。此外,本文首次探索了“记忆感知的测试时扩展”,使ReasoningBank能与丰富探索轨迹中的多样化信号协同工作。

智能体测试时扩展

测试时扩展(TTS)(Snell et al., 2025)已展现出强大的有效性,成为端到端问题求解(如代码生成(Li et al., 2025a; Yu et al., 2025c)和数学推理(Muennighoff et al., 2025))中的常用方法,常见技术包括“最优N选1(best-of-N)”(Chow et al., 2025)、“束搜索(beam search)”(Wu et al., 2024b)和“验证器利用”(Setlur et al., 2025)等。 

然而,TTS在多轮交互场景(尤其是智能体任务)中的应用尚未充分探索。现有研究主要借鉴推理任务的经验(Zhu et al., 2025b),并从智能体系统的不同维度进行扩展,例如每个动作的搜索空间(Yu et al., 2025b)、多智能体系统中的智能体数量(Jin et al., 2025)以及与环境的交互次数(Shen et al., 2025)。但这些研究均未考虑智能体记忆在扩展中的作用——而记忆本可帮助智能体从过往经验中学习,进而指导未来决策。 

本文通过提出“记忆感知测试时扩展(MaTTS)”扩展了这一研究方向。实验结果(表明,记忆的价值远超单纯的计算扩展:记忆与扩展可协同工作,共同提升系统性能。

ReasoningBank框架

过往的原始轨迹(或经验)虽完整且原始,但往往冗长且包含噪声,无法直接应用于当前用户查询。如图2所示,ReasoningBank的核心功能是从过往经验中提炼出有用的策略和推理提示,将其转化为结构化记忆单元后存储,以供未来复用。

图2为ReasoningBank框架概述:经验被提炼为包含“标题、描述、内容”的结构化记忆单元;面对新任务时,智能体检索相关单元与环境交互,并从成功和失败轨迹中构建新记忆单元,最终整合到ReasoningBank中,形成闭环记忆流程。图3为普通TTS与MaTTS的对比:(a)普通TTS(无聚合的MaTTS);(b)MaTTS并行扩展(通过多条轨迹的自对比筛选可靠记忆);(c)MaTTS串行扩展(通过自优化为记忆补充中间推理信号)。

记忆模式(Memory Schema)

ReasoningBank中的记忆单元是从过往经验中诱导生成的结构化知识单元,其设计思路是剥离低层次的执行细节,同时保留可迁移的推理模式与策略。每个记忆单元包含三个核心组件: 

(1)标题(Title):作为简洁标识,概括该记忆单元的核心策略或推理模式; 

(2)描述(Description):用一句话简要总结记忆单元的核心内容; 

(3)内容(Content):记录从过往经验中提炼的推理步骤、决策依据或操作见解。 

这些记忆单元兼具“人类可解释性”与“机器可用性”,便于智能体高效使用和集成。

ReasoningBank与智能体的集成

配备ReasoningBank的智能体可从一组经过筛选的可迁移策略中获取指导,进而辅助决策——这使得智能体能够调用有效的过往见解、规避已发现的陷阱,并更稳健地适配未见过的查询。二者的集成过程分为三个步骤(如图2所示):记忆检索(memory retrieval)、记忆构建(memory construction)与记忆整合(memory consolidation)。 

1. 记忆检索:智能体根据当前查询上下文查询ReasoningBank,通过基于嵌入的相似度搜索,筛选出与当前任务最相关的前$k$条经验及其对应的记忆单元。检索到的记忆单元会被注入智能体的系统指令,确保决策过程有可用的过往经验作为支撑。 

2. 记忆构建:当前查询任务完成后,需通过记忆构建提取新的记忆单元。首先,需获取已完成轨迹正确性的“代理信号”:本文采用“LLM作为评判者(LLM-as-a-judge)”的方法(Gu et al., 2024),在无真值的情况下,根据查询和轨迹将结果标注为“成功”或“失败”。基于这些信号,采用差异化的提取策略:成功经验贡献经过验证的策略,失败经验则提供反事实信号与陷阱提示,帮助强化智能体的“行为边界”。在实际操作中,每条轨迹(或经验)可提取多个记忆单元(详见附录A.1)。 

3. 记忆整合:将新构建的记忆单元通过简单的“添加操作”整合到ReasoningBank中,使记忆库持续进化。具体细节见附录A.2。 

上述三个步骤形成闭环:智能体利用过往经验指导当前任务,从当前任务中构建新记忆,并持续更新记忆库,最终实现测试时学习场景下的持续进化。(注:本文刻意简化了记忆使用流程,未在检索或整合环节引入额外复杂度,以突出ReasoningBank本身的贡献;未来可通过更复杂的技术进一步优化这些环节,以获得额外收益。)

记忆感知测试时扩展(MaTTS)

ReasoningBank使智能体能够从经验中学习,而“更多经验”意味着“更大提升”。近年来,测试时扩展(TTS)(Snell et al., 2025)已成为提升LLM智能体性能的有效策略(Zhu et al., 2025a)——通过分配更多推理阶段的计算资源,可生成丰富的探索历史,具备巨大应用潜力。 

ReasoningBank与测试时扩展的直接结合方式:将更多轨迹独立转化为更多记忆单元。但这种普通形式的结合存在局限性——它未利用“同一问题的冗余探索所产生的内在对比信号”,导致测试时扩展的性能提升受限。为解决这一问题,本文提出记忆感知测试时扩展(MaTTS),将测试时扩展与ReasoningBank进行深度集成。与普通方法不同,MaTTS会刻意从扩展过程中生成的大量成功与失败轨迹中学习,以实现更有效的记忆筛选。本文为MaTTS设计了两种互补的实现方式:并行扩展(parallel scaling)与串行扩展(sequential scaling),具体实现细节见附录A.3。

并行扩展(Parallel Scaling)

在并行设置下,智能体在检索到的记忆单元指导下,为同一查询生成多条轨迹。通过对不同轨迹进行“自对比(self-contrast)”(Chen et al., 2020),智能体可识别出具有一致性的推理模式,同时过滤掉虚假解决方案。这一过程能从单一查询的多次尝试中筛选出更可靠的记忆,进而促进多样化探索。

串行扩展(Sequential Scaling)

串行扩展遵循“自优化(self-refinement)”原则(Madaan et al., 2023),在单条轨迹初始完成后,对其推理过程进行迭代优化。在此过程中,自优化生成的中间记录也会被视为有价值的记忆信号——这些记录包含了推理尝试、修正过程与见解,而这些信息可能不会出现在最终解决方案中。

本文定义“扩展因子k”:对于并行扩展,k表示轨迹数量;对于串行扩展,k表示优化步数。配备ReasoningBank后,并行与串行两种策略均具备“记忆感知能力”,确保测试时分配的额外计算资源能转化为更具迁移性、更高质量的记忆,以服务于未来任务。

为验证方法有效性,本文设置三类基线模型,覆盖“无记忆-轨迹记忆-工作流记忆”的完整梯度: 

1. 无记忆(No Memory):无任何记忆模块的基础LLM智能体; 

2. Synapse(轨迹记忆)(Zheng et al., 2024):将过往轨迹作为上下文记忆的代表性方法; 

3. AWM(工作流记忆)(Wang et al., 2025d):从轨迹中抽象通用模式并形成可复用工作流的方法。 

实验实现细节如下: 

– LLM骨干模型:采用Gemini-2.5系列(Comanici et al., 2025)和Claude-3.7(Anthropic, 2025),涵盖跨模型家族(Gemini、Claude)与同家族不同能力等级(Gemini-2.5-Flash、Gemini-2.5-Pro)的对比; 

– 运行环境:网页浏览任务使用BrowserGym(de Chezelles et al., 2025),软件工程任务使用仅支持bash命令的环境; 

– 智能体架构:采用ReAct风格(Yao et al., 2023),默认解码配置,WebArena任务单查询最大步数限制为30步。 

评估维度聚焦有效性与效率: 

– 有效性:以“成功率(SR)”衡量,即智能体成功解决用户查询的比例,采用LLM模糊匹配与精确字符串匹配结合的方式验证答案正确性; 

– 效率:以“平均交互步数(Step)”衡量,反映任务完成过程中的计算与交互成本。不同基准测试的具体指标会根据任务特性调整(详见附录B)。

ReasoningBank的涌现行为

研究发现,ReasoningBank中的策略并非单一固定,而是会随时间进化,呈现出类似强化学习(RL)学习动态的涌现行为(Wang et al., 2025a)。如图6所示,ReasoningBank中的某一记忆单元在测试时学习过程中会逐步演化,具体阶段如下: 

1. 流程化/执行型策略:初始阶段,策略以执行为导向(如“寻找导航链接”),智能体仅遵循简单的动作规则; 

2. 原子化自我反思:随着经验积累,策略进化为适应性反思(如“重新验证元素标识以减少低级错误”); 

3. 适应性检查:进一步积累经验后,策略发展为系统性检查(如“利用搜索或筛选功能确保结果完整性后再反馈”); 

4. 组合式策略:最终成熟为组合式推理(如“交叉验证任务需求,并将低级动作重新映射为高级推理”)。 

这一演化过程表明,ReasoningBank能让智能体从“机械执行”逐步升级为“灵活推理”,实现策略的持续优化。

图6为ReasoningBank涌现行为的案例分析,展示了某一记忆单元在测试时学习时间线上从“流程化策略”到“组合式策略”的演化过程。

未来研究方向

1 组合式记忆(Compositional Memory)

当前框架将每条经验提炼为多个独立的记忆单元,面对新查询时,仅通过相似度检索并独立复用这些单元。这种设计虽能突出记忆内容的价值,但未考虑单元间的组合潜力。未来可探索“组合感知的检索与整合”——让智能体将互补的记忆单元组合成更高层次的策略,或形成可复用的“策略宏(macro)”,从而在长周期任务中实现更强的泛化能力。

2 高级记忆架构(Advanced Memory Architectures)

当前系统设计刻意保持简洁,以突出核心贡献。未来可构建分层式、产品级记忆栈,整合现有成熟记忆范式: 

– 情景轨迹(episodic traces)(Fountas et al., 2025):用于存储单任务上下文; 

– 短期“工作记忆”(working memory)(Lumer et al., 2025):用于维护会话内状态; 

– 长期巩固记忆(long-term consolidated memory)(Wang et al., 2025b):结合“遗忘/刷新策略”存储长期知识。 

ReasoningBank的设计理念与上述记忆维度兼容。此外,未来还可将“基于嵌入的相似度检索”升级为“推理密集型控制器”(Shao et al., 2025)——通过拆解查询、规划多跳检索、结合不确定性/时效性/成本等因素选择记忆,甚至引入基于学习的路由与整合策略实现自动化。这种整合可将“ReasoningBank+MaTTS”转化为可部署的记忆服务,实现跨领域、跨团队的规模化应用。

局限性

尽管ReasoningBank在实验中表现出优异性能,并提出了“记忆作为扩展维度”的实用范式,但仍存在以下局限性,为未来研究指明方向:

1 聚焦记忆内容而非架构

本文的核心贡献在于“记忆内容的筛选与利用”(如整合失败轨迹、提炼推理提示),而非记忆架构的创新。因此,未与“情景记忆(episodic memory)”“分层记忆(hierarchical memory)”等架构进行深入对比——这些架构解决的是“记忆形式/结构”的问题,与本文“记忆内容”的研究方向正交。未来可探索将ReasoningBank与这些架构结合,进一步提升性能。

2 记忆检索与整合策略较简单

为更清晰地分离“记忆内容质量”的影响,本文刻意采用“基于嵌入的简单检索”与“直接追加的整合策略”。尽管这种设计能确保性能增益可归因于记忆内容,但更复杂的策略(如自适应检索、分层整合)与ReasoningBank框架兼容,且可能进一步提升性能——这些策略并非本文重点,需未来单独探索。

3 依赖LLM-as-a-judge获取正确性信号

当前实现中,轨迹的“成功/失败”信号由“LLM作为评判者(LLM-as-a-judge)”判定。这种自动标注方法虽能在无真值的情况下实现规模化评估,但在任务模糊或评判模型自身存在偏差时,可能引入噪声。尽管实验结果表明框架对这类噪声具有一定鲁棒性,但未来可通过引入更强的验证器、人机协同反馈或集成评判等方式,提升记忆诱导的可靠性。

做个总结

本文提出ReasoningBank——一种从成功与失败经验中提炼策略级推理信号的记忆框架,并将其与测试时扩展结合,构建了记忆感知测试时扩展(MaTTS)。大量实验表明: 

1. ReasoningBank在提升性能的同时,能减少冗余探索,实现“有效性-效率”双优; 

2. 记忆与测试时扩展存在强协同作用:ReasoningBank引导扩展向更有前景的轨迹推进,而多样化轨迹则为记忆提供宝贵的对比信号,形成正向循环; 

3. 组件分析与涌现行为研究验证了“失败经验整合”“策略演化”的价值。 

本文的发现为构建“自适应、终身学习型智能体”提供了切实可行的路径,未来可进一步探索更复杂的记忆架构与扩展策略。

赞(0)
未经允许不得转载:网硕互联帮助中心 » ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory论文阅读
分享到: 更多 (0)

评论 抢沙发

评论前必须登录!