云计算百科
云计算领域专业知识百科平台

MemLens:面向大模型智能体的价值感知记忆管理与交互式分析系统

MemLens:面向大模型智能体的价值感知记忆管理与交互式分析系统

arXiv原文链接:https://arxiv.org/html/2607.25992v1

摘要

记忆管理是大模型智能体的核心底层基础设施,直接决定长时序推理、个性化回复与跨会话知识复用效果。现有大模型记忆方案采用粗粒度统一存储策略,无差异化处理各类交互记录,大量低价值冗余内容长期驻留记忆库,稀释有效上下文、增加Token开销、拉长检索耗时。
本文提出MemLens——一套具备价值感知的智能体记忆全生命周期管理系统,将交互记录作为一等数据对象,基于Shapley边际贡献理论量化记忆单元价值,实现高价值内容选择性留存;配套交互式可视化分析面板,完整覆盖记忆评估、价值感知存储、记忆增强生成全链路流程。
本文以学习助手智能体为演示场景,用户可可视化查看记忆价值分层结构,对比「全量存储、摘要压缩、价值感知存储」三种方案在回答质量、检索延迟、Token消耗维度的差异。MemLens可作为高效、可解释、支持个性化的长记忆底层框架。
在这里插入图片描述

图1:(a) 传统无差异化记忆管理;(b) MemLens价值感知记忆管理
左图传统方案:所有对话、思维链、工具记录全部存入未过滤记忆库;
右图MemLens:拆分细粒度记忆单元,量化价值后筛选高价值内容入库,配套数据分析模块辅助决策。

1 引言

研究背景

长记忆是大模型智能体执行跨会话长时序任务、生成个性化回答、复用历史知识的关键支撑。智能体记忆数据天然异构,除对话文本外,还包含推理思维链、工具调用轨迹、检索文档片段。随着交互会话持续累积,记忆库体量持续膨胀。

现有方案缺陷

现有主流记忆系统(Mem0、VikingMem等)采用两类粗粒度策略:

  • 全量存储:无筛选直接保存所有交互片段;
  • 启发式全局摘要压缩:统一精简全部历史。
    两类方案均未量化单条记忆对后续任务的实际增益,低价值冗余内容持续占用上下文窗口,稀释相关证据、扩大检索空间、显著增加生成阶段Token消耗。
    核心痛点:记忆价值并非固定静态,同一段内容对不同查询贡献差异极大;且记忆单元之间存在组合增益,单一片段效用依赖配套记忆集合。通用摘要策略无法精准区分内容重要性。
  • 本文核心贡献

  • 提出价值感知记忆管理范式,以记忆对下游推理的边际贡献量化效用,仅筛选高价值单元留存;
  • 设计端到端闭环记忆生命周期框架:记忆评估→价值感知存储→记忆增强生成,统一可解释长记忆管理流程;
  • 开发交互式可视化演示系统,直观展示记忆价值分布、分层存储结构,支持多套记忆策略横向对比(回答精度、检索延迟、Token开销)。
  • 在这里插入图片描述

    图2 MemLens系统整体架构
    输入原始交互记录 → 记忆评估模块(拆分分层+Shapley价值打分)→ 价值筛选入库 → 分层记忆存储(向量库+用户画像)→ 查询检索注入LLM生成,全程反馈迭代闭环。

    2 MemLens系统总览

    MemLens彻底重构智能体长记忆存储逻辑,分为三大核心子模块,形成闭环生命周期:

  • 记忆数据评估模块:原始交互拆分层级记忆单元,基于Shapley值量化每条内容的推理贡献;
  • 价值感知记忆存储模块:按价值阈值筛选高价值片段,构建分层语义记忆树,维护动态用户偏好画像;
  • 记忆增强回复模块:检索高价值相关记忆,注入上下文生成个性化回答。
  • 系统核心特性

  • 差异化存储:不统一留存所有交互,仅保留对下游任务增益显著的记忆单元;
  • 可视化交互式分析面板:
    • 每条记忆绑定量化效用分数,全局展示价值分布、留存占比;
    • 可视化分层记忆树,展示语义聚类与长期用户偏好演化;
    • 一键对比全量存储、摘要压缩、价值感知三种方案的精度、延迟、Token开销。
  • 完整工作流

  • 用户归档会话原始交互(对话、CoT推理、工具日志);
  • 系统将原始文本拆分为句子级细粒度原子单元,LLM生成多层摘要,构建层级记忆树(原子片段→中层摘要→高层概览),保留溯源链路避免信息丢失;
  • 基于记忆Shapley值计算每个单元对推理的边际贡献;
  • 设定价值阈值过滤低价值内容,仅高价值单元入库,持续更新用户偏好画像;
  • 用户发起查询时,检索库内高价值相关记忆,结合用户画像注入LLM上下文;
  • 生成回答后可归档新一轮交互,重复完整记忆生命周期,动态迭代记忆库。
  • 3 MemLens系统详细设计

    3.1 记忆数据评估模块

    核心目标:结构化原始交互,并量化每条记忆单元的下游推理效用,分为记忆单元构建、记忆价值计算两步。

    3.1.1 分层记忆单元构建
  • 细粒度拆分:原始交互切分为句子级原子记忆单元;
  • 分层摘要聚合:调用LLM对原子片段多层级归纳,构建树形结构:叶子为原始句子,上层为不同粒度摘要;
  • 溯源绑定:所有高层摘要绑定对应底层原子原文,压缩同时不丢失细节;
  • 优化收益:多条低价值短片段可合并为一条高价值摘要,减少存储与检索开销。
  • 3.1.2 基于Shapley的记忆价值计算

    定义记忆Shapley值(MS-value),量化单条记忆在任意记忆子集下对查询推理的边际增益。

  • 效用基础公式
    给定查询qqq,记忆子集SSS,代理轻模型Mp\\mathcal{M}_pMp
    Vq(S)=Score(Mp(q⊕S))−Score(Mp(q))\\mathcal{V}_{q}(S)=\\textbf{Score}\\big(\\mathcal{M}_{p}(q\\oplus S)\\big)-\\textbf{Score}\\big(\\mathcal{M}_{p}(q)\\big)Vq(S)=Score(Mp(qS))Score(Mp(q))
    ⊕\\oplus代表记忆注入操作,Score由LLM裁判模型输出回答质量分,衡量子集SSS给查询带来的提升。

  • 记忆Shapley值定义
    ϕ(mi)=∑S⊆M∖{mi}∣S∣!(M−∣S∣−1)!M![Vq(S∪{mi})−Vq(S)]\\phi(m_{i})=\\sum_{S\\subseteq\\textsf{M}\\setminus\\{m_{i}\\}}\\frac{|S|!(M-|S|-1)!}{M!}\\left[\\mathcal{V}_{q}(S\\cup\\{m_{i}\\})-\\mathcal{V}_{q}(S)\\right]ϕ(mi)=SM{mi}M!S!(MS1)![Vq(S{mi})Vq(S)]
    MMM为全部记忆单元总数;该值满足无贡献零收益、对称公平、线性可加三大公理。

  • 高效近似计算
    完整排列组合复杂度极高,采用分层抽样近似算法,将复杂度降至O(ρM)O(\\rho M)O(ρM)ρ\\rhoρ为抽样轮次,常规取20~100),保证交互式面板低延迟。

  • 模型配置
    代理轻模型默认使用Qwen2.5-7B,面板支持自由切换各类轻量LLM用于价值打分。

  • 3.2 价值感知记忆存储模块

    基于MS-value完成记忆筛选、分层组织、增量合并,平衡存储成本与推理效果。

    (1)阈值筛选存储

    设定价值阈值τ\\tauτ,仅保留满足条件的记忆单元:
    M∗={mi∈M∣ϕ(mi)≥τ}\\textsf{M}^{\\ast}=\\{m_{i}\\in\\textsf{M}\\mid\\phi(m_{i})\\geq\\tau\\}M={miMϕ(mi)τ}
    面板支持实时滑动调整τ\\tauτ,即时展示记忆压缩率、平均效用变化。

    (2)分层记忆树组织

    原子片段经LLM语义聚类形成树形存储结构:

    • 叶子节点:原始句子原子记忆;
    • 中间/根节点:多层语义摘要;
      新增记忆自动执行三类合并逻辑:
  • 高度相似:直接合并节点,精简冗余;
  • 部分重叠:更新节点补充信息;
  • 完全无关:新增独立分支。
    面板支持点击树形节点查看完整原文与价值分数。
  • (3)交互式数据分析能力
  • 用户画像:基于高价值记忆生成结构化用户偏好提示词;
  • 可视化视图:记忆价值分布直方图、关键词词云、存储压缩率统计;
  • 全局指标:总记忆条数、平均效用、会话增量统计。
  • 3.3 记忆增强回复模块

    利用筛选后的高价值记忆生成个性化回答,并支持会话归档闭环。

  • 检索重排:向量库检索候选记忆,优先按MS-value排序,兼顾语义相似度与推理增益;
  • 上下文注入:将高价值记忆+用户画像共同送入LLM生成回复;
  • 会话归档:交互完成一键归档,送入记忆评估流水线,完成全流程闭环更新记忆库。
  • 4 演示场景:数据库学习助手智能体

    4.1 仿真评测数据集 EduMemBench

    构建数据库专业学习模拟数据集:

    • 2000+轮多会话学生交互对话,主题覆盖事务、索引、并发控制;
    • 衍生500组标准问答测试集,用于横向对比不同记忆策略指标。

    4.2 交互式面板三大功能分区

    在这里插入图片描述

    图3 记忆评估交互面板
    1 模型配置区:切换大模型、轻量代理打分模型;
    2 会话列表:每条对话标记记忆单元、价值分层;
    3 阈值滑动控制器:动态调整留存标准;
    4 价值分布直方图:直观区分高低价值片段。
    在这里插入图片描述

    图4 价值感知存储界面
    1 交互式分层记忆树,节点颜色代表价值高低;
    2 用户偏好画像展示;
    3 全局统计:记忆条数、压缩率;
    4 关键词词云,快速定位高频学习概念。

    在这里插入图片描述

    图5 记忆辅助问答界面
    1 向量库后端切换(FAISS/Milvus);
    2 用户偏好预览;
    3 对话交互区,归档按钮;
    4 雷达图对比三类策略:回答精度、检索延迟、Token消耗。

    4.3 横向对比实验结论

    在EduMemBench数据集上:
    1 全量存储:Token开销巨大,检索延迟高,大量无关内容干扰回答;
    2 全局摘要:丢失细分知识点,专业问题精度下降;
    3 MemLens价值感知方案:同等Token消耗下回答质量显著提升,检索耗时降低,可自由通过阈值平衡压缩率与效果;
    4 框架兼容LoCoMo、LongMemEval等通用长记忆评测基准。

    配套资源汇总

  • 论文HTML原文:https://arxiv.org/html/2607.25992v1
  • 论文PDF原文:https://arxiv.org/pdf/2607.25992
  • MemLens完整开源代码:https://github.com/LIUHA1ZHU/MemLens
  • 配套评测数据集EduMemBench(代码仓库内置)
  • 向量检索依赖FAISS开源库
  • 兼容评测基准:LoCoMo、LongMemEval
  • 赞(0)
    未经允许不得转载:网硕互联帮助中心 » MemLens:面向大模型智能体的价值感知记忆管理与交互式分析系统
    分享到: 更多 (0)

    评论 抢沙发

    评论前必须登录!