MemLens:面向大模型智能体的价值感知记忆管理与交互式分析系统
arXiv原文链接:https://arxiv.org/html/2607.25992v1
摘要
记忆管理是大模型智能体的核心底层基础设施,直接决定长时序推理、个性化回复与跨会话知识复用效果。现有大模型记忆方案采用粗粒度统一存储策略,无差异化处理各类交互记录,大量低价值冗余内容长期驻留记忆库,稀释有效上下文、增加Token开销、拉长检索耗时。
本文提出MemLens——一套具备价值感知的智能体记忆全生命周期管理系统,将交互记录作为一等数据对象,基于Shapley边际贡献理论量化记忆单元价值,实现高价值内容选择性留存;配套交互式可视化分析面板,完整覆盖记忆评估、价值感知存储、记忆增强生成全链路流程。
本文以学习助手智能体为演示场景,用户可可视化查看记忆价值分层结构,对比「全量存储、摘要压缩、价值感知存储」三种方案在回答质量、检索延迟、Token消耗维度的差异。MemLens可作为高效、可解释、支持个性化的长记忆底层框架。

图1:(a) 传统无差异化记忆管理;(b) MemLens价值感知记忆管理
左图传统方案:所有对话、思维链、工具记录全部存入未过滤记忆库;
右图MemLens:拆分细粒度记忆单元,量化价值后筛选高价值内容入库,配套数据分析模块辅助决策。
1 引言
研究背景
长记忆是大模型智能体执行跨会话长时序任务、生成个性化回答、复用历史知识的关键支撑。智能体记忆数据天然异构,除对话文本外,还包含推理思维链、工具调用轨迹、检索文档片段。随着交互会话持续累积,记忆库体量持续膨胀。
现有方案缺陷
现有主流记忆系统(Mem0、VikingMem等)采用两类粗粒度策略:
两类方案均未量化单条记忆对后续任务的实际增益,低价值冗余内容持续占用上下文窗口,稀释相关证据、扩大检索空间、显著增加生成阶段Token消耗。
核心痛点:记忆价值并非固定静态,同一段内容对不同查询贡献差异极大;且记忆单元之间存在组合增益,单一片段效用依赖配套记忆集合。通用摘要策略无法精准区分内容重要性。
本文核心贡献

图2 MemLens系统整体架构
输入原始交互记录 → 记忆评估模块(拆分分层+Shapley价值打分)→ 价值筛选入库 → 分层记忆存储(向量库+用户画像)→ 查询检索注入LLM生成,全程反馈迭代闭环。
2 MemLens系统总览
MemLens彻底重构智能体长记忆存储逻辑,分为三大核心子模块,形成闭环生命周期:
系统核心特性
- 每条记忆绑定量化效用分数,全局展示价值分布、留存占比;
- 可视化分层记忆树,展示语义聚类与长期用户偏好演化;
- 一键对比全量存储、摘要压缩、价值感知三种方案的精度、延迟、Token开销。
完整工作流
3 MemLens系统详细设计
3.1 记忆数据评估模块
核心目标:结构化原始交互,并量化每条记忆单元的下游推理效用,分为记忆单元构建、记忆价值计算两步。
3.1.1 分层记忆单元构建
3.1.2 基于Shapley的记忆价值计算
定义记忆Shapley值(MS-value),量化单条记忆在任意记忆子集下对查询推理的边际增益。
效用基础公式
给定查询qqq,记忆子集SSS,代理轻模型Mp\\mathcal{M}_pMp:
Vq(S)=Score(Mp(q⊕S))−Score(Mp(q))\\mathcal{V}_{q}(S)=\\textbf{Score}\\big(\\mathcal{M}_{p}(q\\oplus S)\\big)-\\textbf{Score}\\big(\\mathcal{M}_{p}(q)\\big)Vq(S)=Score(Mp(q⊕S))−Score(Mp(q))
⊕\\oplus⊕代表记忆注入操作,Score由LLM裁判模型输出回答质量分,衡量子集SSS给查询带来的提升。
记忆Shapley值定义
ϕ(mi)=∑S⊆M∖{mi}∣S∣!(M−∣S∣−1)!M![Vq(S∪{mi})−Vq(S)]\\phi(m_{i})=\\sum_{S\\subseteq\\textsf{M}\\setminus\\{m_{i}\\}}\\frac{|S|!(M-|S|-1)!}{M!}\\left[\\mathcal{V}_{q}(S\\cup\\{m_{i}\\})-\\mathcal{V}_{q}(S)\\right]ϕ(mi)=S⊆M∖{mi}∑M!∣S∣!(M−∣S∣−1)![Vq(S∪{mi})−Vq(S)]
MMM为全部记忆单元总数;该值满足无贡献零收益、对称公平、线性可加三大公理。
高效近似计算
完整排列组合复杂度极高,采用分层抽样近似算法,将复杂度降至O(ρM)O(\\rho M)O(ρM)(ρ\\rhoρ为抽样轮次,常规取20~100),保证交互式面板低延迟。
模型配置
代理轻模型默认使用Qwen2.5-7B,面板支持自由切换各类轻量LLM用于价值打分。
3.2 价值感知记忆存储模块
基于MS-value完成记忆筛选、分层组织、增量合并,平衡存储成本与推理效果。
(1)阈值筛选存储
设定价值阈值τ\\tauτ,仅保留满足条件的记忆单元:
M∗={mi∈M∣ϕ(mi)≥τ}\\textsf{M}^{\\ast}=\\{m_{i}\\in\\textsf{M}\\mid\\phi(m_{i})\\geq\\tau\\}M∗={mi∈M∣ϕ(mi)≥τ}
面板支持实时滑动调整τ\\tauτ,即时展示记忆压缩率、平均效用变化。
(2)分层记忆树组织
原子片段经LLM语义聚类形成树形存储结构:
- 叶子节点:原始句子原子记忆;
- 中间/根节点:多层语义摘要;
新增记忆自动执行三类合并逻辑:
面板支持点击树形节点查看完整原文与价值分数。
(3)交互式数据分析能力
3.3 记忆增强回复模块
利用筛选后的高价值记忆生成个性化回答,并支持会话归档闭环。
4 演示场景:数据库学习助手智能体
4.1 仿真评测数据集 EduMemBench
构建数据库专业学习模拟数据集:
- 2000+轮多会话学生交互对话,主题覆盖事务、索引、并发控制;
- 衍生500组标准问答测试集,用于横向对比不同记忆策略指标。
4.2 交互式面板三大功能分区

图3 记忆评估交互面板
1 模型配置区:切换大模型、轻量代理打分模型;
2 会话列表:每条对话标记记忆单元、价值分层;
3 阈值滑动控制器:动态调整留存标准;
4 价值分布直方图:直观区分高低价值片段。

图4 价值感知存储界面
1 交互式分层记忆树,节点颜色代表价值高低;
2 用户偏好画像展示;
3 全局统计:记忆条数、压缩率;
4 关键词词云,快速定位高频学习概念。

图5 记忆辅助问答界面
1 向量库后端切换(FAISS/Milvus);
2 用户偏好预览;
3 对话交互区,归档按钮;
4 雷达图对比三类策略:回答精度、检索延迟、Token消耗。
4.3 横向对比实验结论
在EduMemBench数据集上:
1 全量存储:Token开销巨大,检索延迟高,大量无关内容干扰回答;
2 全局摘要:丢失细分知识点,专业问题精度下降;
3 MemLens价值感知方案:同等Token消耗下回答质量显著提升,检索耗时降低,可自由通过阈值平衡压缩率与效果;
4 框架兼容LoCoMo、LongMemEval等通用长记忆评测基准。
网硕互联帮助中心





评论前必须登录!
注册