云计算百科
云计算领域专业知识百科平台

深度拆解 AI Agent 底层架构:规划模块、长期记忆、工具执行链路

深度拆解 AI Agent 底层架构:规划模块、长期记忆、工具执行链路

标签:#AI Agent #大模型 #FunctionCalling #智能体 #LLM应用

摘要:如果说大模型是"大脑",那 AI Agent 就是把这个大脑装进了"身体"——它能听懂目标、自己拆任务、记住过去、调用外部工具,一步一步把复杂事情干完。本文从工程视角深度拆解 AI Agent 的三大底层支柱:规划模块(Planning)、长期记忆(Long-term Memory)、工具执行链路(Tool / Function Calling),讲清它们各自怎么工作、怎么协同,并附上一图读懂的可视化拆解。

AI Agent 底层架构封面


目录

  • 一、从"聊天机器人"到"AI Agent",到底差在哪?
  • 二、先看全景:AI Agent 的底层架构长什么样
  • 三、规划模块:让大模型学会"先想清楚再动手"
  • 四、长期记忆:让 Agent 不再"鱼的记忆"
  • 五、工具执行链路:Agent 的"手和脚"
  • 六、三者如何协同:一次真实任务的完整闭环
  • 七、主流实现框架速览
  • 八、总结

一、从"聊天机器人"到"AI Agent",到底差在哪?

过去我们用大模型,本质是"你问一句、我答一句":模型生成一段文字就结束了。这离真正的"帮我把事办了"还差很远。

一个能干活的 AI Agent(智能体),通常具备三个标志性能力:

  • 会规划:面对"帮我策划一场线下发布会"这种模糊大目标,它能自己拆成"定主题 → 查场地 → 排预算 → 写方案"一系列子任务,而不是直接瞎答。
  • 有记忆:它记得你上次说过的偏好、之前踩过的坑,不用你每次重复交代背景。
  • 能动手:它不只会动嘴,还能真的去"搜网页、查数据库、跑代码、调 API、发邮件",拿到真实结果再继续。
  • 用一句话概括:大模型负责"想",Agent 负责"想 + 拆 + 记 + 做"的闭环。 这三件事背后,就是底层三大模块——规划、记忆、工具执行。

    二、先看全景:AI Agent 的底层架构长什么样

    抛开各家框架的花哨包装,一个 AI Agent 的内核非常稳定,可以看作"一个大脑 + 四个外围":

    • 大脑(核心大模型):负责理解意图、做决策、生成语言,是整个 Agent 的调度中心。
    • 规划模块:把模糊目标拆成可执行步骤,并在过程中不断修正。
    • 长期记忆:存放历史经验、用户偏好、中间结果,像一个可检索的"外置知识库"。
    • 工具执行:让模型能调用外部函数、API、搜索、代码解释器等,突破纯文本的边界。
    • 感知与输出:接收用户指令,把最终结果组织成人类可读的回答。

    AI Agent 总体架构

    理解了这张图,后面三个模块的拆解就有了定位:规划管"怎么拆",记忆管"记得住什么",工具管"怎么真的做出来"。

    三、规划模块:让大模型学会"先想清楚再动手"

    大模型默认是"一次性直出",而规划模块的本质,是把一个大问题变成一串小步骤,并在每一步之间做决策。它主要靠三件武器。

    3.1 任务分解:把大象切成一口一口

    面对复杂目标,Agent 会先做"任务拆解"。常见思路:

    • Chain-of-Thought(思维链):让模型"一步一步想",把推理过程写出来,每一步的输出成为下一步的输入。
    • Tree of Thoughts(思维树):不止一条思路,而是同时生成多条候选路径,再择优。适合需要试错、探索的场景。
    • 子任务委派:把大任务拆成子任务,甚至交给不同的"子智能体"分别处理,最后汇总。

    3.2 ReAct:边想边做,边做边看

    光想不做会跑偏,光做不想会乱来。ReAct(Reasoning + Acting) 把两者拧成一个循环:

    • 思考(Thought):现在是什么情况?下一步该干什么?
    • 行动(Action):去调用一个工具 / 执行一个动作。
    • 观察(Observation):拿回执行结果,更新对局势的判断,再进入下一轮思考。

    这正是 Agent 区别于"一次性问答"的关键——它是一个推理与行动交替的循环。

    3.3 自我反思:做错了会自己回头

    更进一步的 Agent 还会做 Reflexion(反思):当结果不达预期时,它会回头复盘"刚才哪一步错了、为什么错、下次怎么改",并把这条经验写进记忆,避免重复踩坑。

    规划模块:把大任务拆小

    四、长期记忆:让 Agent 不再"鱼的记忆"

    大模型本身只有"上下文窗口"这么大的短期记忆,关掉对话就忘。Agent 要变得"越用越懂你",必须有一套记忆体系。

    4.1 两种记忆,分工不同

    记忆类型类比存什么存在哪
    短期记忆(工作记忆) 你桌面上摊开的便签 当前任务的中间结果、最近几轮对话 大模型上下文窗口内
    长期记忆 你归档的文件柜 历史经验、用户偏好、成功/失败案例 外部数据库 / 向量库

    短期记忆受上下文长度限制,用完即弃;长期记忆是外挂的,可以按需"检索"回来,需要时再塞进上下文。

    4.2 记忆是怎么"写进去"和"找回来"的

    一套完整的记忆链路通常包含四个动作:

  • 写入(Write):任务过程中的关键结论、用户偏好、失败教训被判定"值得记下来"后存入记忆库。
  • 打分(Importance):不是所有事都值得记。给每条记忆一个"重要性分数",避免记忆库被噪音塞满。
  • 检索(Retrieve):面对新任务时,按"语义相似 + 时间近 + 重要性高"综合召回最相关的几条记忆。
  • 遗忘(Forget / 压缩):对过时、低价值的记忆做淘汰或摘要压缩,防止无限膨胀。
  • 可以理解为:Agent 的长期记忆,本质上就是给 RAG 那套"向量检索 + 注入上下文"换了个用途——只不过检索的对象从"公司文档"变成了"Agent 自己的经历"。

    长期记忆:Agent 的经验库

    五、工具执行链路:Agent 的"手和脚"

    没有工具,Agent 再聪明也只能"纸上谈兵"——它不能联网、不能算数、不能跑代码。工具执行链路就是让大模型把"想说的动作"翻译成"真实的函数调用"。

    5.1 先注册工具:告诉 Agent"你会用什么"

    要让模型调用工具,先得把工具"教"给它。每个工具通常用一段结构化描述说明:

    • 工具叫什么名字(如 search_web、calculate、run_code);
    • 它是干什么的(一句话用途);
    • 需要哪些参数、每个参数是什么类型、什么含义。

    模型在生成时会"看到"这份工具清单,从而知道自己在什么情况下该用哪个工具。

    5.2 Function Calling:从"说"到"做"的一次转身

    一次工具调用的标准链路是这样跑的:

  • 大脑决策:模型判断"光靠自己答不了,需要查一下实时数据";
  • 生成调用:模型不直接回答,而是输出一个结构化的函数调用,比如 search_web(query="今日金价");
  • 真实执行:外部运行时真正去调用这个函数,拿到结果;
  • 结果回灌:把执行结果作为"观察"再喂回给大模型;
  • 继续决策:模型基于新结果,决定是继续调下一个工具,还是该给用户最终答案了。
  • 5.3 多步链路与健壮性

    真实的 Agent 往往要连续调用好几个工具:先搜索 → 再筛选 → 再算一遍 → 最后生成。健壮的执行链路还要处理:

    • 参数错误 / 工具报错:把错误信息回喂给模型,让它自己修正参数重试;
    • 超时与熔断:避免一个坏工具把整个任务拖死;
    • 幂等与权限:写操作类工具(发邮件、下单)要加确认,避免模型"误触"。

    工具执行链路:Function Calling

    六、三者如何协同:一次真实任务的完整闭环

    把规划、记忆、工具三件事拼到一起,一个 Agent 跑通一个真实任务的完整闭环是这样的:

  • 接收用户提问:理解目标和约束;
  • 规划任务步骤:把目标拆成有序的子任务;
  • 检索长期记忆:先翻出相关的历史经验和用户偏好;
  • 调用外部工具:按计划去搜索、查数据、跑代码;
  • 观察执行结果:拿回真实结果,发现哪里不够;
  • 生成最终回答:整理成有依据、有出处的答案,并把这次经历写回记忆库。
  • 注意最后一步:任务结束不是终点,而是下一次任务的"记忆起点"——这正是 Agent 能持续进化的原因。当结果不理想时,还会从第 6 步回流到第 3 步,重新规划再来一轮。

    Agent 完整闭环

    七、主流实现框架速览

    理解了底层原理,再看各家框架就不会眼花缭乱——它们都是在把上面这套模块封装得更好用:

    框架定位特点
    LangChain / LangGraph 通用 Agent 编排 组件丰富、生态全;LangGraph 把"循环 + 状态"显式画出来,适合复杂可控流程
    AutoGen 多智能体协作 擅长多个 Agent 之间对话、分工、互相校验
    CrewAI 角色化团队 用"角色 + 任务 + 团队"的抽象,快速搭一个虚拟协作小组
    OpenAI / 各家 Function Calling 原生能力 模型侧工具调用 把"工具描述 + 结构化输出"标准化,是所有框架的底层基石

    选型建议:先把 Function Calling + 一个向量记忆库 + 简单的 ReAct 循环跑通,再上框架——否则很容易被框架的抽象绕晕,却讲不清 Agent 到底在干嘛。

    八、总结

    AI Agent 的底层架构并不神秘,剥开花哨的包装后就是三件事:

    • 规划模块解决"怎么做"——把大目标拆成步骤,边想边做、做错会反思;
    • 长期记忆解决"记得住"——用外挂的记忆库让 Agent 有经验、有偏好、越用越聪明;
    • 工具执行链路解决"真做得出"——通过 Function Calling 把模型从"动嘴"变成"动手"。

    三者围绕大模型这个"大脑"形成闭环:规划决定路径,记忆提供经验,工具拿到真实结果,再回流给下一步规划。掌握了这条主线,无论是自己手写一个 Agent,还是看懂 LangGraph、AutoGen 这些框架,都会轻松很多。

    赞(0)
    未经允许不得转载:网硕互联帮助中心 » 深度拆解 AI Agent 底层架构:规划模块、长期记忆、工具执行链路
    分享到: 更多 (0)

    评论 抢沙发

    评论前必须登录!