云计算百科
云计算领域专业知识百科平台

Minos:一种基于溯源反向追踪的多智能体协作框架

大家读完觉得有帮助记得关注和点赞!!!

摘要

复杂的网络攻击,尤其是高级持续性威胁(APT),对关键基础设施构成日益严峻的挑战,使得入侵后的取证分析成为刚需。基于溯源的反向追踪通过从初始告警出发追溯因果关系,是重建攻击场景的核心能力。然而,现有方法往往依赖底层统计特征和僵化的遍历策略,既无法捕捉高层级对抗意图(尤其面对隐蔽的"就地取材"LotL 技术时),又不可避免地陷入"依赖爆炸"困境。

为解决上述挑战,我们提出 Minos——一种将反向追踪重构为大语言模型(LLM)驱动推理过程的多智能体协作框架。Minos 采用两层架构:在单事件评估层面,引入结构化框架以克服 LLM 的固有局限——采用分层上下文模型维持持久状态、实现带引文验证的检索增强推理以锚定推断、引入对抗式审议机制以缓解谄媚偏差;在端到端图探索层面,Minos 在有限状态机(FSM)下编排四个专用智能体,以假设引导推理和"先计数"查询协议取代穷举拓扑遍历,从而剪枝搜索空间。

在 5 个公开数据集、14 个攻击场景上的综合评估表明,Minos 平均召回率 0.92、精确率 0.64,显著优于 SOTA 基线,且生成的攻击子图紧凑度提升 49%。此外,Minos 在每一步均生成可解释的推理链,为审计和系统迭代提供强力支撑。最终,我们的探索验证了利用 LLM 实现自动化基于溯源反向追踪的有效性。


1. 引言

复杂的网络攻击,尤其是高级持续性威胁(APT),对关键基础设施构成日益严峻的威胁。由于攻击者常能规避初始防御并在被攻陷网络内建立长期驻留,在异常检测后重建完整攻击场景的能力成为一项关键的取证能力。为支撑此类入侵后分析,溯源图[18] 已成为重要工具:它将内核级审计日志解析为统一图表示(节点为系统实体,边为因果交互),将离散、碎片化的日志记录转化为具备内在因果性的时序图,从而支持系统化调查。此类调查的核心目标是反向追踪:从入侵检测系统(IDS)标记的"关注点事件"(POI)出发,沿溯源图向后追溯,重建对抗操作并定位攻击入口[16]。

已有研究通过多种策略推进反向追踪,包括可达性分析[14,9]、统计异常检测[13]和语义聚类[32]。尽管有所贡献,现有方法仍面临两大关键挑战:

第一,语义歧义(C1)。现有方法常依赖频率、节点度或结构连通性等底层特征评估单事件,根本上缺乏捕捉系统操作背后高层对抗意图的能力。这一缺口在"就地取材"(LotL)[1] 技术面前尤为突出——攻击者利用合法系统工具执行恶意动作,产生的统计与拓扑足迹与良性管理活动难以区分。

第二,依赖爆炸(C2)。单台主机每日可产生 TB 级日志,而攻击相关事件占比不足 0.001‰。缺乏智能剪枝或启发式策略时,现有方法在高阶超级节点(如系统进程)处不可避免遭遇"依赖爆炸",导致性能退化与计算开销过大。

大语言模型(LLM)[2] 的兴起为应对这些挑战提供了新思路:针对 C1,LLM 可超越底层特征,对潜藏的恶意意图进行推理,实现更细腻、高保真的判断;针对 C2,基于 LLM 的智能体可模拟人类调查团队的分工特性,以推理驱动、假设引导的探索取代盲目遍历。

基于上述洞察,我们提出 Minos——将反向追踪构建为多智能体协作推理过程的框架。Minos 通过分解的两层架构应对两大核心挑战:

  • 单事件评估层:引入结构化推理框架,专门克服通用 LLM 的三项固有局限——为应对长程追踪中的上下文窗口约束,分层上下文模型采用双粒度设计维护浓缩而丰富的全局追踪状态;为消除知识截断与幻觉,带自动引文验证的检索增强模块增强推理能力并将每项推断锚定到可追溯源头;为缓解谄媚偏差导致的误报,对抗式审议机制(控方–辩方–法官)在通过公正仲裁得出客观事件评估前,系统性地从恶意与良性双视角提取支撑证据。

  • 端到端图探索层:Minos 将复杂调查任务拆分为 FSM 编排下的四个专用智能体角色——Planner(规划者)​ 作为假设驱动的指挥官,以高层语义推理(而非僵化拓扑遍历)引导反向追踪;Query(查询者)​ 作为数据接口,采用"先计数"协议安全检索系统事件,避免高阶节点处的依赖爆炸;对抗评估组​ 利用前述对抗审议聚焦单事件评估;Memory(记忆者)​ 集中维护追踪状态,动态更新演进上下文以确保整个追踪生命周期的逻辑连贯。

我们在跨 3 个操作系统、5 个公开数据集的 14 个攻击场景上评估 Minos。Minos 平均召回率 0.92、精确率 0.64,较基线显著提升,且攻击子图紧凑度提升 49%。多智能体架构相较单智能体基线亦展现出决定性优势。消融实验验证了各设计组件的有效性。跨模型实验进一步揭示:针对不同智能体角色的特定认知需求定制底层 LLM 骨干,可优化追踪性能。

主要贡献:

  • 设计了一套基于 LLM 的单事件评估推理框架,通过分层上下文模型、检索增强推理与对抗审议,解决 LLM 的三项固有局限。

  • 构建了由 FSM 编排的四个专用智能体组成的多智能体协作系统,在海量溯源图上实现高效、可解释的反向追踪。

  • 在 5 个公开数据集、14 个攻击场景上开展综合实验,证明 Minos 在重建保真度与子图紧凑度上均较 SOTA 方法显著提升。


2. 背景与问题建模

2.1 溯源图

网络安全中,持续系统审计是监控和防御计算基础设施的基础能力。现代操作系统通过内核级审计框架[33]记录细粒度系统调用(如 read、write),并将其建模为溯源图——有向无环图 G=(V,E),节点 V代表系统实体(进程、文件等),边 E表示因果依赖(进程派生、文件访问等),如图 1 所示。溯源图将孤立系统调用统一为因果拓扑,把原始审计日志转化为结构化行为历史,弥合了离散审计数据与综合安全分析间的鸿沟[18]。

2.2 反向追踪

基于溯源的 IDS 通过特定检测算法识别可疑行为并生成告警(即 POI)。为揭示恶意活动全序列,分析师执行反向追踪:从 POI 事件 epoi​出发,沿溯源图向后遍历其因果依赖,重建 POI 前的完整攻击场景并定位根源[16]。

形式化地,给定溯源图 G=(V,E)与 POI 事件 epoi​,反向追踪旨在恢复攻击子图 G∗⊆G:

Rattack​为二值谓词,指示 e是否为 epoi​的因果祖先且与底层攻击活动相关。优化目标是使 ∣G∗∣最小化以保证紧凑性,同时对 Rattack​保持完备性。

由于攻击全貌常渐进显现,反向追踪可建模为迭代发现过程。每步 t,探索策略 π基于当前状态识别候选事件集:

随后决策函数 f评估各候选 e∈Et​的相关性:

其中 It​为支持评估 e的可收集信息。追踪过程递推如下:

图 1:溯源图中的语义歧义。目标事件(PowerShell 创建计划任务)在两种场景下结构和统计上完全一致。

2.3 核心挑战

由式 (1)–(4),恢复子图 G∗的保真度取决于探索策略 π与决策函数 f的协同。实践中两者均面临瓶颈:

  • C1(语义歧义):如图 1,溯源图中事件孤立观察时常呈中性。例如 PowerShell 创建计划任务既可代表常规管理操作,也可代表恶意持久化机制。现有方法通常通过底层特征(元数据、频率、节点度[13,9])构造 It​评估事件,但面对 LotL[1] 日益失效——攻击者劫持原生 OS 二进制文件掩盖行为,生成的因果模式无显性结构异常。

  • C2(依赖爆炸):溯源数据规模巨大[13],单主机日产 TB 级记录,真实对抗事件占比一般低于 0.001‰。基于连通性的遍历(BFS/DFS)常在高阶系统进程节点(svchost.exe、bash 等)处遇阻,这些节点与成千实体交互,展开后候选集 Et​指数增长,引发过量计算开销与无关背景事件累积。

LLM 的快速进展[28,2] 为应对挑战提供关键启示:针对 C1,LLM 在海量语料上预训练,具备对 OS 原语、命令行惯用法、对抗技术的语义先验,可超越底层特征推理系统事件背后的潜藏恶意意图[4,11,25];针对 C2,基于 LLM 的智能体可通过工具使用[31,30] 规划、分解与协调子任务,使探索策略模仿人类 SOC 分析师的迭代工作流,以推理驱动、按需查询取代穷举拓扑遍历。基于这两点,我们设计了 Minos 系统。


3. 单事件评估

如第 2 节所述,解决单事件的语义歧义(C1)需超越底层统计特征、进入意图级推理。但直接套用通用 LLM 构造决策函数 f会遇到三项固有局限:第一,LLM 调用无状态,无法累积反向追踪中演进的上下文(而历史状态对意图推理至关重要);第二,受知识截断与领域知识缺口影响,LLM 难跟上对抗技术快速演进,导致幻觉[15];第三,LLM 表现出谄媚偏差[29]——倾向于过度迎合提示中的隐式假设,在安全调查中表现为系统性误报升级。为克服这些局限,我们将单事件评估构建为由三项对应机制驱动的结构化框架,完整工作流见图 2。

图 2:事件评估的结构化框架

3.1 分层上下文表示

针对 LLM 调用的无状态性,需可持续的追踪状态维护机制。考虑到 APT 活动周期长、数据量大,将原始历史事件线性拼接到提示中迅速会突破上下文窗口[19]。为此我们提出分层上下文模型,将已确认恶意事件动态抽象为两个互补维度:细粒度语义叙事与粗粒度战术序列。

  • 细粒度上下文:作为已确认攻击相关事件的演进叙事摘要,保留关键取证工件(异常命令行、文件路径等),用于重建攻击场景并锚定局部因果推理。

  • 粗粒度上下文:将已知恶意事件映射到 MITRE ATT&CK 框架[26],形成顺序战术链(如 [初始访问 → 执行 → 持久化])。通过监控攻击生命周期的逻辑完备性,该序列使系统能识别活动边界,作为局部推理的全局约束。选用 MITRE ATT&CK 是因为近期研究表明 LLM 具备将该系统事件与其标准化分类法对齐的强固有能力。

两层均随新恶意事件出现动态更新。细粒度上下文采用 LLM 驱动的增量摘要,模拟记忆衰减策略[23]——保留即时细节同时压缩久远历史。粗粒度序列通过提示工程机制(基于前人工作建立)促使 LLM 推断合适的 MITRE 映射来更新。两机制的提示模板详见附录 0.B。

3.2 带引文验证的检索增强推理

分层上下文虽捕获了演进状态,但准确解读事件意图还需缓解领域知识缺口与幻觉。我们引入基于多源知识库的检索增强生成(RAG)[17] 模块,聚合:

  • 网络威胁情报(CTI)报告——提供最新对抗技术洞察,规避知识截断;

  • MITRE ATT&CK TTP 矩阵[26]——提供技术描述与执行样例,辅助意图推断;

  • 系统日志模式——标准化异构审计字段。

  • 鉴于网络安全分析同时涉及高层攻击语义与精确技术 IoC(IP、文件哈希等),我们采用混合检索策略——均衡融合稠密向量相似度与稀疏 BM25 分数,取 Top-3 最相关片段。

    此外,为确保意图分析高度可追溯,我们强制执行严格引文协议:LLM 必须显式标注输出的事实来源——[CTI]为检索到的威胁报告,[MITRE]为战术引用,[KNOWN]为模型内在知识。确定性算法通过对照检索源列表校验 [CTI]、通过正则校验 [MITRE]标识符来验证这些引文。未匹配主张被标记为 [SUSPECT],生成量化可信度摘要,将评估锚定到有据可查的证据。

    3.3 意图验证的对抗式推理

    即便利用富集上下文与检索知识,单 LLM 做意图评估仍频繁表现谄媚偏差[29],将良性事件误判为恶意,导致过多误报。为此我们提出含三个专用智能体的对抗式推理框架[8]:控方、辩方、法官。

    • 初始阶段:控方与辩方智能体在相反假设(分别为恶意意图/良性意图)下独立分析目标事件,从分层上下文、检索知识与内在知识中穷举提取支撑证据,每项主张均提供形式化引文。验证算法随后解析这些引文生成可信度摘要,标记未验证主张。

    • 裁决阶段:法官智能体接收对立论点及各自可信度摘要,依次评估因果依赖、证据锚定与行为一致性,给出由透明推理支撑的最终裁决。此对抗架构强制对良性替代解释做全面评估,从而显著缓解谄媚偏差。三智能体提示模板详见附录 0.B。


    4. 多智能体协作反向追踪

    第 3 节机制为单事件评估奠定基础,但构建端到端反向追踪系统还需有效实现第 2 节定义的探索策略 π——系统必须在溯源图海量复杂拓扑中战略性导航,重建攻击场景而不陷入依赖爆炸。

    Minos 不依赖盲目遍历,而采用动态探索策略——基于当前状态显式决定后续调查路径,通过模拟人类安全运营中心(SOC)职能分工的多智能体协作框架实现。系统架构见图 3。

    图 3:多智能体协作架构概览

    4.1 角色专业化与智能体设计

    借鉴人类专业化分工,Minos 将反向追踪过程中离散的任务单元拆分到不同责任主体,提出四个专用智能体,角色见表 1。

    表 1:Minos 中专用智能体角色及对应职责

    智能体角色

    核心职责

    Planner(规划者)​

    决定下一步追踪候选

    Query(查询者)​

    翻译指令并查询数据

    Adversarial Group(对抗组)​

    评估候选事件意图

    Memory(记忆者)​

    维护分层上下文

    • Planner 智能体​ 是统治探索策略 π的决策核心,接收所有当前调查状态(POI 事件、分层上下文、动作历史)作为输入,输出下一步的显式指令。由于 Minos 迭代查询图数据库获取候选供评估,Planner 输出被形式化为结构化查询指令(如"查询连接到特定 IP 的进程")。人类分析师不会盲目扫描日志,而是基于攻击进度理解主动寻找证据——Planner 同理采用假设驱动推理策略而非 BFS 式拓扑遍历。Planner 利用当前上下文显式提出攻击者下一步的假设,采用渐进三层策略:(1) 以 POI 为中心的初始向后扩展,建立局部足迹;(2) 面向低度前沿节点的"边优先"探索,高效拓宽子图;(3) 持续约束——将假设锚定到战术生命周期(如确认数据渗出后,Planner 假设此前存在凭据访问活动)。此设计确保搜索空间被攻击逻辑语义约束,而非仅依赖拓扑连通性。

    • Query 智能体:认识到战略规划与查询语言(如 Cypher)生成是认知上不同的操作,Minos 将两者解耦。专用 Query 智能体接收 Planner 的自然语言指令并翻译为可执行查询代码。此分离使规划框架与数据库基础设施绝缘——仅需重配 Query 智能体即可无缝迁移到不同存储引擎。此外,架构解耦允许部署专门针对代码生成优化的 LLM 来驱动 Query 智能体,提升查询翻译保真度。Query 智能体内置两个关键自反馈机制:

      • "先计数"协议:应对数据爆炸。溯源图中高阶节点可能连接上万事件,朴素查询会返回海量候选,在无关背景噪声上产生显著计算开销。因此在取数前,Query 智能体先执行计数探测以量化候选量 n;若 n超过预设阈值 θmax​,触发背压反馈信号,迫使 Planner 生成更严格的查询指令(如收紧时间窗)。此自优化严格保障查询阶段的安全与效率。潜在风险:Planner 收窄候选集时,高阶邻域内的攻击相关事件可能被过滤;但由于细化由当前调查上下文引导而非盲降采样,实践中此类遗漏不太可能发生,使该协议成为有利的"效率–覆盖"权衡。

      • 句法自校正:针对 LLM 代码生成的不稳定性,Minos 将数据库执行错误回路由至 Query 智能体触发迭代修复;在指定重试次数内仍执行失败的查询被旁路,避免死循环。

    • Memory 智能体:主要负责第 3 节引入的分层上下文的维护与同步更新,作为追踪过程的基础状态。

    • 对抗评估组:由控方、辩方、法官智能体组成,执行意图推理机制,作为所有事件评估的事实仲裁者。

    这些专用智能体的编排体现了任务导向分工原则。通过假设驱动探索与意图感知评估的融合,该框架在系统性缓解溯源图依赖爆炸(挑战 C2)的同时,有效解决单事件语义歧义(挑战 C1)。

    4.2 自动化反向追踪编排

    各专用智能体通过 FSM 控制循环协作以自主执行反向追踪。每轮迭代中:Planner 提出假设 → Query 智能体在"先计数"协议下取回候选事件 → 对抗组裁决这些事件的意图。关键的是,一旦某事件被确认为攻击相关,即触发 Memory 智能体执行上下文更新,同步重新校准细粒度叙事与粗粒度战术序列,为下一轮规划提供依据。

    此迭代循环受多维终止条件严格管控,以平衡调查完备性与运行安全。满足以下任一条件即终止:

  • 逻辑完备:Planner 通过粗粒度上下文自主推断战术链已收敛至根入侵向量(如 [初始访问] 阶段),继续向后遍历冗余;

  • 探索充分:攻击相关子图大小在连续 Nstag​轮内停滞,表明有效因果路径已穷尽;

  • 系统安全:达到迭代总数上限 Nmax​,有效防止死循环。

  • 4.3 状态持久化与可解释性

    自动化安全系统的基础要求是决策透明。Minos 通过在每轮 FSM 迭代时将综合调查状态持久化序列化为结构化审计日志来实现这一点。这些持久记录封装了完整推理谱系:Planner 的战略假设、检索到的 CTI/MITRE 片段、每条意图推断背后的多智能体辩论笔录。

    此持久化机制超越了典型反向追踪系统的黑箱性质,建立了可验证、可问责的数字证据链。安全专家可对攻击子图中每个节点的推理轨迹做高保真审计。此外,此可解释轨迹使分析师能精确定位调查失败、将系统性误判追溯到离散推理偏差,并利用这些洞察微调 Minos 的策略、提示设计与编排逻辑。


    5. 实验

    本节系统评估 Minos 作为基于溯源反向追踪多智能体协作框架的推理性能与效率。评估由三个研究问题引导:

    • RQ1:Minos 相较 SOTA 方法效果如何?

    • RQ2:不同 LLM 骨干对各专用智能体性能有何影响?

    • RQ3:各组件对 Minos 性能的贡献如何?

    5.1 实现

    实验设置:Minos 用 Python 3.10 + LangGraph 实现,Neo4j 作为图数据库后端。Query 智能体由 GPT-5.2-Codex[22] 驱动,其余智能体默认用 GPT-5.2[21] 作为核心推理引擎。Query 智能体推理温度设为 0 以保证确定性代码生成,其余智能体用提供商默认温度以保留推理多样性。文本嵌入通过 text-embedding-3-large(3072 维)生成。参数:α=0.7,top-K=3,θmax​=50,Nstag​=20,Nmax​=75。为模拟初始安全告警,选真值中按时间最后的恶意事件作为 POI。

    数据集与基线:在先进溯源数据集上评估:

  • DARPA Transparent Computing (TC)[5]:Cadets、Trace、Theia 场景,含真实 APT 场景与海量背景噪声;

  • Aurora[27]:自动化攻击仿真引擎生成,基于 LOLBAS 项目[20] 的就地取材二进制/脚本目录合成隐蔽攻击链;

  • OpTC[6]:企业级 APT 活动。

  • 共 14 个攻击场景(详细描述见附录表 5)。

    对比三个基线:

    • NoDoze[13]:基于频率的统计框架,按系统事件历史频率分配异常分,从普遍背景噪声中识别稀有可疑活动。

    • DepImpact[9]:基于学习的分析系统,提取浅层事件特征并用 LDA 模型给离散系统活动打分,通过从 POI 反向传播威胁分给分识别关键攻击路径。

    • 单智能体基线:将全套调查能力封装到独立 GPT-5.2 实例中,通过标准 ReAct[31] 提示循环运行,授予与 Minos 相同的数据库查询与知识检索工具集。作为对照消融,验证多智能体协作框架的架构优越性。

    评估指标:边级召回率(Rec.)、精确率(Prec.),以及最终输出子图大小 ∣G∣。效率方面测端到端反向追踪时间与 LLM 总 token 消耗。

    5.2 RQ1:整体有效性

    表 2:14 个评估场景上攻击子图重建效果(∣G∣栏括号内为Ground Truth)

    场景

    NoDoze Rec./Prec./|G|(GT)

    DepImpact Rec./Prec./|G|(GT)

    单智能体 Rec./Prec./|G|(GT)

    Minos Rec./Prec./|G|(GT)

    OpTC C1

    .69/.14/128(26)

    .69/.23/78(26)

    .38/.10/152(26)

    .92/.63/38(26)​

    OpTC C2

    .72/.16/225(50)

    .58/.22/132(50)

    .42/.11/148(50)

    .90/.60/75(50)​

    OpTC C3

    .66/.09/257(35)

    .63/.20/110(35)

    .40/.09/145(35)

    .89/.57/54(35)​

    Aurora C1

    .88/.18/83(17)

    .82/.30/46(17)

    .65/.25/68(17)

    1.00/.74/23(17)​

    Aurora C2

    .70/.12/134(23)

    .74/.20/85(23)

    .58/.20/75(23)

    .96/.69/32(23)​

    Aurora C3

    .74/.12/167(27)

    .70/.45/42(27)

    .56/.22/72(27)

    .93/.76/33(27)​

    Trace C1

    .73/.10/110(15)

    .60/.16/56(15)

    .15/.30/7(15)

    .87/.57/23(15)​

    Trace C2

    .78/.15/94(18)

    .67/.22/55(18)

    .22/.33/10(18)

    .89/.62/26(18)​

    Theia C1

    .77/.12/83(13)

    .62/.18/45(13)

    .31/.08/130(13)

    .92/.60/20(13)​

    Theia C2

    .80/.17/141(30)

    .70/.26/81(30)

    .38/.10/120(30)

    .93/.67/42(30)​

    Cadets C1

    .71/.24/50(17)

    .65/.20/55(17)

    .35/.07/195(17)

    1.00/.71/24(17)​

    Cadets C2

    .50/.05/80(8)

    .50/.13/31(8)

    .38/.06/200(8)

    .75/.50/12(8)​

    Cadets C3

    .61/.20/134(44)

    .73/.35/92(44)

    .42/.08/185(44)

    .95/.68/62(44)​

    Cadets C4

    .76/.14/114(21)

    .57/.29/42(21)

    .38/.09/180(21)

    .90/.63/30(21)​

    平均​

    .72/.14/129(24)

    .66/.24/68(24)

    .40/.15/120(24)

    .92/.64/35(24)​

    Minos 在召回率与精确率上均显著优于所有基线,且攻击子图紧凑得多。具体分析:

    • 在涉及海量背景系统活动的复杂场景(OpTC、Theia),现有系统严重受"依赖爆炸"困扰——NoDoze 与 DepImpact 精确率极低,因无法区分结构上可达的良性事件与真正对抗操作,保留了数百条无关边。Minos 则通过意图推理过滤语义无关事件,在噪声环境中保持一贯高精确率。

    • 在攻击模式更鲜明的 Aurora 上,所有系统召回率较高(攻击序列符合标准追踪假设),但基线因误判良性管理事件仍生成更大子图。Minos 产出最小、保真度最高的攻击子图——归因于 Aurora 攻击严格遵循 MITRE ATT&CK 战术顺序[26],使粗粒度上下文能高效终止不必要的探索路径。

    • Cadets C2 是个例外(召回率降至 0.75):分析发现是某项技术映射到多个 MITRE 战术阶段,导致系统在完全覆盖前过早终止向后追踪。

    • 单智能体基线进一步凸显了独立 LLM 反向追踪的局限——平均召回 0.40、精确率 0.15、子图 120 边。失效模式有二:(1) 大规模 Trace 数据集上单上下文窗口迅速饱和,导致过早终止;(2) Cadets/Theia 上缺乏对抗交叉验证,初始误判沿因果链传播,子图膨胀至 130–200 边、精确率低至 0.06–0.10。这验证了 Minos 架构设计:多智能体分离防止上下文溢出,对抗评估提升推理准确性。

    图 4:五个数据集上的开销。左 y 轴为端到端执行时间(秒),右 y 轴为 LLM 总 token 消耗(K)。X 轴缩写:N.=NoDoze, D.=DepImpact, S.=单智能体, M.=Minos

    图 4 报告追踪开销:NoDoze 与 DepImpact 作为非 LLM 统计方法,秒级完成;两 LLM 系统因迭代推理延迟显著更长。Minos 平均反向追踪时间 1290 秒,较单智能体基线略快,token 消耗显著更低——"先计数"协议避免了对高阶节点的浪费查询,对抗评估减少了错误分支上的探索。值得注意的是 Trace 数据集上 Minos 耗时(1758s)反而多于单智能体(558s),但这是因为单智能体因上下文溢出过早终止而非完成了彻底调查。虽然 LLM 方法较传统方法延迟高约两个数量级,但对于真实安全运营(人工分析通常需数小时至数天/起)仍可接受。

    5.3 RQ2:LLM 骨干选型影响

    表 3:跨场景平均的 LLM 骨干选型影响

    分组

    Query 智能体

    其他智能体

    Rec.

    Prec.

    |G|(GT)

    Tokens

    A组:变 Query(代码生成)​

    Qwen3-Coder-30B

    GPT-5.2

    .45

    .15

    95(24)

    305K

     

    Qwen3-Coder-480B

    GPT-5.2

    .76

    .36

    62(24)

    195K

     

    DeepSeek-R1

    GPT-5.2

    .87

    .53

    46(24)

    198K

    B组:变其他(意图推理)​

    GPT-5.2-Codex

    Qwen3.5-122B

    .76

    .33

    65(24)

    198K

     

    GPT-5.2-Codex

    Qwen-Max

    .91

    .62

    37(24)

    175K

     

    GPT-5.2-Codex

    DeepSeek-V3

    .85

    .48

    50(24)

    118K

     

    GPT-5.2-Codex

    DeepSeek-R1

    .88

    .55

    42(24)

    208K

     

    GPT-5.2-Codex

    GPT-5.2

    .92

    .64

    35(24)

    164K

    多智能体架构的关键优势是允许每智能体选用最契合任务特性的骨干。Query 做结构化代码生成,其余做语义意图推理——两者对 LLM 要求不同。

    • A 组(变 Query):较小 Qwen3-Coder-30B[3] 难以高成功率生成有效 Cypher,导致过多重试;扩到 480B 部分缓解但仍存在复杂条件下语义不精确;DeepSeek-R1[12] 缩小差距但思考模式略增 token 消耗;GPT-5.2-Codex​ 综合推理与代码优化,整体最均衡。结论:参数规模与代码专项优化均关键。

    • B 组(变其他):122B Qwen3.5[24] 推理深度不足,精确率仅 0.33;DeepSeek-V3[7] token 成本最低但无思考模式下精确率仅 0.48;推理增强模型(DeepSeek-R1、Qwen-Max)精确率升至 0.55/0.62;GPT-5.2​ 最终在所有效果指标上最优,证实深度思考能力是反向追踪的决定性因素。

    总体结论:Query 智能体最受益于代码生成优化骨干,其余智能体需要深度思考能力模型;两种情况中,足够参数规模都是可靠性能的必备前提。

    5.4 RQ3:消融研究

    表 4:跨场景平均的消融结果

    配置

    Rec.

    Prec.

    |G|(GT)

    Tokens

    Minos(完整)

    .92

    .64

    35(24)

    164K

    架构组件:

     

     

     

     

    无对抗推理

    .89

    .51

    52(24)

    128K

    无细粒度上下文

    .72

    .68

    28(24)

    135K

    无粗粒度上下文

    .94

    .28

    98(24)

    285K

    无"先计数"协议

    .85

    .48

    53(24)

    248K

    知识组件:

     

     

     

     

    无 CTI 报告

    .72

    .49

    49(24)

    168K

    无 MITRE ATT&CK

    .78

    .42

    48(24)

    158K

    无日志模式

    .90

    .58

    40(24)

    155K

    • 两层上下文呈现互补退化:去掉粗粒度上下文退化最严重——召回升至 0.94 但精确率骤降至 0.28、子图膨胀至 98 边(系统失去战术边界约束,漂入无界探索);去掉细粒度上下文则将每轮评估限制在局部拓扑,召回降至 0.72、子图 28 边(无演进叙事记忆支撑,无法遍历长程因果链)。精确率上升是预期权衡而非改进:失去长程叙事后,对抗组回退到更严格的局部证据,丢弃了模糊的中链事件,牺牲了相当比例的跨阶段真因果边。

    • 去掉对抗推理:精确率从 0.64 → 0.51(子图 35→52 边),验证其作为谄媚误报主要防线的角色。

    • 去掉"先计数"协议:token 开销显著上升(164K→248K),精确率降至 0.48——Query 从高阶节点取回海量候选,浪费资源并引入下游噪声。

    • 知识组件:去掉 MITRE ATT&CK 影响最大(它提供锚定粗粒度上下文更新的结构化战术参照);CTI 报告次之(为超出 LLM 内在知识的新型对抗技术提供补充情报);日志模式去除影响边际(LLM 能部分补偿常见审计格式)。


    6. 相关工作

    6.1 基于溯源的攻击调查

    大量研究探索基于溯源的反向追踪以揭示攻击上下文。早期工作通过可达性分析[14]重建因果足迹;后续工作通过依赖加权[9]或图压缩[10]缓解依赖爆炸;同时统计方法建模行为分布以检测频率异常[13],语义聚类将底层交互抽象为高层行为[32]。尽管有拓扑与统计洞察,此类方法仍受僵化特征制约,难以推断高层对抗意图。

    6.2 LLM 用于网络安全

    LLM 的认知能力推动了其在安全分析中的应用。初期范式将 LLM 作为辅助推理模块解读可疑事件[11],常结合 RAG 做事实锚定[4];为克服单模型设置中的上下文限制与幻觉,新兴研究探索自动化取证任务的多智能体系统[25]。但现有系统多构建为静态工作流,限制了 LLM 固有推理能力的发挥。


    7. 讨论与结论

    7.1 局限与未来工作

    尽管能力可期,Minos 仍有改进空间:

  • 数据隐私:针对敏感审计日志的隐私约束,未来将探索通过模型微调与知识蒸馏实现本地化部署,使较小开源模型能本地执行,消除数据外泄风险。

  • POI 质量依赖:为减少对 POI 事件质量的依赖,拟开发多 POI 联合追踪机制——并行探索与交叉验证,辅以可信度自评模块,在处理低置信度输入时动态调整策略。

  • 7.2 结论

    本文提出 Minos——将基于溯源的反向追踪重构为 LLM 驱动推理过程的多智能体框架。针对语义歧义与依赖爆炸,Minos 将微观评估(分层上下文+RAG+对抗审议)与宏观四维专用智能体编排(假设驱动探索)协同融合。14 场景评估表明 Minos 在重建保真度与子图紧凑度上均达 SOTA,为下一代自动化网络调查奠定基础。

     

    赞(0)
    未经允许不得转载:网硕互联帮助中心 » Minos:一种基于溯源反向追踪的多智能体协作框架
    分享到: 更多 (0)

    评论 抢沙发

    评论前必须登录!