云计算百科
云计算领域专业知识百科平台

DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search论文分享

今天分享的论文是《DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search》

原文链接:https://arxiv.org/abs/2510.12801

这是苹果的一篇论文,关于多模态网格搜索的。

多模态大型语言模型(Multimodal Large Language Models, MLLMs)在实际应用中,需要获取外部知识源,且必须能响应现实世界中动态变化的信息,才能解决用户的信息查询类和知识密集型问题。现有方法(如检索增强生成(Retrieval Augmented Generation, RAG)、搜索代理以及具备搜索功能的多模态大型语言模型)往往存在流程僵化、搜索调用过多以及搜索查询构建不合理等问题,导致效率低下且结果欠佳。为解决这些局限性,我们提出DeepMMSearch-R1——首个能够执行按需多轮网络搜索,并为图像和文本搜索工具动态生成查询的多模态大型语言模型。具体而言,DeepMMSearch-R1可基于输入图像的相关裁剪区域发起网络搜索(提升图像搜索效果),并能根据检索到的信息迭代优化文本搜索查询,从而实现自我反思与自我修正。我们的方法采用两阶段训练流程:先进行冷启动监督微调(Supervised Finetuning, SFT)阶段,随后采用GRPO算法(Shao等人,2024)进行在线强化学习(Reinforcement Learning, RL)优化。在训练方面,我们引入全新的多模态视觉问答数据集DeepMMSearchVQA,该数据集通过自动化流程构建,并融入了来自网络搜索工具的真实世界信息。此数据集包含多样化的多跳查询(需融合文本与视觉信息),可训练模型掌握“何时搜索、搜索什么、使用何种搜索工具以及如何基于检索信息进行推理”。我们在多个知识密集型基准测试集上开展了大量实验,以验证所提方法的优越性。最后,我们对实验结果进行分析,并提供对推动多模态网络搜索发展具有价值的见解。

多模态大型语言模型(MLLMs)(Hurst等人,2024;Team等人,2023;Li等人,2024a;Bai等人,2025;Chen等人,2024;You等人,2023;Wang等人,2024;Deitke等人,2024)将预训练视觉编码器与大型语言模型(Large Language Models, LLMs)相结合,在视觉感知、视觉定位和生成任务等领域取得了显著进展。这些能力使其成为各类日常智能辅助应用的核心组件。然而,尽管取得了这些突破,MLLMs在处理知识密集型和信息查询型视觉问答(Visual Question Answering, VQA)任务时仍存在困难(Chen等人,2023;Mensink等人,2023)——这类任务不仅要求准确识别视觉实体,还需要获取相关背景知识。开放世界视觉知识的广度使得许多查询处于“长尾分布”中,这必然要求模型获取其内部训练语料之外的信息。而构建规模越来越大的训练数据集并不现实,因为这需要耗费大量成本用于数据收集、清洗、整理和模型重训练。此外,由于网络信息持续更新,静态训练语料会迅速过时,导致MLLMs无法回答需要最新信息的问题。例如,2025年1月最后更新的Qwen2.5-VL(Bai等人,2025)无法回答以下问题:“<图像>这场划船比赛正在哪里举行?”[答案:该图像展示的是印度尼西亚廖内省一年一度的帕库贾鲁(Pacu Jalur)划船比赛]。相关图像见附录F.1。

为解决这些局限性,近期研究尝试将搜索工具与MLLMs集成,以实现对外部信息的动态获取。现有方法大致可分为三类:

1. 检索增强生成(RAG)方法(Ling等人,2025;Qi等人,2024;Liu等人,2024e):这类方法依赖外部知识库,但静态语料库无法覆盖开放世界知识的全部范围,因此该假设在实际应用中并不成立。此外,RAG方法“先检索后生成”的固定流程往往导致检索操作过多且存在不必要的检索。

2. 搜索代理(Li等人,2024c、b):这类方法通过提示LLMs/MLLMs执行多轮网络搜索,并将检索到的内容融入模型上下文以用于后续轮次。但搜索代理通常以即插即用模块的形式实现,并未针对“与真实世界中含噪声的网络搜索结果交互”进行优化。因此,它们往往无法基于检索内容有效推理,且在预训练阶段未见过的开放世界场景中泛化能力较差。

3. 具备搜索功能的多模态大型语言模型(Jin等人,2025;Song等人,2025;Chen等人,2025):这类模型经过训练,可与搜索工具协同工作,并基于检索内容进行推理。然而,大多数现有工作仅局限于文本搜索,极大地限制了其在多模态知识密集型问答任务中的适用性。Wu等人(2025)的研究首次将检索扩展到多模态领域,引入了图像搜索工具,但该方法仍存在显著局限性:首先,尽管模型可自主决定调用哪种工具,但限制为每种工具仅调用一次,无法实现自我反思与自我修正;其次,其提出的图像搜索工具仅能基于完整输入图像检索信息,缺乏针对具体问题的引导或聚焦。而在实际部署中,背景内容和无关视觉实体往往会给图像搜索引入噪声,导致检索效果不佳且相关视觉实体识别错误,这成为制约图像搜索实际效率的主要瓶颈(见图1左侧)。

为克服现有研究的两大核心局限性,我们提出DeepMMSearch-R1——该模型能够执行按需多轮网络搜索,并为图像和文本搜索工具动态生成查询(见图1右侧)。具体而言,DeepMMSearch-R1可通过自我反思与自我修正,在多轮交互中自适应生成并优化文本搜索查询,同时将检索内容与原始问题作为反馈融入过程。为提升图像搜索效果,我们引入中间图像裁剪工具(本文采用Grounding DINO(Liu等人,2024b)),以解决背景噪声和无关视觉实体带来的挑战:DeepMMSearch-R1首先生成与问题最相关的视觉实体的指代描述,随后裁剪工具基于该描述动态识别并裁剪图像中的对应区域,最终使用裁剪后的图像进行搜索,以获取更具上下文相关性的结果。这种针对性方法显著提升了检索质量和整体性能。

图 1 与以往缺乏自我反思、自我纠错以及基于裁剪图像检索的基线模型不同,本文提出的 DeepMMSearch‑R1 能够执行按需式多轮网页搜索,并通过增强型图像检索实现更优效果 —— 该检索模块集成了中间裁剪工具,用于选取图像中最相关的区域。模型具备自我反思与自我纠错能力,可迭代优化文本查询语句,从而更好地处理真实网络环境中的嘈杂信息。该模型性能优于其他基线模型(尤其是 GPT‑4o),且与 GPT‑o3 模型表现相当。

我们采用两阶段训练流程:首先通过监督微调(SFT)进行冷启动初始化,随后采用GRPO算法(Shao等人,2024)进行在线强化学习(RL)。训练目标是让模型掌握“何时搜索、使用何种工具、搜索什么内容,以及如何基于检索内容推理以决定下一步动作(输出最终答案或优化查询以进行再次搜索)”。

本文的贡献如下:

1. 提出新型数据集:我们构建了DeepMMSearchVQA数据集,该数据集包含多样化的多跳视觉问答样本及多轮对话,在知识类别上分布均衡,且同时涵盖“需搜索”和“无需搜索”两类问题。该数据集可训练模型掌握“何时搜索、搜索什么、使用何种工具,以及如何基于检索内容推理”。

2. 多模态搜索工具集成:我们构建了真实世界多模态搜索流程,包含三种工具:(1)文本搜索工具——支持模型发起针对性查询,以检索相关网页并获取最新事实知识;(2)基于Grounding DINO(Liu等人,2024b)的定位工具——根据模型生成的视觉实体指代描述,识别并裁剪输入图像中的相关区域;(3)图像搜索工具——基于输入图像(裁剪后或完整图像)检索网络内容(包括标题和描述),帮助模型获取网络信息以识别陌生视觉实体。

3. 性能提升:通过“冷启动SFT初始化+GRPO在线RL”的两阶段训练流程,我们的模型实现了当前最优性能,超越了现有开源基准模型(见图1)。我们分析了“自我反思、自我修正及裁剪图像搜索”对性能的影响,并对工具调用行为进行了补充分析,为推动MLLMs中多模态网络搜索工具的集成提供了有价值的参考。

目前缺乏用于训练多模态大型语言模型网络搜索能力的指令微调数据集。为填补这一空白,我们提出DeepMMSearchVQA——该数据集包含多轮对话,融合了结构化工具调用标注和来自图像、文本搜索工具的网络检索信息。数据集构建遵循两大核心原则:(1)数据集需多样化,覆盖知识分类的全范围;(2)问题需同时包含“无需搜索”和“需搜索”两类,且通过多轮对话培养模型的推理、自我反思与自我修正能力。数据集自动化构建流程的概述见图2(上)。

图 2(上)DeepMMSearchVQA 数据生成流程:

首先将问题–图像对 (q,i) 输入 Gemini 模型,由其生成推理过程并输出一个动作标记。随后执行检查 A、B、C:若检查 A 或 B 不通过,则丢弃该样本;若检查 C 通过,则得到最终答案并保存该样本。否则,流程会根据动作标记调用搜索工具。该工具会检索排名前 k 的网页结果,对其进行摘要后回传给 Gemini,将网页检索信息融入上下文,供推理过程的后续轮次使用。

(下)DeepMMSearchVQA 统计信息:

知识分类体系、不同对话轮次下的样本分布、使用文本搜索、图像搜索与裁剪图像搜索的问题占比。

实验

实验设置

多模态搜索工具

为获取额外上下文和最新信息,我们构建了包含三种工具的多模态搜索流程:文本搜索工具、图像搜索工具和定位工具。

– 文本搜索工具:基于DeepMMSearch-R1生成的文本查询,通过内部网络搜索API从大规模索引中检索相关文档,随后由基于LLM的摘要模块对Top 5结果进行浓缩,生成与用户问题直接相关的简洁输出;

– 图像搜索工具:当模型判定问题仅涉及图像的特定区域时,会先生成描述该兴趣区域的指代表达式,再通过Grounding DINO(Liu等人,2024b)定位该区域并生成边界框,裁剪后作为检索输入;若完整图像与问题相关,则直接使用原始图像。最终视觉输入通过内部图像搜索API检索网络中视觉相似的图像,以及对应的上下文和页面元数据,再由LLM摘要模块对Top 5结果浓缩,生成视觉实体的简洁描述;

– 定位工具:即上述的Grounding DINO,用于实现图像中特定区域的精准定位与裁剪。

值得注意的是,我们未对文本/图像搜索的索引或API进行任何修改,以此验证模型与标准化检索工具的无缝适配能力。此外,文本和图像搜索结果的摘要均采用gpt-5-chat-latest作为LLM摘要器——这一步骤对保持检索内容的简洁性至关重要,可避免超出模型的最大上下文长度限制。摘要生成所用提示语见附录E.7。

实现细节

我们基于LLaMA-Factory框架(Zheng等人,2024)对Qwen2.5-VL-7B-Instruct进行微调,在所有目标模块中应用秩为8的LoRA适配器。监督微调训练持续3个epoch,学习率设为10^-4,采用余弦调度器和bf16混合精度,在1个节点(配备8张H100 GPU)上进行,全局批次大小为8,并通过输入掩码仅对多轮VQA数据集的生成输出部分进行优化。

在线强化学习优化采用veRL框架(Sheng等人,2024)中的GRPO算法,以gpt-5-chat-latest作为奖励模型,设置lambda_fmt=0.1、KL惩罚系数为0.001、裁剪比例为0.2。RL训练持续30个epoch,在4个节点(每个节点配备8张H100 GPU)上进行,批次大小为512,轨迹生成数量为8,学习率初始值为2 e^-6,并设置45步的预热阶段。响应的最大长度设为8192 token,同样通过输入掩码将优化聚焦于生成输出部分。更多实现细节见附录D。

基线模型

为验证DeepMMSearch-R1的有效性,我们将其与多类强基线模型对比,包括闭源模型(GPT-4o、GPT-o3)和开源模型(Qwen2.5-VL系列),并设计四种评估流程:

1. 直接回答(Direct Answer):要求模型不使用任何外部检索,直接生成简洁答案;

2. RAG流程(RAG Workflow):要求模型对每个问题执行固定两轮检索——先图像搜索,再文本搜索。其中,第一轮提供图像搜索结果以指导文本查询生成,第二轮提供文本搜索结果以生成最终答案。该流程虽能最大化外部知识获取,但当检索到无关或低质量内容时,可能引入噪声;

3. 基于提示的搜索代理(Prompt-based Search Agents):通过提示基础模型使用多模态搜索工具,并将检索结果融入最终响应生成;

4. 具备网络搜索功能的多模态大型语言模型(Web-search-equipped MLLMs):指能够执行按需多轮搜索的模型。此前的Search-R1(Jin等人,2025)、ReSearch(Chen等人,2025)等工作仅局限于文本检索,无法作为真正的多模态基线;而MMSearch-R1(Wu等人,2025)支持多模态检索,因此成为本实验中唯一的该类基线。

所有流程所用提示语见附录E。

数据集

– 训练数据集:监督微调阶段采用基于InfoSeek(Chen等人,2023)构建的DeepMMSearchVQA数据集;在线GRPO优化阶段采用FVQA(Wu等人,2025)训练集——选择FVQA的原因是其“需图像搜索”的问题比例高于SFT阶段使用的InfoSeek,可鼓励模型更频繁地调用图像搜索工具,这对提升多模态信息查询类VQA任务的性能至关重要;

-评估数据集:采用InfoSeek测试集、DynVQA(Li等人,2024c)、SimpleVQA(Cheng等人,2025)、Encyclopedic-VQA(Mensink等人,2023)、OKVQA(Marino等人,2019)和A-OKVQA(Schwenk等人,2022)作为基准测试集。由于InfoSeek和Encyclopedic-VQA规模较大,我们从两者的测试集中各随机抽取2000个样本;SimpleVQA则包含所有英文QA样本;OKVQA和A-OKVQA的问题基于COCO(Lin等人,2014)图像构建,难度相对较低,大多无需搜索——尽管这些基准测试集用于评估模型的“外部知识查询能力”,但由于许多现代MLLMs的预训练数据已包含COCO(Bai等人,2025),因此这些数据集的难度已显著降低,且以“无需搜索”的问题为主。

评估指标

我们采用“以LLM为评判者”(LLM-as-Judge)的框架评估模型性能——该框架通过LLM判断响应的准确性,能更好地捕捉多模态开放域VQA任务中“正确性”的细微差异(传统自动指标难以做到这一点)。具体而言,我们使用gpt-5-chat-latest作为评判模型,向其输入“问题、真实答案、模型响应”,由其判定响应是否正确。完整的评估提示语见附录E.5。

结果与分析

  • 具备网络搜索功能的多模态大型语言模型(MLLMs)性能优于RAG流程和基于提示的搜索代理基线
  • “搜索平衡”的SFT数据(从所有知识分类中均匀采样样本)能带来更优性能
  • SFT赋予模型工具使用能力,RL则通过减少不必要调用优化工具选择行为
  • 基于LoRA模块的SFT与“带KL惩罚的在线GRPO”能保持模型的通用VQA能力
  • 总结

    本研究提出DeepMMSearch-R1——一种新型多模态大型语言模型,旨在通过集成“按需多轮网络搜索能力”,提升模型在“知识密集型”和“信息查询型”视觉问答任务中的性能。为克服现有检索增强方法和多模态代理的局限性,我们的方法实现了两大核心功能:(1)通过自我反思与自我修正,实现动态迭代查询优化;(2)引入裁剪图像搜索工具,提升图像搜索效率。

    模型训练采用两阶段流程:

    1. 监督微调(SFT)阶段:基于所提出的DeepMMSearchVQA数据集,赋予模型工具使用能力;

    2. 在线强化学习(RL)阶段:通过GRPO算法进一步优化工具使用行为,提升效率和有效性。

    实验结果表明,DeepMMSearch-R1在6个基准测试集上的性能均超越现有基线模型。我们认为,DeepMMSearch-R1为“真实世界多模态信息查询类AI”的发展迈出了重要一步,在网络代理、教育、数字辅助等领域具有广阔应用前景。未来研究可探索“扩展工具多样性、长上下文推理、将训练扩展到更广泛的多语言和多模态领域”等方向。

    伦理声明(Ethics Statement)

    本研究提出的方法可增强多模态大型语言模型(MLLMs)的实时网络搜索能力。此类系统虽在提升信息丰富度与适应性方面具有显著优势,但也存在伦理风险:检索到的内容可能包含带有偏见、过时或误导性的信息,而自动摘要过程可能会放大这些错误信息,或引发版权问题。此外,本方法依赖外部基础设施,这可能会限制资源有限的机构对其的获取与使用。我们倡导采用负责任的部署实践,包括对信息进行来源标注、内容过滤,以及在高风险应用场景中引入人工监督。

    可复现性声明(Reproducibility Statement)

    我们已采取措施确保研究成果可被学术界复现。论文中详细提供了训练与评估的完整设置,包括数据生成流程、基础模型架构、所用数据集及训练步骤。我们公布了监督微调与强化学习阶段使用的所有超参数,同时也提供了实现细节(如批次大小、学习率及优化调度)。此外,数据集生成、评估及奖励建模过程中使用的完整提示语均已收录于附录E中。这些资源共同为复现我们的实验、验证研究结果提供了可能。

    相关工作(Related Works)

    1 多模态LLM(Multimodal LLMs)

    多模态大型语言模型(MLLMs)将视觉编码器与高性能文本大型语言模型(LLMs)相结合,能够处理并推理文本与视觉两种输入。近年来,GPT-4o(Hurst等人,2024)、Gemini(Team等人,2023)、Qwen2.5-VL(Bai等人,2025)、InternVL(Chen等人,2024)、LLaVA系列(Li等人,2024a;Lin等人,2023;Liu等人,2023b、a、2024a)、Phi(Abdin等人,2024)、MM1(McKinzie等人,2024;Zhang等人,2024a)、OVIS(Lu等人,2024b;Wang等人,2025)、VILA(Lin等人,2024;Nath等人,2025)、Gemma(Team等人,2024a、b)等模型已在视觉感知、视觉定位和多模态推理领域展现出强大能力,在视觉问答、图像描述生成和多模态对话等任务中取得了显著进展。

    这些进展凸显了MLLMs作为真实世界应用(如数字助手、教育和信息获取)核心组件的潜力。然而,尽管具备这些优势,MLLMs在处理知识密集型或信息查询型任务时仍存在根本性局限(Mensink等人,2023;Chen等人,2023;Cheng等人,2025;Li等人,2024c):其训练依赖静态语料库,而现实世界信息不断更新,这必然导致模型知识过时;此外,开放世界知识的广度遵循长尾分布,无法在固定训练数据集中覆盖所有罕见或新兴事实(Mensink等人,2023),这使得MLLMs难以应对长尾知识及需要最新背景的信息查询任务。

    2 基于RAG的搜索(RAG-based Search)

    顾名思义,检索增强生成(RAG)范式通过向量搜索从固定知识语料库中检索外部信息,并将其融入模型上下文以生成基于事实的响应。该领域的早期成果包括REALM(Guu等人,2020)——该方法通过联合优化密集检索器与语言模型,引入了检索增强预训练,以支持知识密集型任务;RAG(Lewis等人,2020)进一步推进了这一范式,将生成式序列到序列(seq2seq)模型与神经检索集成,在开放域问答任务中展现出显著优势。

    近年来,研究人员将检索增强扩展到多模态场景:REVEAL(Hu等人,2023)提出了检索增强视觉-语言预训练框架,对记忆模块、编码器、检索器和生成器进行端到端预训练,并使用海量数据;VisRAG(Yu等人,2024)提出了基于视觉-语言模型的RAG流程,将文档直接作为图像嵌入以进行检索,避免了文本解析过程中的信息丢失,同时支持对检索文档进行联合筛选,仅保留相关性最高、准确性最强的参考内容;RoRA-VLM(Qi等人,2024)引入了两阶段检索流程,通过图像锚定的文本查询扩展,协同融合查询中的视觉与文本信息,以检索最相关的多模态知识片段,此外还通过在训练中注入对抗性噪声,提升了检索增强视觉-语言模型的鲁棒性;RaR(Liu等人,2024e)针对视觉识别任务,提出了“检索-排序增强”多模态框架,强调了检索质量在多模态感知任务中的关键作用;近期的MMKB-RAG(Ling等人,2025)则提出了新型多模态RAG框架,利用模型固有的知识边界动态生成语义标签,以优化检索过程。

    尽管取得了这些进展,RAG方法仍依赖静态语料库,且存在“所有信息均可被固定数据集覆盖”的不切实际假设。在真实场景中,网络信息具有动态性和持续性,检索复杂度极高,这些因素为RAG在开放域视觉问答(VQA)中的实际应用带来了巨大挑战。

    3 基于提示的搜索代理(Prompt-based Search Agents)

    基于提示的搜索代理以即插即用模块的形式存在,无需额外微调即可与现有多模态LLM集成。在这种架构中,MLLM扮演“代理”角色,将网络检索信息融入响应生成过程。例如,VSA(Zhang等人,2024b)支持任何视觉-语言模型作为多模态自动搜索引擎,其流程分为三步:(1)视觉内容构建——模型识别目标对象;(2)网络知识搜索——生成多个子问题并发起网络查询;(3)摘要生成——整合检索信息后回答用户问题。

    类似地,MMSearch(Jiang等人,2024)引入了MMSearch-Engine框架,通过重新查询、重排序和摘要生成,为大型多模态模型赋予搜索能力;OmniSearch(Li等人,2024c)进一步推进了这一思路,提出了用于多模态检索的自适应规划代理——该代理将复杂问题动态分解为序列性子问题,并相应选择检索动作,且在每一步中,规划器会通过求解器评估先前的检索反馈,以决定“优化查询、切换检索模式(如文本、图像、网络)或生成新子问题”。这种基于反馈的灵活流程取代了僵化的启发式规则,更适用于动态、多跳、多模态的VQA场景。

    然而,上述方法均未对基础模型进行“与网络检索信息及外部搜索工具交互”的专门训练,导致模型难以应对真实网络信息含噪声、复杂度高的特性。

    4 具备网络搜索功能的多模态LLM(Web-search Equipped MLLMs)

    近期研究聚焦于通过R1优化(R1-optimization)为MLLMs赋予网络搜索能力,这一趋势源于OpenAI o1、o3及DeepSeek-R1等推理模型的成功。DeepResearcher(Zheng等人,2025)采用多代理浏览架构和GRPO算法,学习在真实约束条件(如API限制、网络延迟、反爬虫机制)下导航、提取和筛选任意网页中的信息;R1-Searcher(Song等人,2025)提出了两阶段“基于结果的强化学习”框架,使LLMs能在知识密集型任务的推理过程中自主调用外部搜索系统——第一阶段仅奖励模型“学习触发检索”(不考虑答案正确性),第二阶段则训练模型“整合检索证据以最大化答案准确性”;Search-R1(Jin等人,2025)引入了“检索token掩码”机制,避免强化学习目标直接对检索内容进行优化,从而在混合生成token与检索token时稳定训练过程。

    但上述工作均局限于文本搜索,无法执行图像搜索,这极大地限制了它们在多模态知识密集型问答任务中的适用性。MMSearch-R1(Wu等人,2025)是现有唯一支持多模态检索的研究,但仍存在明显局限:首先,尽管模型可自主决定使用何种工具,但每种工具仅能调用一次,无法通过自我反思与自我修正调整决策;其次,在知识密集型VQA任务中,精准识别问题所指向的图像视觉实体至关重要,但真实场景中的背景干扰和无关视觉实体会给检索过程引入噪声,阻碍目标实体的准确定位,导致图像搜索效果不佳(Mensink等人,2023)。为解决这些局限,本研究提出DeepMMSearch-R1——该模型通过“基于相关图像裁剪区域的搜索”执行图像检索,并能迭代优化文本搜索查询,以更好地应对真实网络信息的噪声问题。

    赞(0)
    未经允许不得转载:网硕互联帮助中心 » DeepMMSearch-R1: Empowering Multimodal LLMs in Multimodal Web Search论文分享
    分享到: 更多 (0)

    评论 抢沙发

    评论前必须登录!