云计算百科
云计算领域专业知识百科平台

论文阅读笔记 | VideoSeeker: 通过原生智能体工具调用激励实例级视频理解

VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation

  • 项目主页: https://gaotiexinqu.github.io/VideoSeeker/

一、Motivation

当前大型视觉语言模型(LVLMs)在视频理解方面已取得显著进展,但在需要实例级精确时空定位的任务上仍面临两个核心瓶颈:

1. 视觉感知与语言推理的脱耦

现有方法大多将推理过程围绕语言展开,而非直接基于视觉证据。这种"语言中心"的范式在长视频场景下容易产生幻觉。此外,广泛采用的单次均匀采样策略属于被动感知机制,无法自适应地捕获关键视觉证据,导致细粒度定位任务(如"某人第二次出现是什么时候")表现不佳。

2. 文本查询的交互局限性

现有方法和基准测试主要关注整体视频理解,强调全局语义和粗粒度事件,缺乏对特定实例的细粒度时空定位与推理能力。用户只能通过冗长的文本描述来指定目标(如"舞台上从左数第七个人"),交互效率低下,用户体验差。

核心洞察:视觉提示(Visual Prompts)能让用户直接在视频帧上标注目标区域,实现更精确的空间和时间引用;同时,赋予模型主动感知能力(Agentic Reasoning),让模型像人类一样"先全局浏览,再局部精读",可以根据需要动态获取视觉证据。


二、Related Work

本文的相关工作主要涉及两个方向:

2.1 视觉语言模型的强化学习

受 OpenAI o1 和 DeepSeek-R1 的启发,近期研究将 GRPO 式的强化学习从纯文本推理扩展到多模态领域。代表性工作包括:

  • 图像领域: Perception-R1 利用 IoU 作为奖励信号改进定位,DeepEyes 通过 RL 鼓励模型调用视觉工具
  • 视频领域: Video-R1、VideoChat-R1、VideoRFT 等聚焦视频 QA 和时序定位
  • 局限性: 这些方法仍依赖文本链式推理(CoT),本质上是"语言中心"的,在长视频场景下容易产生幻觉

2.2 工具增强的智能体视觉语言模型

近期工作表明,为模型配备外部工具能显著增强感知能力:

  • 图像领域: PixelReasoner、DeepEyesV2 等让模型"用图像思考"
  • 视频领域: LongVT 提出原生时序检索推理,VITAL 构建视觉工具箱允许模型按需密集采样

VideoSeeker 的差异化定位:(1)聚焦实例级视频理解,而非整体语义建模;(2)采用视觉提示(框、点、掩码等)而非纯文本查询;(3)提出全自动数据生成管线,并通过两阶段训练将工具调用能力内化到模型中。

三、Method

在这里插入图片描述

3.1 任务定义与环境交互

给定查询 Q、视觉提示帧 F_vp 和任意长度的视频 V,目标是针对 F_vp 所指示的特定实例准确回答查询 Q。

模型被建模为一个智能体,配备感知工具集 T = {view_visual_prompt, crop_video}:

  • view_visual_prompt: 持续提供视觉提示帧,作为目标实例外观的认知锚点
  • crop_video: 赋予模型细粒度局部观察能力,可主动筛选关键帧并去除冗余信息

交互过程为多轮循环:模型生成响应 → 如包含工具调用则执行工具并将结果追加到上下文 → 如包含答案则终止。这种"主动感知 → 局部放大 → 证据推理"的认知循环模拟了人类面对复杂视觉场景时"先全局浏览再局部精读"的策略。

3.2 数据构建

在这里插入图片描述

提出四阶段全自动数据合成管线,将任意视频 QA 数据集转化为视觉提示依赖的 QA 数据:

阶段方法功能保留率
(1) 低成本文本过滤 GPT-4o 快速筛除不适合视觉提示的 QA(如相机运动、场景描述、计数题等) 44.5%
(2) 视频级验证 Gemini-3.1-Pro 五步推理:目标提取+唯一性判断+语义标签生成+时间窗口定位+QA 改写 32.9%
(3) 像素级掩码生成 SAM3 基于语义标签进行文本驱动视频分割,1fps 采样生成像素级掩码 27.9%
(4) 视觉提示渲染 均匀采样 8 种提示类型 在帧上渲染视觉提示,改写 QA 使其依赖视觉提示 27.8%

最终数据源自 LLaVA-Video-178K,从 147,245 个样本中筛选得到约 40,929 个高质量样本。

SFT 和 RL 数据策划:使用 Qwen3-VL-235B-A22B-Thinking 通过拒绝采样策略生成多轮工具调用轨迹,筛选正确轨迹获得 34.2k 样本用于 SFT,进一步基于 pass-k 过滤得到 4.1k 样本用于 GRPO 训练。

3.3 训练策略

阶段一:监督微调(SFT)

使用 34.2k 高质量轨迹训练,通过标准自回归交叉熵损失优化。目标是让模型习得多轮、多尺度的主动感知模式,为智能体强化学习奠定基础。

阶段二:智能体强化学习(Agentic RL)

采用 GRPO 算法,将模型视为能自主使用工具的智能体。设计了三维度奖励函数:

  • 答案准确性 R_acc:使用 Qwen3-VL-235B 作为评判者,输出 {1, 0.5, 0} 评分
  • 格式合规性 R_format:鼓励模型生成结构化输出,便于解析和验证
  • 简约性 R_par:惩罚过多的工具调用次数,鼓励高效推理。公式为 R_par = max{0, 1 – λ·N}
  • 综合奖励:R = α·R_acc + β·R_format + γ·R_par(α=0.8, β=0.15, γ=0.05)


    四、Experiments

    4.1 实验设置

    • 基座模型: Qwen3-VL-4B 和 Qwen3-VL-8B
    • 训练基础设施: SFT 使用 LLaMA-Factory,RL 使用 verl,8 张 NVIDIA H800 GPU
    • 评测基准: V2P-Bench(实例级)、Video-MME、LongVideoBench、LongVT(通用)

    4.2 主要结果

    在这里插入图片描述

    实例级视频理解(V2P-Bench):

    模型平均准确率相对基线提升
    VideoSeeker-4B 70.6% +11.4%
    VideoSeeker-8B 74.5% +13.7%
    GPT-4o 65.4%
    Gemini-2.5-Pro 69.8%

    VideoSeeker-8B 以 74.5% 的平均分超越了 GPT-4o 和 Gemini-2.5-Pro,在 12 个评估维度中大部分取得最优。

    通用视频理解基准上的迁移性:
    在这里插入图片描述

    尽管训练数据完全来自实例级任务,VideoSeeker 在 Video-MME、LongVideoBench、LongVT 三个通用基准上仍分别取得 +3.2%(4B)和 +3.3%(8B)的平均提升,表现出良好的跨任务泛化能力。

    4.3 消融实验

    工具消融:view_visual_prompt 单独使用提升 8.6%,crop_video 单独提升 2.9%,两者组合提升 13.7%,呈现超加性协同效应。

    奖励消融:仅用 R_acc 得 65.4%;加入 R_format 提升至 73.1%;三维度组合达到最优 74.5%,三者存在互补效应。

    训练阶段消融:SFT 单独贡献 +9.6%;零样本 RL 中,单轮 RL 仅提升 1.8%,而智能体 RL 提升 5.1%,验证了智能体范式是有效 RL 训练的关键使能器。两阶段级联达到最优 74.5%。

    4.4 深度分析

    异构蒸馏悖论:更强的教师模型不一定训练出更强的学生模型。Gemini-3.1-Pro 作为教师(83.8%)反而使学生模型性能退化 19.1%,而同系列的 Qwen3-VL-235B(78.4%)仅退化 8.0%。同构蒸馏中教师与学生共享相似模式,知识传递更高效。

    奖励攻击问题:多选题数据上的 RL 训练导致性能暴跌至 43.8%(模型学会了随机猜测),而开放式问答 + LLM 评判的策略更鲁棒(74.5%)。

    推理效率:VideoSeeker 通过精简的工具调用策略和更紧凑的推理链,在生成和工具调用两个阶段都显著降低了推理开销。


    五、Conclusion

    VideoSeeker 提出了一种智能体范式,通过原生工具调用实现实例级视频理解。其核心贡献包括:

  • 有机整合智能体推理与实例级视频理解,突破文本查询局限
  • 构建四阶段全自动数据合成管线,高效生成大规模高质量训练数据
  • 两阶段训练策略(SFT + Agentic RL)将工具调用能力内化到模型中
  • 8B 模型在 V2P-Bench 上超越 GPT-4o 和 Gemini-2.5-Pro,同时在通用基准上展现良好迁移性

  • 六、个人思考

    亮点

  • 视觉提示 + 智能体推理的结合非常自然。用视觉提示替代冗长文本描述来指定目标实例,不仅提升了交互效率,也更符合人类直觉。模型通过主动调用工具"看一看"再推理,模拟了人类"先扫一眼全局,再仔细看细节"的认知策略,这比单次前向传播更合理。

  • 数据构建管线设计精巧。四阶段管线从文本过滤到视频验证再到掩码生成和渲染,逐步提高数据质量。用轻量 LLM 做文本预筛 + 强大 VLM 做视频验证的"由粗到细"策略,有效平衡了成本和质量。这套管线的自动化程度很高,可扩展到其他数据源。

  • 三维度奖励设计有工程洞察。特别是简约性奖励的引入,鼓励模型只在需要额外证据时才调用工具,避免了无意义的工具滥用,这在实际部署中对控制推理成本很重要。

  • 局限与思考

  • 工具集较为有限。目前仅有 view_visual_prompt 和 crop_video 两个工具,未来可以考虑引入目标追踪、光流分析、实例分割等更丰富的视觉工具,进一步增强模型的主动感知能力。

  • 数据源依赖。管线依赖 LLaVA-Video-178K 作为源数据,可能继承其领域偏差。论文中 72.1% 的视频来自 YouTube,领域覆盖的多样性有待提升。

  • 异构蒸馏悖论值得深入探索。这一发现对大模型知识蒸馏的实践具有重要启示:选择教师模型时不应单纯追求最强,而要考虑与学生模型的架构兼容性。这与近期"小模型自我进化"的研究方向形成有趣呼应。

  • 视觉提示的实用性。在实际应用中,用户是否愿意在视频帧上手动标注目标仍是一个开放问题。未来可以考虑结合自然语言描述的模糊匹配 + 视觉提示的精确标注,提供更灵活的交互方式。

  • 与 LongVT、VITAL 等工作的进一步对比。虽然论文强调了差异化定位,但在通用视频理解基准上的比较仍有限,特别是在超长视频(>30 分钟)上的表现值得更多探索。


  • 一句话总结: VideoSeeker 将智能体式的主动感知与视觉提示有机结合,用"先看再想"的方式实现了实例级视频理解的显著提升,数据管线和训练策略的设计具有较强的实用价值和可推广性。

    赞(0)
    未经允许不得转载:网硕互联帮助中心 » 论文阅读笔记 | VideoSeeker: 通过原生智能体工具调用激励实例级视频理解
    分享到: 更多 (0)

    评论 抢沙发

    评论前必须登录!