
📖标题:Deep Research Pretraining via Predictive Navigation
🌐来源:arXiv, 2608.00432v1
🛎️文章简介
🔸研究问题:如何利用文档中自然存在的引用和超链接结构,在不依赖昂贵在线环境交互的情况下,高效预训练深度研究智能体?
🔸主要贡献:论文提出深度研究预训练(DRP)框架,将引文和超链接转化为离线预测导航监督信号,显著提升了下游智能体训练的样本效率。
📝重点思路
🔸构建离线反向合成框架:利用带有引用或超链接的段落作为目标报告,推断代理研究目标,从证据图中恢复支持性证据及拓扑相关的替代文档,将其合成为搜索-打开-撰写的轨迹。
🔸定义预测导航任务:模型需根据当前研究目标和已观察到的证据,预测下一步搜索内容、选择查阅的文档以及如何综合证据,无需实时检索环境或策略 rollout。
🔸多领域实例化验证:在学术引文图(DRP-Paper)和维基百科超链接图(DRP-Web)上分别构建数据集,对Qwen3-14B基座模型进行10亿token的持续预训练。
🔸掩码语言建模目标:在预训练阶段,仅对助手的推理、工具调用参数及最终报告计算损失,屏蔽搜索和打开操作的观测结果,迫使模型学习基于证据的决策而非复述环境响应。
🔎分析总结
🔸显著提升样本效率:在低数据预算下(如1/16或1/4的监督微调数据),经过DRP预训练的模型在DeepResearch Bench上 consistently 优于未预训练基座,DRP-Web仅用1/4数据即超越全量数据基座。
🔸增益具有泛化性:性能提升不仅限于长文本生成,还迁移至ResearchQA、WebWalkerQA和SimpleQA等基准测试,且在后续的智能体强化学习过程中优势依然保持。
🔸归因于证据对齐:对照实验表明,性能提升源于基于证据的条件导航能力,而非单纯的领域知识暴露或代理格式模仿;若打乱证据与查询的对齐关系,增益几乎消失。
🔸保持通用能力:将一半的通用预训练预算替换为DRP数据,在维持整体通用能力不变的同时,大幅提升了下游研究任务的初始化效果。
💡个人观点
论文利用了互联网和学术文献中固有的结构化关联(引用与链接),将其转化为无需昂贵交互成本的弱监督信号。

网硕互联帮助中心




评论前必须登录!
注册