云计算百科
云计算领域专业知识百科平台

DeepResearch(二):Vane、AutoResearchClaw、ROMA、SearchClaw、Perplexica、Kimi-Researcher

DeepResearch系列:

  • DeepResearch(上):方法论、OpenAI Deep Research、SurfSence、MindSearch、morphik、Firesearch
  • 通义DeepResearch

本文继续汇总介绍几个开源或闭源深度研究项目。

Vane

开源(GitHub,35.8K Star,3.9K Fork)AI搜索引擎/工具,能理解问题、整理答案的智能助手。曾用GitHub地址:ItzCrazyKns/Perplexica。

不仅能像传统搜索引擎一样检索互联网信息,更能理解你的提问语境,结合LLM和相似度检索技术,给出更准确、结构化且带有来源引用的答案,核心目标是为开发者和知识工作者提供一个无需依赖大厂、可完全本地化部署的智能搜索工具。

特性

  • 多模式智能搜索
    • Copilot模式:通过自动生成多样化查询,主动访问相关网页,提取并筛选最优答案,适合复杂、开放式问题。
    • 普通模式:类似经典搜索,输入问题后自动调用SearxNG元搜索引擎,结合AI理解能力返回答案。
  • 六大Focus模式
    • All Mode:全网检索,返回最优结果
    • Writing Assistant:写作助手,不联网,适合内容创作
    • Academic Search:学术搜索,聚焦论文和学术资源
    • YouTube Search:检索YouTube视频
    • Wolfram Alpha Search:支持复杂计算与数据分析
    • Reddit Search:聚合Reddit社区讨论与观点
  • 实时性与隐私保护。不会像部分AI搜索那样仅依赖爬取后的静态数据,而是实时通过SearxNG抓取、重排序,确保信息新鲜且无需担心隐私泄露,可选择本地部署LLM(如Ollama等),实现100%本地推理,无需API Key,数据不出本地。
  • 丰富的模型与API支持。支持多种LLM接入,包括Lemonade等,可通过API轻松集成到你的应用或自动化流程中。
  • 实战

    提供多种部署方式,如基于Docker、Docker Compose、npm等:

    # 基于Docker
    docker run -d -p 3000:3000 -v vane-data:/home/vane/data –name vane itzcrazykns1337/vane:latest
    # 基于Docker和自建SearxNG
    docker run -d -p 3000:3000 -e SEARXNG_API_URL=http://your-searxng-url:8080 -v vane-data:/home/vane/data –name vane itzcrazykns1337/vane:slim-latest
    # 基于源码和Docker Compose
    git clone https://github.com/ItzCrazyKns/Vane.git
    cd Vane
    docker compose up -d
    # 或基于npm
    npm i
    npm run build
    npm run start

    浏览器打开http://localhost:3000,开始体验。

    AutoResearchClaw

    论文,开源(GitHub,13.8K Star,1.6K Fork)深度研究助手,输入一个主题,即可生成论文级别的专业文档。 在这里插入图片描述

    功能说明
    多源文献 来自OpenAlex、Semantic Scholar和arXiv的真实论文,查询扩展、去重、三态熔断器与优雅降级
    四层引用核查 arXiv ID校验→CrossRef/DataCite DOI→Semantic Scholar标题匹配→LLM相关性评分。幻觉引用自动删除
    硬件感知执行 自动检测GPU(NVIDIA CUDA/Apple MPS/纯CPU),据此调整代码生成、import和实验规模
    OpenCode Beast Mode 复杂实验自动路由至OpenCode,生成多文件项目,含自定义架构、训练循环和消融实验。通过researchclawsetup安装
    沙箱实验 AST验证代码、不可变harness、NaN/Inf快速失败、自修复、迭代优化(最多10轮)、部分结果捕获
    顶会级写作 NeurIPS/ICML/ICLR模板,分段撰写(5,000-6,500词),反数据捏造守卫、修订长度保障、反免责声明强制
    模板切换 neurips_2025、iclr_2026、icml_2026,Markdown→LaTeX,含数学公式、表格、图片、交叉引用、\\cite{}
    反数据捏造 VerifiedRegistry强制论文中使用经过验证的实验数据。自动诊断失败实验并在写作前修复。未验证数字被清理
    质量门控 3个人工审批门控(阶段5、9、20),支持回滚。用–auto-approve跳过
    HITL Co-Pilot 6种干预模式,支持逐阶段策略。Idea Workshop、Baseline Navigator、PaperCo-Writer实现深度协作。Smart Pause、成本护栏、升级策略和干预学习确保生产安全。CLI/Web Socket/MCP适配器
    成本护栏 预算监控,可配置阈值告警(50%/80%/100%)。超出预算时流水线自动暂停
    可复现性 所有阶段产物的SHA256校验和。不可变清单用于验证。多级撤销与版本化快照

    核心能力

    功能说明
    Idea Workshop 协作式头脑风暴、评估和优化假设(阶段7-8)
    Baseline Navigator AI建议基线+人工增删+可复现性检查清单(阶段9)
    Paper Co-Writer 分段撰写,人工编辑与AI润色结合(阶段16-19)
    Smart Pause 基于置信度的动态暂停,自动检测何时需要人类输入
    声明验证 与收集的文献进行内联事实检查,标记无依据的声明
    成本护栏 预算监控,50%/80%/100%阈值告警
    干预学习 ALHF,每次运行提取教训(决策理由、运行时警告、指标异常),30天时间衰减。从历史中学习,优化未来的暂停决策
    分支探索 分叉流水线探索多个假设,比较后合并最佳路径
    升级策略 分级通知(终端→Slack→邮件→自动暂停),无人值守时触发
    3种适配器 CLI(终端)、WebSocket(Web仪表板)、MCP(外部Agent)
    知识库 每次运行在6个类别(决策、实验、发现、文献、问题、评审)中构建结构化知识库

    流水线:8个阶段组,23个阶段 阶段组A:研究定义 1.TOPIC_INIT 2.PROBLEM_DECOMPOSE

    阶段组B:文献发现 3.SEARCH_STRATEGY 4.LITERATURE_COLLECT ← 真实API 5.LITERATURE_SCREEN [门控] 6.KNOWLEDGE_EXTRACT

    阶段组C:知识综合 7. SYNTHESIS 8. HYPOTHESIS_GEN ← 辩论

    阶段组D:实验设计 9. EXPERIMENT_DESIGN [门控] 10. CODE_GENERATION 11. RESOURCE_PLANNING

    阶段组E:实验执行 12. EXPERIMENT_RUN 13. ITERATIVE_REFINE ← 自修复

    阶段组F:分析与决策 14. RESULT_ANALYSIS ← 多Agent 15. RESEARCH_DECISION ← PIVOT/REFINE

    阶段组G:论文撰写 17. PAPER_DRAFT 18. PEER_REVIEW ← 证据审查 19. PAPER_REVISION

    阶段组H:终稿 20. QUALITY_GATE [门控] 21. KNOWLEDGE_ARCHIVE 22. EXPORT_PUBLISH ← LaTeX 23. CITATION_VERIFY ← 相关性审查

    提供完整的人机协作(HITL)系统,将流水线从纯自动化转变为人机协作的研究引擎:

    模式命令做什么
    完全自动 –auto-approve 原始行为——无人工干预
    仅门控 –modegate-only 在3个门控阶段(5、9、20)暂停等待审批
    检查点 –modecheckpoint 在每个阶段组边界暂停(8个检查点)
    Co-Pilot –modeco-pilot 在关键阶段深度协作,其余自动执行
    逐步 –modestep-by-step 每个阶段后暂停——用于学习流水线
    快速 –modeexpress 快速审核——仅3个最关键的门控

    可使用任何ACP兼容的编码Agent作为其LLM后端,无需API密钥,Agent通过acpx通信,在全部23个流水线阶段中维持单个持久会话。

    内置Bridge适配器系统,提供6个可选集成能力:

    # config.arc.yaml
    openclaw_bridge:
    use_cron: true# 定时研究任务
    use_message: true# 进度通知(Discord/Slack/Telegram)
    use_memory: true# 跨会话知识持久化
    use_sessions_spawn: true# 为并行阶段派生子会话
    use_web_fetch: true# 文献检索中的实时网络搜索
    use_browser: false# 基于浏览器的论文采集

    实战

    基于源码体验:

    # 1. 克隆并安装
    git clone https://github.com/aiming-lab/AutoResearchClaw.git
    cd AutoResearchClaw
    python3 -m venv .venv && source .venv/bin/activate
    pip install -e .
    # 2. 初始化,交互式安装OpenCode Beast Mode,检查Docker/LaTeX
    researchclaw setup
    # 3. 配置
    researchclaw init# 交互式:选择LLM提供商,创建config.arc.yaml
    # 或手动:cp config.researchclaw.example.yaml config.arc.yaml
    # 4. 运行
    export OPENAI_API_KEY="sk-…"
    researchclaw run –config config.arc.yaml –topic "Your research idea" –auto-approve

    CLI命令示例:

    # 以HITL模式启动
    researchclaw run –topic "…" –mode co-pilot
    # 附加到暂停的流水线(从另一个终端)
    researchclaw attach artifacts/rc-2026-xxx
    # 检查流水线和 HITL 状态
    researchclaw status artifacts/rc-2026-xxx
    # 从另一个终端或脚本审批/拒绝
    researchclaw approve artifacts/rc-2026-xxx –message "LGTM"
    researchclaw reject artifacts/rc-2026-xxx –reason "缺少关键基线"
    # 为某个阶段注入引导(甚至在它运行之前)
    researchclaw guide artifacts/rc-2026-xxx –stage 9 –message "使用 ResNet-50 作为主要基线"

    配置文件config.arc.yaml示例:

    hitl:
    enabled: true
    mode: copilot # full-auto、gate-only、checkpoint、co-pilot、custom
    cost_budget_usd: 50.0 # 超出预算时暂停(0 = 无限制)
    notifications:
    on_pause: true
    on_quality_drop: true
    channels: ["terminal"] # terminal、slack、webhook
    timeouts:
    default_human_timeout_sec: 86400 # 默认等待24小时
    auto_proceed_on_timeout: false
    collaboration:
    max_chat_turns: 50
    save_chat_history: true
    # 逐阶段自定义策略,可选,用于'custom'模式
    stage_policies:
    8: { require_approval: true, enable_collaboration: true }
    9: { require_approval: true, allow_edit_output: true }

    ROMA

    由Sentient AGI团队开发的Recursive-Open-Meta-Agent开源(GitHub,5.1K Star,772 Fork)框架,通过递归层次结构自动将复杂问题拆解为可并行子任务,提供完全透明的执行过程,便于调试和优化。

    内置通用任务解决器、深度研究Agent和金融分析Agent,支持多模态、工具调用和MCP协议,在SEAL-0、FRAMES和SimpleQA基准测试中表现卓越,堪称Deep Research的开源杀手。

    特性:

  • 递归分解层次结构与并行执行
    • Atomizer:判断任务是否原子,若非则触发规划
    • Planner:将任务拆解为子任务,递归反馈
    • Executors:处理原子任务,支持LLM、API或其他Agent(agent.execute()接口)
    • Aggregator:整合子任务结果,回传父任务
    • 信息流:自顶向下分解、自底向上聚合、左到右依赖执行
  • 基准测试顶级性能
    • SEAL-0:事实求证测试,处理冲突搜索结果,ROMA-Search超越Gemini-2.5-Pro
    • FRAMES:检索增强生成,评估事实性、检索准确性和推理,ROMA在多源整合上卓越
    • SimpleQA:简单问答,ROMA匹配o3 Pro水平
  • 内置专业智能体
    • 通用任务解决器:多领域Agent,使用ChatGPT Search Preview,支持智能搜索、规划和原型构建
    • 深度研究Agent:复杂研究系统,智能拆解、并行信息收集、多源整合和合成
    • 金融分析Agent:加密货币专属,集成Binance/CoinGecko/DefiLlama实时数据、Arkham链上分析、技术指标和DeFi指标,在E2B沙盒安全执行
  • 多模态与工具集成
    • 多模态支持:处理文本、图像、代码等
    • 工具调用:MCP协议、钩子、缓存,支持API集成
    • 安全执行:E2B沙盒和S3数据持久化,避免风险
  • 透明调试与优化执行
    • 可视化:每步日志清晰,支持上下文工程
    • 迭代优化:调整Planner或Executor,快速改进Agent
  • 实战

    部署

    git clone https://github.com/sentient-agi/ROMA.git
    cd ROMA
    ./setup.sh –docker # 自动构建环境
    ./setup.sh –native # 安装Python依赖
    ./setup.sh –e2b # E2B沙盒集成
    ./setup.sh –test-e2b # 测试E2B

    SearchClaw

    技术报告,专业的开源(GitHub,106 Star,15 Fork)代理式网络研究工具,通过其Web用户界面,用户只需提出问题,它便能自主执行多步骤研究,包括全面搜索网页、学术论文和新闻等多种来源,并智能阅读、分析内容,最终生成经过充分引用且高质量的答案。项目借鉴线束工程原理,围绕LLM构建一个结构化框架,而非单纯依赖提示词,从而提升代理的可靠性。

    关键特性包括:

    • 支持多源搜索和可选的浏览器集成以处理复杂页面;
    • 具备自动研究规划和在研究过程中向用户提问的能力;
    • 通过严谨的质量门控机制确保答案的引用完整性、来源多样性及信息全面性;
    • 智能管理上下文窗口,拥有持久化记忆功能以学习用户偏好和历史事实
    • 广泛兼容多种LLM提供商
    • 可配置密码保护以确保远程部署安全。

    Perplexica

    官网,聊天式搜索入口 在这里插入图片描述 支持多种当前最强(国外包括国内)模型,自动选择最优模型: 在这里插入图片描述 支持多种搜索来源在这里插入图片描述 并支持多种适用模式: 在这里插入图片描述

    Kimi-Researcher

    项目主页,Kimi推出,专为解决复杂问题而设计的深度研究智能体,擅长多轮搜索与推理。暂未开源,GitHub只有静态图片、markdown文件和一次提交。

    网页端入口如下: 在这里插入图片描述

    核心能力包含如下4个维度:

    • 研究计划制定:首先向用户追问澄清需求,然后基于ReAct模式进行研究。同时,具备计划的动态调整能力,在任务执行过程中,如果发现初始的规划方向不够精准或遇到新的信息,它能够实时调整策略。
    • 工具使用与环境交互:内置一套强大的工具集,包含并行实时搜索工具、交互式Web浏览器工具和代码执行工具。依托工具集,将思考与行动紧密结合,形成"推理→行动→反馈"流程,即先通过内部推理规划行动步骤,再自主调用适当的工具获取信息或执行操作,然后将结果纳入思考,循环往复直至解决问题。
    • 内容评估与报告生成:具备信息冲突解决和交叉验证能力。当多个来源的信息相互冲突时,可通过迭代假设细化和自我纠正机制处理信息冲突;在回答前回执行额外的搜索并交叉验证信息。支持生成可溯源(引用标注)、结构化和可视化报告。
    • 多角色Agent协同:作为闭源产品,其内部实现细节未公开。从技术细节看,可能是单Agent架构。

    核心创新

  • 全自动化的数据生成与验证管线,以保证训练数据的规模、多样性和正确性
  • #mermaid-svg-UcagZjPrvNrq49do{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-UcagZjPrvNrq49do .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-UcagZjPrvNrq49do .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-UcagZjPrvNrq49do .error-icon{fill:#552222;}#mermaid-svg-UcagZjPrvNrq49do .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-UcagZjPrvNrq49do .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-UcagZjPrvNrq49do .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-UcagZjPrvNrq49do .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-UcagZjPrvNrq49do .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-UcagZjPrvNrq49do .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-UcagZjPrvNrq49do .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-UcagZjPrvNrq49do .marker{fill:#333333;stroke:#333333;}#mermaid-svg-UcagZjPrvNrq49do .marker.cross{stroke:#333333;}#mermaid-svg-UcagZjPrvNrq49do svg{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-UcagZjPrvNrq49do p{margin:0;}#mermaid-svg-UcagZjPrvNrq49do .label{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;color:#333;}#mermaid-svg-UcagZjPrvNrq49do .cluster-label text{fill:#333;}#mermaid-svg-UcagZjPrvNrq49do .cluster-label span{color:#333;}#mermaid-svg-UcagZjPrvNrq49do .cluster-label span p{background-color:transparent;}#mermaid-svg-UcagZjPrvNrq49do .label text,#mermaid-svg-UcagZjPrvNrq49do span{fill:#333;color:#333;}#mermaid-svg-UcagZjPrvNrq49do .node rect,#mermaid-svg-UcagZjPrvNrq49do .node circle,#mermaid-svg-UcagZjPrvNrq49do .node ellipse,#mermaid-svg-UcagZjPrvNrq49do .node polygon,#mermaid-svg-UcagZjPrvNrq49do .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-UcagZjPrvNrq49do .rough-node .label text,#mermaid-svg-UcagZjPrvNrq49do .node .label text,#mermaid-svg-UcagZjPrvNrq49do .image-shape .label,#mermaid-svg-UcagZjPrvNrq49do .icon-shape .label{text-anchor:middle;}#mermaid-svg-UcagZjPrvNrq49do .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-UcagZjPrvNrq49do .rough-node .label,#mermaid-svg-UcagZjPrvNrq49do .node .label,#mermaid-svg-UcagZjPrvNrq49do .image-shape .label,#mermaid-svg-UcagZjPrvNrq49do .icon-shape .label{text-align:center;}#mermaid-svg-UcagZjPrvNrq49do .node.clickable{cursor:pointer;}#mermaid-svg-UcagZjPrvNrq49do .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-UcagZjPrvNrq49do .arrowheadPath{fill:#333333;}#mermaid-svg-UcagZjPrvNrq49do .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-UcagZjPrvNrq49do .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-UcagZjPrvNrq49do .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-UcagZjPrvNrq49do .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-UcagZjPrvNrq49do .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-UcagZjPrvNrq49do .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-UcagZjPrvNrq49do .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-UcagZjPrvNrq49do .cluster text{fill:#333;}#mermaid-svg-UcagZjPrvNrq49do .cluster span{color:#333;}#mermaid-svg-UcagZjPrvNrq49do div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-UcagZjPrvNrq49do .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-UcagZjPrvNrq49do rect.text{fill:none;stroke-width:0;}#mermaid-svg-UcagZjPrvNrq49do .icon-shape,#mermaid-svg-UcagZjPrvNrq49do .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-UcagZjPrvNrq49do .icon-shape p,#mermaid-svg-UcagZjPrvNrq49do .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-UcagZjPrvNrq49do .icon-shape .label rect,#mermaid-svg-UcagZjPrvNrq49do .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-UcagZjPrvNrq49do .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-UcagZjPrvNrq49do .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-UcagZjPrvNrq49do :root{–mermaid-font-family:\”trebuchet ms\”,verdana,arial,sans-serif;}#mermaid-svg-UcagZjPrvNrq49do .blueBox>*{fill:#c2c5ff!important;stroke:#333!important;stroke-width:1px!important;}#mermaid-svg-UcagZjPrvNrq49do .blueBox span{fill:#c2c5ff!important;stroke:#333!important;stroke-width:1px!important;}#mermaid-svg-UcagZjPrvNrq49do .grayBox>*{fill:#f4f4f4!important;stroke:#666!important;stroke-width:1px!important;}#mermaid-svg-UcagZjPrvNrq49do .grayBox span{fill:#f4f4f4!important;stroke:#666!important;stroke-width:1px!important;}#mermaid-svg-UcagZjPrvNrq49do .greenBox>*{fill:#a5ffa5!important;stroke:#333!important;stroke-width:1px!important;}#mermaid-svg-UcagZjPrvNrq49do .greenBox span{fill:#a5ffa5!important;stroke:#333!important;stroke-width:1px!important;}#mermaid-svg-UcagZjPrvNrq49do .container>*{fill:#fff!important;stroke:#999!important;stroke-width:1px!important;stroke-dasharray:5 5!important;}#mermaid-svg-UcagZjPrvNrq49do .container span{fill:#fff!important;stroke:#999!important;stroke-width:1px!important;stroke-dasharray:5 5!important;}

    验证与过滤

    推理密集型任务

    数学与代码推理

    高难度搜索

    工具为中心的任务

    强制调用特定工具

    开始:定义任务目标

    数据生成策略

    自动化生成问题-答案对

    提取可靠的Ground Truth (GT)

    Pass@N检查过滤简单问题

    移除模糊或错误数据

    最终训练数据集

    工具为中心的任务:被特意设计为必须通过调用特定工具才能解决,旨在训练智能体学习何时以及如何有效地协同使用工具。

    推理密集型任务,旨在强化智能体的核心认知能力:

    • 数学与代码推理:训练模型利用工具集解决逻辑推理和算法问题。
    • 高难度搜索:要求智能体在上下文约束下进行迭代式搜索、信息综合和推理,以得出正确答案。
  • 采用强化学习算法进行训练。
  • 为了确保训练的稳定性,采用以下关键策略:

    • 严格的On-policy训练:在训练过程中,禁用工具调用格式强制器等LLM引擎机制,确保智能体完全依据自身的概率分布生成轨迹,从而获得严格的在策略(On-policy)数据。
    • 负样本控制:负样本(错误的轨迹)会降低模型输出的概率,可能导致熵崩溃。为此,团队策略性地丢弃部分负样本,使模型能够在更长的训练周期内持续改进。
    • 结果导向的奖励机制:为了在动态环境中提供一致的偏好信号,使用基于最终结果的奖励。
      • 格式奖励:对包含无效工具调用或超出上下文/迭代限制的轨迹给予惩罚。
      • 正确性奖励:对于格式正确的轨迹,根据模型答案与标准答案(Ground Truth)的比对结果给予奖励。
    • 效率激励:对正确的轨迹应用gamma衰减因子(公式

      r

      ×

      γ

      T

      i

      r×γ^{T−i}

      r×γTi),其中

      r

      r

      r是结果奖励,

      T

      T

      T是总步数。鼓励模型探索更短、更高效的解题路径。

    #mermaid-svg-9nDnvykBltRILl1t{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-9nDnvykBltRILl1t .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-9nDnvykBltRILl1t .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-9nDnvykBltRILl1t .error-icon{fill:#552222;}#mermaid-svg-9nDnvykBltRILl1t .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-9nDnvykBltRILl1t .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-9nDnvykBltRILl1t .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-9nDnvykBltRILl1t .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-9nDnvykBltRILl1t .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-9nDnvykBltRILl1t .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-9nDnvykBltRILl1t .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-9nDnvykBltRILl1t .marker{fill:#333333;stroke:#333333;}#mermaid-svg-9nDnvykBltRILl1t .marker.cross{stroke:#333333;}#mermaid-svg-9nDnvykBltRILl1t svg{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-9nDnvykBltRILl1t p{margin:0;}#mermaid-svg-9nDnvykBltRILl1t .label{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;color:#333;}#mermaid-svg-9nDnvykBltRILl1t .cluster-label text{fill:#333;}#mermaid-svg-9nDnvykBltRILl1t .cluster-label span{color:#333;}#mermaid-svg-9nDnvykBltRILl1t .cluster-label span p{background-color:transparent;}#mermaid-svg-9nDnvykBltRILl1t .label text,#mermaid-svg-9nDnvykBltRILl1t span{fill:#333;color:#333;}#mermaid-svg-9nDnvykBltRILl1t .node rect,#mermaid-svg-9nDnvykBltRILl1t .node circle,#mermaid-svg-9nDnvykBltRILl1t .node ellipse,#mermaid-svg-9nDnvykBltRILl1t .node polygon,#mermaid-svg-9nDnvykBltRILl1t .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-9nDnvykBltRILl1t .rough-node .label text,#mermaid-svg-9nDnvykBltRILl1t .node .label text,#mermaid-svg-9nDnvykBltRILl1t .image-shape .label,#mermaid-svg-9nDnvykBltRILl1t .icon-shape .label{text-anchor:middle;}#mermaid-svg-9nDnvykBltRILl1t .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-9nDnvykBltRILl1t .rough-node .label,#mermaid-svg-9nDnvykBltRILl1t .node .label,#mermaid-svg-9nDnvykBltRILl1t .image-shape .label,#mermaid-svg-9nDnvykBltRILl1t .icon-shape .label{text-align:center;}#mermaid-svg-9nDnvykBltRILl1t .node.clickable{cursor:pointer;}#mermaid-svg-9nDnvykBltRILl1t .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-9nDnvykBltRILl1t .arrowheadPath{fill:#333333;}#mermaid-svg-9nDnvykBltRILl1t .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-9nDnvykBltRILl1t .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-9nDnvykBltRILl1t .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-9nDnvykBltRILl1t .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-9nDnvykBltRILl1t .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-9nDnvykBltRILl1t .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-9nDnvykBltRILl1t .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-9nDnvykBltRILl1t .cluster text{fill:#333;}#mermaid-svg-9nDnvykBltRILl1t .cluster span{color:#333;}#mermaid-svg-9nDnvykBltRILl1t div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-9nDnvykBltRILl1t .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-9nDnvykBltRILl1t rect.text{fill:none;stroke-width:0;}#mermaid-svg-9nDnvykBltRILl1t .icon-shape,#mermaid-svg-9nDnvykBltRILl1t .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-9nDnvykBltRILl1t .icon-shape p,#mermaid-svg-9nDnvykBltRILl1t .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-9nDnvykBltRILl1t .icon-shape .label rect,#mermaid-svg-9nDnvykBltRILl1t .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-9nDnvykBltRILl1t .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-9nDnvykBltRILl1t .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-9nDnvykBltRILl1t :root{–mermaid-font-family:\”trebuchet ms\”,verdana,arial,sans-serif;}#mermaid-svg-9nDnvykBltRILl1t .pink>*{fill:#ffcccc!important;stroke:#333!important;stroke-width:1px!important;}#mermaid-svg-9nDnvykBltRILl1t .pink span{fill:#ffcccc!important;stroke:#333!important;stroke-width:1px!important;}#mermaid-svg-9nDnvykBltRILl1t .green>*{fill:#ccffcc!important;stroke:#333!important;stroke-width:1px!important;}#mermaid-svg-9nDnvykBltRILl1t .green span{fill:#ccffcc!important;stroke:#333!important;stroke-width:1px!important;}#mermaid-svg-9nDnvykBltRILl1t .gray>*{fill:#f5f5f5!important;stroke:#999!important;stroke-width:1px!important;}#mermaid-svg-9nDnvykBltRILl1t .gray span{fill:#f5f5f5!important;stroke:#999!important;stroke-width:1px!important;}

    智能体生成完整轨迹

    轨迹是否存在格式错误?

    格式奖励: 惩罚

    答案是否正确?

    正确性奖励: 正奖励

    应用Gamma衰减, 早期步骤奖励更高

    正确性奖励: 负奖励/零奖励

    学习信号

  • 高效的长上下文管理
  • 一个长序列研究任务的观察上下文可能非常庞大,若无有效的记忆管理,智能体在10次迭代内就可能超出上下文限制。为此设计一套上下文管理机制,允许模型在保留关键信息的同时,丢弃不必要的文档。使单个Rollout轨迹的长度扩展到超过50次迭代。早期消融研究表明,采用该机制训练的模型迭代次数增加30%,从而能获取更多信息并取得更高性能。

  • 大规模智能体RL基础设施 在这里插入图片描述 具体来说:
    • 全异步Rollout:采用基于服务器的架构,并行调度智能体Rollout、环境交互和奖励计算,消除了资源等待时间,效率远超同步系统。
    • 回合级部分Rollout:针对少数需要大量回合的长尾任务,设计部分Rollout机制。超出时间预算的任务会被存入回放缓冲区,在后续迭代中使用更新后的模型权重继续执行剩余的回合。带来至少1.5倍的Rollout加速。
    • 鲁棒的沙箱环境:统一的沙箱架构在保证隔离性的同时消除容器间开销。基于Kubernetes的混合云架构支持动态资源分配和零停机调度,确保系统的高可用性和容错性。
    赞(0)
    未经允许不得转载:网硕互联帮助中心 » DeepResearch(二):Vane、AutoResearchClaw、ROMA、SearchClaw、Perplexica、Kimi-Researcher
    分享到: 更多 (0)

    评论 抢沙发

    评论前必须登录!