云计算百科
云计算领域专业知识百科平台

DeepSeek-V4-Pro 正式版突袭上线:Agent 能力暴涨,DeepSWE 直接干翻 Claude Opus 4.8

DeepSeek-V4-Pro 正式版突袭上线:Agent 能力暴涨,DeepSWE 直接干翻 Claude Opus 4.8

8 月 12 日深夜,DeepSeek 悄悄在 API 文档里上架了一个新版本号——DeepSeek-V4-Pro-0813。第二天(13 日),这个版本被确认为 V4 Pro 正式版。没有发布会,没有预热,只改了版本号,就把整个 AI 圈的注意力又抢了过去。


一、发生了什么:一次"改版本号"式的正式发布

事情的开场很"DeepSeek":没有直播、没有 keynote,最先泄露风声的是官方 API 文档的"模型 & 价格"页面。眼尖的开发者发现,deepseek-v4-pro 的模型版本一栏,从预览版悄悄变成了 DeepSeek-V4-Pro-0813。

紧接着,官方群放出的评测对比表开始流传,各媒体跟进报道,正式版的身份才被坐实。

关键点:调用方式完全没变。 你不需要改任何代码,只要继续用 deepseek-v4-pro 这个模型名,API 返回的就是最新版。这对存量用户来说,等于一次"零迁移成本"的免费升级。


二、最炸裂的数字:DeepSWE 从个位数飙到 62.7

这次正式版最值得说的一件事,是 Agent(智能体)能力的质变。

在长周期、高复杂度的真实软件工程智能体基准测试 DeepSWE 上:

  • 预览版(V4-Pro-Preview):得分仅 12.8
  • 正式版(V4-Pro-0813):62.7

接近 5 倍的提升,而且直接超越了 Claude Opus 4.8(58.0)。

DeepSWE 是什么含金量?它是一个无污染的软件工程基准,使用严格验证器(误报率仅 0.3%),比传统的 SWE-bench 更接近"让 AI 真正在一个代码库里干活"的真实场景。能在这个测试上拿到 62.7,说明 DeepSeek 这次不是堆参数,而是在专门训练模型"当工程师"。


三、和自家 Flash 掰手腕:贵 3 倍,到底强在哪?

这是很多开发者最纠结的问题:DeepSeek 自家的两个正式版,到底该用哪个?

先看核心指标对比:

指标V4-Flash-0731V4-Pro-0813
DeepSWE 54.4 62.7
输入(缓存命中) 0.02 元 / M 0.025 元 / M
输入(缓存未命中) 1 元 / M 3 元 / M
输出 2 元 / M 6 元 / M
并发限制 2500 500

结论很清晰:

  • Flash 是性价比之王:输入未命中 1 元、输出 2 元,只有 Pro 的三分之一价格,但 DeepSWE 也有 54.4 分(同样是从预览版的 7.3 暴涨上来的)。日常任务、高频调用、预算敏感的场景,Flash 完全够用。

  • Pro 是旗舰深度版:DeepSWE 62.7 压过 Flash 一头,整体能力(尤其复杂 Agent 任务、长上下文深度推理)更强,适合对质量要求更高的生产场景。

  • 一句话总结:默认用 Flash 跑量,复杂任务上 Pro。 两者价格差 3 倍,能力差距没那么悬殊,按需切换是最聪明的用法。


    四、到底什么水平?官方 10 项基准原表全解析

    这是大家最关心的问题:V4-Pro-0813 到底处于什么水平?官方放出的 Agent 相关评测对比表(对标本家预览版/Flash 版 + Claude Opus 4.8 + Fable 5),数据如下:

    DeepSeek V4-Pro-0813 官方 Agent 评测对比表

    基准测试Pro-0813Flash-0731Pro-PreviewOpus 4.8Fable 5
    HLE (wo/w tools) 42.7/60.0 37.8/51.5 37.7/48.2 49.8/57.9 53.3/63.0
    Terminal Bench 2.1 87.9 82.7 72.1 85.0 88.0
    NL2Repo 61.5 54.2 38.5 69.7
    CyberGym 83.3 76.7 52.7 78.3 83.1
    DeepSWE 62.7 54.4 12.8 58.0 70.0
    Toolathlon-Verified 74.1 70.3 55.9 76.2 77.9
    Agents’ Last Exam 25.7 25.2 16.5 25.7
    Automation-Bench 31.8 25.1 12.8 27.2 29.1
    DSBench-FullStack 71.1 68.7 41.8 71.6 77.2
    DSBench-Hard 67.2 59.6 31.1 71.7 68.3

    四个关键结论

    1. Agent 能力:和 Opus 4.8 同档,逼近 Fable 5

    10 项基准里,Pro-0813 在 4 项上超过 Opus 4.8(DeepSWE、Terminal Bench 2.1、CyberGym、Automation-Bench),3 项打平(Agents’ Last Exam 同为 25.7、DSBench-FullStack 71.1 vs 71.6 几乎没差),3 项落后(HLE、NL2Repo、DSBench-Hard)。整体看就是 Opus 4.8 同级选手。

    对 Fable 5:CyberGym 打平(83.3 vs 83.1)、Automation-Bench 反超(31.8 vs 29.1),但 DeepSWE(62.7 vs 70)、HLE、DSBench 落后明显。能打,但旗舰之座还没抢到。

    2. 相比预览版:全面碾压

    所有 10 项全部大幅上涨,不是单项突破。DeepSWE 从 12.8 → 62.7、Automation-Bench 从 12.8 → 31.8、CyberGym 从 52.7 → 83.3。说明这次正式版是整体后训练质量跃迁,不是某个测试集上的特调。

    3. 短板很明确:知识推理和复杂代码库

    HLE(人类最后考试,纯知识推理)42.7 vs Opus 49.8、NL2Repo(自然语言建仓)61.5 vs 69.7、DSBench-Hard 67.2 vs 71.7。复杂推理仍是 DeepSeek 的软肋,和 Claude 系旗舰有 6-8 分的稳定差距。

    4. 性价比维度:这才是真正的碾压

    注意上面这些对比对象的价格:Opus 4.8 输出约 $25/M 级别,Fable 5 更是顶级定价。而 Pro-0813 输出只要 6 元人民币/M。性能同一档,价格差几十倍——这才是"性价比屠夫"的完整含义。


    五、能力清单:一个能"动手"的模型

    正式版在接口能力上几乎拉满,核心规格如下:

    项目规格
    模型版本 DeepSeek-V4-Pro-0813
    上下文长度 1M tokens
    最大输出 384K tokens
    思考模式 支持非思考 + 思考模式(默认)
    JSON Output 支持
    Tool Calls(工具调用) 支持
    Responses API 支持
    Anthropic API 兼容 支持
    FIM 补全(Beta) 支持(仅非思考模式)
    并发限制 500

    几个值得单独说的地方:

  • 1M 上下文 + 384K 输出:在国产模型里属于头部水平,处理大型代码库、超长文档、多步骤 Agent 任务,基本不用再手动切分上下文了。

  • 双格式兼容:同时提供 OpenAI 格式(https://api.deepseek.com)和 Anthropic 格式(https://api.deepseek.com/anthropic)。这意味着你从 Claude 迁移过来,几乎可以无缝切换。

  • 思考模式可开关:默认开思考,但支持关闭。对 Agent 类请求,思考强度会被自动推到最高档,这是为工具调用和复杂推理专门设计的。


  • 六、价格:白菜价还能维持多久?

    价格永远是 DeepSeek 的杀手锏。官方定价(单位:元 / 百万 tokens):

    项目价格
    输入(缓存命中) 0.025 元
    输入(缓存未命中) 3 元
    输出 6 元

    对比一下国际上的参考价(OpenRouter):输入约 $0.435 / M,输出约 $0.87 / M。DeepSeek 官方的这个定价,尤其是缓存命中只要 0.025 元,配合 1M 上下文,对长文档、长对话场景的成本优势是碾压级的。

    但有一个必须注意的预警:官方定价页明确标注——“计划近期整体上调 DeepSeek API 服务的定价,预计涨幅较大”。也就是说,这个白菜价是窗口期,不是常态。要上车的话,现在是性价比最高的阶段。


    七、这波更新,对开发者意味着什么?

    总结成三句话:

  • 如果你在做 AI Agent / 自动化编程:DeepSWE 62.7 的成绩说明,这个模型是真的能"上手干活"了,值得认真评测进生产链路。

  • 如果你在用 Claude / OpenAI 的 API:Anthropic 格式兼容 + 1M 上下文 + 价格优势,是一个值得评估的替换或降本选项。

  • 如果你想赶在涨价前囤量:官方已明确预告涨价,当前价格是明确的窗口期。


  • 八、怎么用?一行代码的事

    模型名不变,直接调:

    POST https://api.deepseek.com/chat/completions
    {
    "model": "deepseek-v4-pro",
    "messages": […]
    }

    想用 Anthropic 格式的,把 base URL 换成 https://api.deepseek.com/anthropic 即可。


    数据来源:DeepSeek 官方 API 文档(模型 & 价格页)、DeepSeek 官方 Agent 评测对比表、快科技、澎湃新闻、网易、新浪财经、凤凰网科技、36氪、财联社等公开报道,截至 2026 年 8 月 13 日。

    赞(0)
    未经允许不得转载:网硕互联帮助中心 » DeepSeek-V4-Pro 正式版突袭上线:Agent 能力暴涨,DeepSWE 直接干翻 Claude Opus 4.8
    分享到: 更多 (0)

    评论 抢沙发

    评论前必须登录!