DeepSeek-V4-Pro 正式版突袭上线:Agent 能力暴涨,DeepSWE 直接干翻 Claude Opus 4.8
8 月 12 日深夜,DeepSeek 悄悄在 API 文档里上架了一个新版本号——DeepSeek-V4-Pro-0813。第二天(13 日),这个版本被确认为 V4 Pro 正式版。没有发布会,没有预热,只改了版本号,就把整个 AI 圈的注意力又抢了过去。
一、发生了什么:一次"改版本号"式的正式发布
事情的开场很"DeepSeek":没有直播、没有 keynote,最先泄露风声的是官方 API 文档的"模型 & 价格"页面。眼尖的开发者发现,deepseek-v4-pro 的模型版本一栏,从预览版悄悄变成了 DeepSeek-V4-Pro-0813。
紧接着,官方群放出的评测对比表开始流传,各媒体跟进报道,正式版的身份才被坐实。
关键点:调用方式完全没变。 你不需要改任何代码,只要继续用 deepseek-v4-pro 这个模型名,API 返回的就是最新版。这对存量用户来说,等于一次"零迁移成本"的免费升级。
二、最炸裂的数字:DeepSWE 从个位数飙到 62.7
这次正式版最值得说的一件事,是 Agent(智能体)能力的质变。
在长周期、高复杂度的真实软件工程智能体基准测试 DeepSWE 上:
- 预览版(V4-Pro-Preview):得分仅 12.8
- 正式版(V4-Pro-0813):62.7
接近 5 倍的提升,而且直接超越了 Claude Opus 4.8(58.0)。
DeepSWE 是什么含金量?它是一个无污染的软件工程基准,使用严格验证器(误报率仅 0.3%),比传统的 SWE-bench 更接近"让 AI 真正在一个代码库里干活"的真实场景。能在这个测试上拿到 62.7,说明 DeepSeek 这次不是堆参数,而是在专门训练模型"当工程师"。
三、和自家 Flash 掰手腕:贵 3 倍,到底强在哪?
这是很多开发者最纠结的问题:DeepSeek 自家的两个正式版,到底该用哪个?
先看核心指标对比:
| DeepSWE | 54.4 | 62.7 |
| 输入(缓存命中) | 0.02 元 / M | 0.025 元 / M |
| 输入(缓存未命中) | 1 元 / M | 3 元 / M |
| 输出 | 2 元 / M | 6 元 / M |
| 并发限制 | 2500 | 500 |
结论很清晰:
Flash 是性价比之王:输入未命中 1 元、输出 2 元,只有 Pro 的三分之一价格,但 DeepSWE 也有 54.4 分(同样是从预览版的 7.3 暴涨上来的)。日常任务、高频调用、预算敏感的场景,Flash 完全够用。
Pro 是旗舰深度版:DeepSWE 62.7 压过 Flash 一头,整体能力(尤其复杂 Agent 任务、长上下文深度推理)更强,适合对质量要求更高的生产场景。
一句话总结:默认用 Flash 跑量,复杂任务上 Pro。 两者价格差 3 倍,能力差距没那么悬殊,按需切换是最聪明的用法。
四、到底什么水平?官方 10 项基准原表全解析
这是大家最关心的问题:V4-Pro-0813 到底处于什么水平?官方放出的 Agent 相关评测对比表(对标本家预览版/Flash 版 + Claude Opus 4.8 + Fable 5),数据如下:

| HLE (wo/w tools) | 42.7/60.0 | 37.8/51.5 | 37.7/48.2 | 49.8/57.9 | 53.3/63.0 |
| Terminal Bench 2.1 | 87.9 | 82.7 | 72.1 | 85.0 | 88.0 |
| NL2Repo | 61.5 | 54.2 | 38.5 | 69.7 | — |
| CyberGym | 83.3 | 76.7 | 52.7 | 78.3 | 83.1 |
| DeepSWE | 62.7 | 54.4 | 12.8 | 58.0 | 70.0 |
| Toolathlon-Verified | 74.1 | 70.3 | 55.9 | 76.2 | 77.9 |
| Agents’ Last Exam | 25.7 | 25.2 | 16.5 | 25.7 | — |
| Automation-Bench | 31.8 | 25.1 | 12.8 | 27.2 | 29.1 |
| DSBench-FullStack | 71.1 | 68.7 | 41.8 | 71.6 | 77.2 |
| DSBench-Hard | 67.2 | 59.6 | 31.1 | 71.7 | 68.3 |
四个关键结论
1. Agent 能力:和 Opus 4.8 同档,逼近 Fable 5
10 项基准里,Pro-0813 在 4 项上超过 Opus 4.8(DeepSWE、Terminal Bench 2.1、CyberGym、Automation-Bench),3 项打平(Agents’ Last Exam 同为 25.7、DSBench-FullStack 71.1 vs 71.6 几乎没差),3 项落后(HLE、NL2Repo、DSBench-Hard)。整体看就是 Opus 4.8 同级选手。
对 Fable 5:CyberGym 打平(83.3 vs 83.1)、Automation-Bench 反超(31.8 vs 29.1),但 DeepSWE(62.7 vs 70)、HLE、DSBench 落后明显。能打,但旗舰之座还没抢到。
2. 相比预览版:全面碾压
所有 10 项全部大幅上涨,不是单项突破。DeepSWE 从 12.8 → 62.7、Automation-Bench 从 12.8 → 31.8、CyberGym 从 52.7 → 83.3。说明这次正式版是整体后训练质量跃迁,不是某个测试集上的特调。
3. 短板很明确:知识推理和复杂代码库
HLE(人类最后考试,纯知识推理)42.7 vs Opus 49.8、NL2Repo(自然语言建仓)61.5 vs 69.7、DSBench-Hard 67.2 vs 71.7。复杂推理仍是 DeepSeek 的软肋,和 Claude 系旗舰有 6-8 分的稳定差距。
4. 性价比维度:这才是真正的碾压
注意上面这些对比对象的价格:Opus 4.8 输出约 $25/M 级别,Fable 5 更是顶级定价。而 Pro-0813 输出只要 6 元人民币/M。性能同一档,价格差几十倍——这才是"性价比屠夫"的完整含义。
五、能力清单:一个能"动手"的模型
正式版在接口能力上几乎拉满,核心规格如下:
| 模型版本 | DeepSeek-V4-Pro-0813 |
| 上下文长度 | 1M tokens |
| 最大输出 | 384K tokens |
| 思考模式 | 支持非思考 + 思考模式(默认) |
| JSON Output | 支持 |
| Tool Calls(工具调用) | 支持 |
| Responses API | 支持 |
| Anthropic API 兼容 | 支持 |
| FIM 补全(Beta) | 支持(仅非思考模式) |
| 并发限制 | 500 |
几个值得单独说的地方:
1M 上下文 + 384K 输出:在国产模型里属于头部水平,处理大型代码库、超长文档、多步骤 Agent 任务,基本不用再手动切分上下文了。
双格式兼容:同时提供 OpenAI 格式(https://api.deepseek.com)和 Anthropic 格式(https://api.deepseek.com/anthropic)。这意味着你从 Claude 迁移过来,几乎可以无缝切换。
思考模式可开关:默认开思考,但支持关闭。对 Agent 类请求,思考强度会被自动推到最高档,这是为工具调用和复杂推理专门设计的。
六、价格:白菜价还能维持多久?
价格永远是 DeepSeek 的杀手锏。官方定价(单位:元 / 百万 tokens):
| 输入(缓存命中) | 0.025 元 |
| 输入(缓存未命中) | 3 元 |
| 输出 | 6 元 |
对比一下国际上的参考价(OpenRouter):输入约 $0.435 / M,输出约 $0.87 / M。DeepSeek 官方的这个定价,尤其是缓存命中只要 0.025 元,配合 1M 上下文,对长文档、长对话场景的成本优势是碾压级的。
但有一个必须注意的预警:官方定价页明确标注——“计划近期整体上调 DeepSeek API 服务的定价,预计涨幅较大”。也就是说,这个白菜价是窗口期,不是常态。要上车的话,现在是性价比最高的阶段。
七、这波更新,对开发者意味着什么?
总结成三句话:
如果你在做 AI Agent / 自动化编程:DeepSWE 62.7 的成绩说明,这个模型是真的能"上手干活"了,值得认真评测进生产链路。
如果你在用 Claude / OpenAI 的 API:Anthropic 格式兼容 + 1M 上下文 + 价格优势,是一个值得评估的替换或降本选项。
如果你想赶在涨价前囤量:官方已明确预告涨价,当前价格是明确的窗口期。
八、怎么用?一行代码的事
模型名不变,直接调:
POST https://api.deepseek.com/chat/completions
{
"model": "deepseek-v4-pro",
"messages": […]
}
想用 Anthropic 格式的,把 base URL 换成 https://api.deepseek.com/anthropic 即可。
数据来源:DeepSeek 官方 API 文档(模型 & 价格页)、DeepSeek 官方 Agent 评测对比表、快科技、澎湃新闻、网易、新浪财经、凤凰网科技、36氪、财联社等公开报道,截至 2026 年 8 月 13 日。
网硕互联帮助中心




评论前必须登录!
注册