云计算百科
云计算领域专业知识百科平台

DeepSeek V4.1 Flash 发布开源,Harness v0.1.5同日适配

2026 年 9 月 10 日,DeepSeek 一次性放出了三样东西:V4.1 Flash 的模型权重(MIT 协议)、Agent 框架 DeepSeek Harness 的 v0.1.5、以及一个此前没被预告过的 xPU 内核 JIT 编译库 DeepJIT。模型、推理栈、Agent 框架三层同时开源,再加上一份保留峰谷机制的降价通知,这套组合拳的分量比单看参数表要大得多。

对开发者来说,这次发布里有两件事需要立即行动:一是 deepseek-v4-pro 的调用将在 9 月 14 日 12:00 起被自动路由到 V4.1 Flash 并按新价格计费;二是 Harness 的 v0.1.5 头号更新就是为这个模型做专项训练适配,意味着配套的 Agent 用法也有变化。

这篇文章按"规格拆解 → 成本结构 → 迁移清单 → 生态盘点"的顺序展开,尽量把官方通稿里被简化掉的部分补回来。

请添加图片描述

一、先拆规格:552B 这个数字会漏掉一层

官方口径是 “552B 参数 MoE”,但这个数字只算主干。完整渲染这套架构需要三个数字:

  • 552B:MoE 主干参数(对比 V4 Flash 是 284B);
  • 约 196B:Engram 条件记忆模块,位于第 1 层和第 14 层,稀疏访问,不计入官方 552B 口径;
  • DeepSeek-ViT:视觉编码器,原生多模态视觉理解所需。

三者加起来,总存储参数约 763B。据 MarkTechPost 的拆解报道,如果写技术文章时只报 552B,会漏掉 Engram 这一层——而它恰好是理解后面 KV Cache 为什么能压这么狠的关键之一。

MoE 结构层面:每层 1 个共享专家 + 384 个路由专家,每 token 激活 top-6。整体架构是全新的 Causal-Encoder-Decoder(CED),共 40 层,由 20 层因果编码器 + 20 层解码器组成。

激活参数是非对称的,这点值得单独拎出来:

阶段激活参数量
输入(编码)阶段 约 8B
输出(解码)阶段 约 16B

非对称激活配合 CED 的分层设计,是"输入侧便宜、输出侧贵"这一成本结构在架构层的来源。对做长文档理解、RAG 预填充密集的应用来说,输入阶段只激活 8B 是个实打实的成本利好。

上下文窗口最高 100 万 tokens。

二、成本结构的真正改写:890 字节/token 是怎么来的

发布材料里最容易被当成营销数字带过的一句话,是"KV Cache 相对初代缩小约 437 倍,HBM 需求降至 1/4、SSD 降至 1/8"。实际口径是:完整 1M 上下文只需约 0.9 GB KV Cache,平均每 token 约 890 字节。

这个数字不是靠单一技巧压出来的,而是三重机制叠加的结果。据 InfoQ 中文站的技术拆解,机制如下。

第一层:CSA2(Compressed Sparse Attention 2)

CSA2 替代了此前 V4 系列使用的 CSA + HCA 混合方案。核心变化是:每个注意力层被静态指定为三种模式之一——

  • Full:自己计算 main KV、投影 indexer K、选出新的 Top-K 索引;
  • Reindex:复用上游的 main KV 与 indexer K,但用自己的 indexer Q 重新打分;
  • Reuse:直接复用上游的 main KV 与 Top-K 索引,完全跳过 indexer 计算。

跨层共享 main KV 和 indexer K,并复用 Top-K 稀疏索引,配合 Hierarchical Sparse Indexer,让深层注意力的开销与上下文长度解耦。这是"层数越深越贵"这一传统认知被打破的地方——深层的注意力几乎不再随序列长度线性增长。

第二层:FP4 主 KV 缓存

主 KV Cache 使用 FP4 存储,具体是 E2M1 格式,每 16 个通道配一个 E4M3 的 scale。这一步直接把缓存位宽砍到 4 bit 量级。值得注意的是,FP4 KV 与 CSA2 都需要非标准 kernel 支持——这正好解释了同日开源 DeepJIT 的动机,后面会讲。

第三层:SWA Bounded Replay

滑窗注意力(Sliding Window Attention)的 KV 不再持久化,而是在需要时重建(bounded replay)。用计算换显存,把滑窗部分的常驻开销归零。

请添加图片描述

“分层复用 + 低精度 + 有界重放"这套组合,是这次发布里技术上最值得细看的一段。它的直接后果是:长文本推理的显存瓶颈从"放不下 KV Cache"变成了"KV Cache 几乎不占地方”,单卡能支撑的并发会话数和上下文长度都被重新划定了边界。

三、基准:反超是真的,但有一个明显的反例

官方自测数据(均为厂商口径):

基准V4.1 Flash对照
DeepSWE v1.1 74.2 V4 Pro 62.7;Claude Opus 5 74.0
Codeforces 3471
GPQA Diamond 90.9
Terminal-Bench 2.1 90.6
MathArena Apex 65.6
HLE 36.8 仍落后于 Opus 5

Agent 类与代码类基准全面超过 DeepSeek-V4-Pro-0813,部分超过 Claude Opus 5——"Flash 反超自家 Pro"这个说法在这些项目上是成立的。

但**"全面超越"在难题推理上不成立**。HLE(Humanity’s Last Exam)只有 36.8,仍落后于 Opus 5。写选型报告时把这个反例点出来,比笼统地说"全面领先"要可信得多。

另一个必须标注的 caveat:发布时第三方评测机构(Artificial Analysis)尚未出独立测评,上表全部为厂商自测口径。厂商自测与第三方复现之间的差距在历史上并不小,正式选型前建议等独立数据。

四、价格:两套互相矛盾的口径,动手前请核实 changelog

这是本次发布里最容易被写错的一块,值得花篇幅说清楚。

流传最广的中文媒体版本(据腾讯云开发者、新浪财经、凤凰科技、IT之家等报道):空闲时段缓存命中 0.02 元 / 未命中 1.0 元 / 输出 4.0 元,高峰翻倍,9 月 10 日 12:00 生效;对比旧价 0.05 / 1.5 / 4.5,缓存命中降幅约 60%。

但 businesstimescn 的一篇文章指出这个流传版本有三处错误:

  • 计价单位应为美元而非人民币;
  • 颗粒应为每百万 token 而非"次";
  • 分时计价的生效日是 2026-08-16,而非 9/10。
  • 该文给出的 V4 Flash 官方美元价为:

    项目空闲时段高峰时段
    缓存命中输入 $0.007 $0.014
    缓存未命中输入 $0.22 $0.44
    输出 $0.66 $1.32

    这两套口径很可能对应 8 月与 9 月两次不同的调价事件被混为一谈。据 businesstimescn 分析,这种情况下的正确做法是以官方 changelog 为准,并明确标注币种口径。本文不复刻那个广为流传的版本,也不把它当成定论——动手改代码前请自行核对官方定价页。

    峰谷机制的真实价差比"高峰翻倍"要陡峭得多。 同一时段内,缓存命中输入与未命中输入的单价差距达 31.4 倍(0.007 vs 0.22 美元),输出与缓存命中输入的差距约 94.3 倍。而高峰时段只覆盖每周 168 小时中的约 35 小时(不到 20%,周一至周五北京时间 9:00–12:00、14:00–18:00)。

    这个结构意味着:对缓存密集型应用,命中率比模型选型更决定账单。客服、知识库问答、固定 system prompt 的 Agent 长会话——这些场景的成本几乎完全由缓存命中率主导。这也正是"把缓存命中价压到 0.02 元"这个动作的真实商业含义:它奖励的不是"用哪个模型",而是"有没有把 prompt 前缀设计成可缓存的"。

    请添加图片描述

    五、迁移清单:这不是一次普通的下线

    如果你有生产环境在调 deepseek-v4-pro,下面这几条需要立刻处理。

    时间线与影响面

    • deepseek-v4-pro 原定下线时间推迟到北京时间 2026-09-14 12:00;
    • 下线后,deepseek-v4-pro 的请求自动路由至 V4.1 Flash,并按新单价计费;
    • API 名改为 deepseek-flash,旧的 V4 Flash 与 V4 Flash Vision Exp 下线。

    争议点(据凤凰科技报道)

    • 从通知到下线不足 48 小时;
    • 没有并行迁移期——不存在新旧模型同时可用、可灰度对比的窗口;
    • 消息通过社区群而非官方 API changelog 发布。

    对照组被反复提及:OpenAI 关停 Sora API 时提前了 6 个月通知。另有科研团队反映,其研究基于 DeepSeek-V4-Pro-0813,模型撤下后实验无法复现——这是"模型下线"对学术复现性的直接影响。

    内测期已知 bug:英文提问偶尔返回中文;开启联网搜索时存在语言不一致问题。这两个问题在迁移评估时值得重点压测。

    迁移动作建议

    # 迁移前:显式指定旧模型名,9/14 后会被静默路由到 V4.1 Flash
    client.chat.completions.create(
    model="deepseek-v4-pro", # ⚠️ 9/14 12:00 起自动路由至 V4.1 Flash
    messages=messages,
    )

    # 迁移后:显式使用新 API 名,避免依赖隐式路由
    client.chat.completions.create(
    model="deepseek-flash",
    messages=messages,
    )

    配套的检查项:

  • 锁版本:把所有硬编码的 deepseek-v4-pro / deepseek-v4-flash-vision-exp 全部替换为 deepseek-flash,不要依赖自动路由——隐式路由意味着你的成本模型和输出分布会在某天凌晨静默改变。
  • 回归评测:趁着还没到 9/14,把线上的 prompt 集在 V4.1 Flash 上跑一遍。CED 架构 + 全新注意力机制意味着输出风格和长文行为都可能变化。
  • 重算预算:按上表的美元口径重新估算,特别注意缓存命中率对总账的影响权重。
  • 语言一致性压测:针对内测期已知的"英文提问返回中文"问题,在英文 prompt 上做一轮专项验证。
  • 留意 1M 上下文:长文档场景可以顺手把上下文窗口开大,成本结构已经和以前不一样了。
  • 六、Harness v0.1.5:模型与 Agent 框架开始协同设计

    同日的 DeepSeek Harness v0.1.5,核心就是针对 V4.1 Flash 的专项训练适配,覆盖三种 Harness 配置:标准模式、PTC(程序化工具调用)模式、极简模式。源码在 github.com/deepseek-ai/deepseek-harness。

    安装启动:已装 Node.js 的工具链可以直接跑:

    npx @deepseek-ai/dsh web

    这会启动 Web UI。

    v0.1.5 里最实用的一条更新:支持保留已有 KV Cache 的情况下更新系统提示词。对长会话 Agent 来说,这一条的实际意义是省掉改 system prompt 之后的全量重算——在缓存命中价与未命中价差 31.4 倍的价格结构下,这个特性的省钱效果可能比模型本身降价还明显。

    其余更新包括:文件上传与 Sidebar 预览、插件扩展入口标准化、长会话性能优化、子 Agent 双向通信,以及实验性 Agent Teams。

    Agent Teams 的几个细节:以实验性插件形式提供、默认关闭、需在命令行把插件加入 Profile 才能用,且会产生额外 token 消耗。官方后续计划做内置插件管理面板。

    插件生态已经长出多个第三方实现。在官方 Agent Teams 之外,社区已有:wowyuarm/dsh-agent-team(npm @wowyuarm/dsh-agent-team 0.1.7,在官方 Discussion #4303 “Show Your Plugins!” 板块明确标注非官方)、huxint/dsh-team(支持 /agent-teams <目标> 拉起队伍,maxTeammates 默认 8、maxChainHops 默认 4)、@nanmicoder/dsh-agent-teams(0.1.15,含 requirements→implementation→verification→review→integration 质量门)、dsh-ai-team、dsh-flat-teams 等。安装方式统一:

    dsh plugin –profile web add <包名>

    取向差异也值得注意:官方 Agent Teams 偏任务拆分与跟踪,社区版偏长期驻留与 human-in-the-loop。选型时按自己的流程需求挑。

    七、开源 ≠ 可得:2000 张 GPU 的门槛与社区反例

    权重以 MIT 协议发布于 Hugging Face 和 ModelScope,共 48 个分片,技术报告一并放出。MIT 意味着可商用,这是这套权重最实在的价值。

    但官方口径的自部署门槛约 2000 张 GPU 加存储集群。这是"能下载"与"能跑"之间的真实距离。

    社区已在尝试把这个门槛往下压:tonyd2wild/DeepSeek-V4.1-Flash-vLLM-DGX-Spark 用 4 台 NVIDIA DGX Spark、vLLM TP4(MXFP4 experts) 跑通,仓库里包含 Engram-on-disk patch、sm121 kernel 构建、启动脚本与实测数字。这类可复现的轻量部署尝试,是"开源 ≠ 可得"这个论述里最有价值的部分——官方给门槛数字,社区给反例。

    同日还开源了 DeepJIT——一个轻量级 xPU 内核 JIT 编译库。这一项不在最初的话题摘要里,但它其实是理解整盘棋的第三块拼图:V4.1 Flash 的 FP4 KV Cache 与 CSA2 都需要非标准 kernel 支持,JIT 编译库是否开源,直接决定第三方推理引擎(vLLM / SGLang)能不能低成本跟进适配。把它和权重、Harness 放在一起看,"模型 + 推理栈 + Agent 框架三层同时开源"的意图就清楚了。

    八、总结:这次发布真正改变了什么

    规格层面:552B MoE + 196B Engram + ViT 约 763B 存储参数,CED 架构(20 层编码 + 20 层解码),非对称激活(输入 8B / 输出 16B),1M 上下文。

    成本层面:890 字节/token 的 KV Cache 是这次最硬的技术成果。CSA2 三种层模式 + FP4 缓存 + SWA 有界重放,把长文本推理的显存结构改写了一遍。但要注意价格口径的混乱——币种、颗粒、生效日期都有矛盾版本流传,动手前请核实官方 changelog。

    选型层面:Flash 在代码与 Agent 基准上反超 Pro 是真的,HLE 36.8 落后 Opus 5 也是真的;且全部为厂商自测,第三方独立测评尚未出炉。

    生态层面:模型权重 MIT 开源、Harness 开源且已长出多个社区插件、DeepJIT 补齐推理栈——这是国产模型冲击开发者入口最完整的一次组合,但它同时也暴露出一个短板:不足 48 小时的迁移通知、没有并行期、走社区群发布。对已经上生产的团队,9 月 14 日 12:00 是个硬截止时间,这个周末得加班了。

    最后留一个观察点:模型与 Agent 框架协同设计这件事,V4.1 Flash + Harness v0.1.5 是第一个明确的样本。Harness 的三种模式(标准 / PTC / 极简)是跟着模型训练一起定的,这意味着以后选模型可能不只是选 API,而是选一整套 Agent 配置。这个趋势对开发者是好是坏,得看各家会不会走向"框架绑定"。

    参考链接

    • 模型权重:huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
    • Harness 源码:github.com/deepseek-ai/deepseek-harness
    • 插件讨论区:deepseek-harness/discussions/4303
    • 社区轻量部署:tonyd2wild/DeepSeek-V4.1-Flash-vLLM-DGX-Spark
    • CSA2 技术拆解(InfoQ 中文):infoq.cn/news/sbaJrAa8VTIRKIPCpKlo
    • 规格与基准拆解(MarkTechPost):marktechpost.com — DeepSeek-V4.1-Flash 发布解读
    • 定价口径澄清(businesstimescn):businesstimescn.com/articles/625824.html
    • 迁移争议报道(凤凰科技):tech.ifeng.com/c/8wIslCJisoh
    • Harness v0.1.5 说明(IT之家):ithome.com — Harness 0.1.5 更新
    • DeepJIT 开源(腾讯云开发者):cloud.tencent.cn/developer/article/2741287
    赞(0)
    未经允许不得转载:网硕互联帮助中心 » DeepSeek V4.1 Flash 发布开源,Harness v0.1.5同日适配
    分享到: 更多 (0)

    评论 抢沙发

    评论前必须登录!