云计算百科
云计算领域专业知识百科平台

890 字节/token:DeepSeek-V4.1-Flash 发布,长上下文 Agent 的内存账单被砍到 1/4

💡 一句话总结:9 月 10 日 DeepSeek 开源了 V4.1-Flash——552B 参数、1M 上下文、原生看图、MIT 随便商用;核心卖点是全新 CED 架构把 KV cache(模型处理长上下文时最吃内存的那块账单)压到每 token 890 字节,官方还顺手宣布 V4 Pro 「性能全面被它超越」将被路由下线。发布事实很硬,跑分是官方自测,独立复现还得再等等。

做 Agent 开发的同学最近大概率被两件事折磨过:上下文越塞越长,账单越拉越高;想自托管个开源模型,一算 KV cache 的显存直接劝退。为什么长上下文这么贵?因为注意力机制要给每个 token 存一份「中间记忆」(KV cache),上下文翻倍、这份记忆就翻倍,显存和成本跟着翻倍。

9 月 10 日,DeepSeek 发布的 V4.1-Flash 就是冲着这份账单来的:模型卡标题不藏着掖着,就叫《Pushing the Limits of KV Cache Compression》(把 KV cache 压缩推到极限)。

想自己动手?

  • 🤗 权重与技术报告:Hugging Face · DeepSeek-V4.1-Flash(MIT 许可)
  • 📄 API 更新公告:DeepSeek API 更新日志
  • 💰 价格表:模型与价格

📦 这次到底发了什么

先把基本盘摆清楚:V4.1-Flash 是一个 552B 主干参数的 MoE 模型(混合专家架构,总参数很大但每个 token 只激活一小部分上场),上下文窗口 1M token,最大输出 384K,原生支持图像理解——视觉编码器是从零训练的,不是外挂的。

几个对开发者直接有用的点:

  • 调用名是 deepseek-flash:旧的 deepseek-v4-flash、deepseek-v4-flash-vision-exp 已经下线,暂时路由到新模型,按 Flash 价格计费——老代码不用改就能白嫖升级。
  • MIT 许可:权重和代码都放开商用,Hugging Face 可下。
  • 第三方 Day-0 跟进:SiliconFlow 发布当天即上线托管,WorkBuddy 等应用侧也快速接入。
  • 支持 1–100 连续推理强度(reasoning_effort,控制模型「想多深」的旋钮),用推理成本换精度,按需调。

值得注意的是发布节奏:8 月 21 日才上线实验版 Vision-Exp,20 天后就掏出换架构的正式版——这个迭代速度在开源圈相当罕见。

🔧 CED 架构:让「前台」替「执行层」记笔记

这次架构上的大动作叫 CED(Causal Encoder-Decoder,因果编码器-解码器):40 层模型劈成两半——20 层因果编码器 + 20 层解码器。关键改动在于:解码器的全局 KV cache 不再由各解码层自己生成,而是直接从编码器最后一层的隐状态投影过来。

听着绕?打个比方:以前团队里每个执行的人都要自己从头听一遍客户会议、各记一本笔记(每层解码器各存一份 KV);现在改成前台助理先把会议完整听一遍、整理出一份纪要,执行层的每个人拿纪要干活就行——笔记从「人手一份」变成「共享一份」,存储自然下来了。

实际效果是:prefill(读输入)时只激活 8B 参数,decode(生成输出)时激活 16B。输入越长的 Agent 型工作负载,这个设计越占便宜——因为 Agent 场景恰恰是「读得多、写得少」。

官方架构成果图:左为 Agent 基准表现,右为各代 DeepSeek 模型 KV cache 对比

图说:右图是重点——全局 KV cache 每 token 字节数从 DeepSeek-V1 到 V4.1-Flash 一路下探,V4.1-Flash(最右侧)约为上代 V4-Flash 的 1/4、初代 V1 的 1/437。

🗜️ 压缩三板斧:890 字节是怎么来的

KV cache 压到 890 字节/token,靠的是三件套叠加:

  • SWA Bounded Replay:滑窗注意力(SWA)的 KV 不再写 SSD 硬盘暂存,需要时只重放最近窗口内的 token 重建——省掉硬盘 I/O,持久化 KV 只剩上代约 1/8。
  • CSA2 稀疏注意力:给每层注意力静态分配 Full / Reindex / Reuse 三种模式之一,跨层共享主 KV 和索引器、复用 Top-K 稀疏索引;深层的索引成本不再随上下文长度增长。
  • FP4 KV 缓存:主 KV 用 4-bit 浮点(E2M1 格式)存储,每 16 个通道配一个缩放因子——这是 890 字节这个数字的最大功臣。

各来源在这点上口径一致:官方模型卡、the-decoder、MarkTechPost 的转述都指向同一组数字。需要留意的是「890 字节」是全局 KV cache 的均值口径,不同层、不同模式下的实际占用会有差异——拿它做容量规划时别直接线性外推。

📊 跑分:亮点很亮,但先看清楚谁测的

官方基准(max 档推理强度)里最抢眼的是 Agent 编码类:

  • Terminal-Bench 2.1:90.6,压过对比表里所有对手——Opus-5.0(89.1)、GPT-5.6 Sol(88.8)、K3(88.3)、GLM-5.3(88.2)
  • DeepSWE v1.1:74.2、CyberGym 88.1、AutomationBench 54.8、Agent's Last Exam 31.8,均为表内第一
  • Codeforces Rating 3471,也是表内最高

但把整张表看完,短板同样清楚:HLE 只有 36.8(Opus-5.0 是 56.3,差得不是一点半点);Terminal-Bench 3.0/4.0 这类高难档位(30.0/31.2)明显落后 Opus-5.0(43.3/51.8);NL2Repo-Bench、ProgramBench 也未登顶。

官方 Agent 基准对比图

图说:官方放出的 Agent 类基准对比,V4.1-Flash(深色)在 TB2.1、DeepSWE 等中低难任务领先,高难任务与 Opus-5.0 仍有差距。

三点澄清帮你定位这些数字:其一,全部是官方自测,用的是自研 DeepSeek Harness 极简模式,第三方独立复现目前还没有;其二,官方自己放的多 scaffold 对比表显示,同一模型换不同测试框架分数差异不小(DeepSWE 从 67.6 到 74.2 不等)——说明这类 benchmark 对 harness 敏感,跨厂商比较要留个心眼;其三,小细节:NL2Repo-Bench 分数在 HuggingFace 模型卡写 64.0、在 API 更新日志写 65.4,两处官方口径对不上 (uncertain),虽然不影响大局,但说明「官方数字」也值得多看一眼。

至于社区反应:Hacker News 讨论帖 935 分、517 条评论,热度足够说明关注度;已有用户表示主力项目全量跑在 DeepSeek Flash 上,也有博客提醒「吞吐约 2–4 倍提升是官方口径,暂无独立分数」。上一代 V4-Flash 在 Reddit 有过「细节处不可靠」的反馈——换架构之后稳定性如何,还得让子弹飞一会儿。

💰 价格:输出价打到 V4 Pro 的三成,V4 Pro 直接「毕业」

这次真正让存量用户坐直的,是价格表和一句官方宣布。新价格(每百万 token,空闲/高峰时段):

  • 输入(缓存命中):0.02 / 0.04 元
  • 输入(缓存未命中):1 / 2 元
  • 输出:4 / 8 元
  • 并发上限:2500(V4 Pro 是 500)

对比 V4 Pro 原价(输入未命中 4.5/9 元、输出 13.5/27 元),输出价约为其 30%,并发还翻了五倍。高峰时段指北京时间工作日 9–12 点、14–18 点,其余时间半价。

更激进的是这句:「经多方测试,V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro,因此我们计划有序下线 V4 Pro」。9 月 14 日 12 点之后,所有 deepseek-v4-pro 的请求会被路由到 V4.1-Flash,按 Flash 价格计费,直到未来的 V4.1 Pro 上线。

这里有个值得咂摸的行业信号:自家 1.6T 参数的旗舰档,被 552B 的「小杯」以官方名义整体替代——「更大激活参数=更高档位」这条老公式,在 Agent 负载主导的时代开始松动了。当然,「全面超越」的判定标准官方没有展开 (uncertain),把它理解为产品策略+技术事实的混合表述更稳妥。

🧭 对不同人的意味

把话说明白:这次发布对不同场景的实际影响不一样。

  • API 用户:9 月 14 日后无感切换+降价,纯利好;但依赖 V4 Pro 特有行为的同学留意一下输出风格变化,以及 V4.1 Pro 空窗期的时间表官方尚未给出。
  • 自托管玩家:KV cache 1/4 意味着同显存能扛更长上下文或更多并发——890 字节/token 的量级,让单卡跑长上下文 Agent 服务从「勉强」变「从容」。
  • 做 Agent 产品的团队:1M 上下文 + 输出 4–8 元/百万 token + 2500 并发,长任务(整库重构、全天候监控类)的成本模型值得重算一遍。
  • 国产模型竞品:MIT 许可 + Agent 基准第一梯队 + 激进定价,这组合的压力会直接传导到下一轮各家发布里。

至于发布当天的背景噪音——同日美方机构发布针对中国 AI 公司的蒸馏指控公告——与本次发布并无因果关联,但恰好说明了这类开源发布的行业敏感度。另外路透社近日还报道 DeepSeek 正筹备科创板 IPO(目标估值约 5000 亿元人民币,未经公司确认)——商业层面,它也到了要用收入证明模式的时候。

总的说来:发布事实(开源、架构、降价、路由下线)全部有一手来源、站得住;跑分领先是官方自测、方向可信但幅度待独立验证;「全面超越 V4 Pro」介于技术判断和产品话术之间。对你而言,最实际的动作可能就一个:9 月 14 日之前,把自己账单里的 deepseek-v4-pro 检查一遍。


参考来源

  • DeepSeek-V4.1-Flash 官方模型卡(一手/官方)— https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
  • DeepSeek API 更新日志 2026-09-10(一手/官方)— https://api-docs.deepseek.com/zh-cn/updates
  • DeepSeek 官方定价页(一手/官方)— https://api-docs.deepseek.com/zh-cn/quick_start/pricing/
  • the-decoder 报道(权威媒体)— https://the-decoder.com/new-deepseek-model-v4-1-flash-cuts-memory-needs-for-ai-agents
  • MarkTechPost 报道(行业媒体)— https://www.marktechpost.com/2026/09/10/deepseek-ai-released-deepseek-v4-1-flash-with-1m-context-fp4-kv-cache-and-cross-layer-attention-reuse
  • Hacker News 讨论(社区,935 分/517 评论)— https://news.ycombinator.com/item?id=49639090
  • SiliconFlow Day-0 上线公告(生态/官方)— https://x.com/SiliconFlowAI/status/2098054160176545821
  • orcarouter 新旧对比(垂直博客,含「缺独立分数」提醒)— https://www.orcarouter.ai/blog/deepseek-v4-1-flash-vs-deepseek-v4-flash
赞(0)
未经允许不得转载:网硕互联帮助中心 » 890 字节/token:DeepSeek-V4.1-Flash 发布,长上下文 Agent 的内存账单被砍到 1/4
分享到: 更多 (0)

评论 抢沙发

评论前必须登录!