
本文基于 Qwen3.8-Flash / Qwen3.8-Flash-Next 与 GLM-5.3-Flash(均发布于 2026-08-26)、Spring AI 2.0.1(当前稳定版)与 LangChain4j 1.19.0(事实核查于 2026-08-31)编写,事实来源包括 GitHub 官方仓库(QwenLM/Qwen3.8-Flash-Next)、阿里云百炼官方模型页、智谱官方发布信息与多家媒体交叉报道。文中价格均为发布时口径(GLM 促销价截至 2026-09-09),该领域迭代极快,请以官方文档为准。上一篇:Spring AI 2.0 vs LangChain4j 1.19:MCP 新规范竞速,Spring AI 慢在哪。还在 Spring AI 1.x 的读者,建议先过一遍升级实战。
开篇:8 月 26 日,深夜两声炸响
先看时间线,比模型本身还有戏剧性:
- 8 月 17 日,DeepSeek 新 API 价格生效:V4 全系启用峰谷分时计费,第三方核算显示高峰时段输出价格最高涨至旧价的 4.7 倍。大模型行业两年的"价格下行曲线",在这个夏天集体掉头。
- 8 月 26 日晚,阿里发布并同步开源 Qwen3.8-Flash:多模态 MoE,主模型 125B、每 token 仅激活 6B,官方称以 6B 的激活参数获得超越 Claude Opus 4.6 的性能,API 价格输入 1 元、输出 3 元(每百万 token,下同)。
- 同夜,更深夜,智谱上线并开源 GLM-5.3-Flash(320B-A18B):GLM-5 系列首个原生多模态模型,总参数 320B、激活 18B,在全球权威的 Artificial Analysis 综合智能指数(AA 指数)中拿到 57 分——与 Anthropic 最新的 Claude Opus 4.8 持平,定价却是 Opus 4.8 的零头。
- 彩蛋:GLM 这颗炸弹其实提前炸过一次。发布前,智谱把它以 ox-alpha 的匿名代号投放到 OpenRouter 和 OpenCode 上做盲测,上线即登顶 OpenRouter 调用量榜、刷新单日 tokens 用量纪录(媒体报道),被网友戏称为"牛来模型"——直到 8 月 26 日深夜才被官方认领。盲测流量全程跑在国产 AI 芯片上(摩尔线程、商汤等厂商随后官宣适配,据媒体报道)。
一边是行业涨价潮,一边是两家国产厂商同夜把"Opus 级能力"打到二十分之一的价格。这不是巧合,是信号:"对标 Opus"正在从旗舰模型的专利,变成 Flash(轻量)档的标配。
但对做应用的 Java 工程师来说,热闹之后是实际问题:两家都声称"对标 Opus",都是 MoE 低激活、都是 1M 上下文、都开源、都兼容 OpenAI 协议——**那到底接哪根线?**这篇文章把规格、架构、账单、接入代码一次讲透,最后给一棵决策树。
一、规格硬碰硬:先摆事实
| 总参数 | 125B(+51B N-gram Embedding) | 320B |
| 每 token 激活 | 6B | 18B |
| 架构 | MoE + GDN + 稀疏注意力 | MoE + 线性注意力 + 稀疏注意力 + mHC |
| 上下文 | API 版默认 1M;开源权重部署示例 256K | 1M |
| 多模态 | 原生(图像理解与生成) | 原生(图片、视频、文件输入) |
| 基准口径 | 官方称 6B 激活超越 Claude Opus 4.6 | AA 指数 57 分 = Claude Opus 4.8 |
| API 价格(每 M token) | 输入 ¥1 / 输出 ¥3 | 输入 $0.15 / 输出 $0.50 / 缓存 $0.03 |
| 对标模型价格 | — | Opus 4.8 为 $5 / $25,GLM 输入约为其 1/33 |
| 开源 | Qwen3.8-Flash-Next(Qwen4 架构预览) | MIT 协议,权重全量开放(zai-org/GLM-5.3-Flash) |
| 本地部署门槛 | 友好:llama.cpp GGUF、MLX、嵌入表可卸载主机内存 | 高:320B 权重 8bit 量化后仍需 300GB 级显存 |
| 协议兼容 | OpenAI + Anthropic 双协议(官方声明可接 Claude Code、Codex) | OpenAI + Anthropic 双协议(已接入 ZCode、清言、GLM Coding Plan) |
| 思考模式 | Qwen3 系 Flash 传统支持思考/非思考切换(以百炼文档为准) | 仅 enabled,不可关闭(reasoning_effort 可调档) |
| 训练成本 | 约为 Qwen3.7-Plus 的 1/9(官方口径) | 未披露;基于重新训练的独立基座 |
几个容易踩的辨析,先钉死:
1. Qwen 的"两个名字"不是笔误。 公开权重叫 Qwen3.8-Flash-Next(GitHub: QwenLM/Qwen3.8-Flash-Next),是"Qwen4 架构的早期预览",部署示例上下文 262144;而 API 上的 Qwen3.8-Flash(百炼/QwenCloud)是基于 Flash-Next 的生产版本,默认 1M 上下文并带官方内置工具(阿里云官方模型页)。选型时别混:看论文选 Next,跑业务选 API 版。
2. GLM-5.3-Flash 不是 GLM-5.3 的加速版。 GLM-5.3(8 月 14 日发布)沿用的是 GLM-5.2 的基座、靠后训练提升;而 Flash 是重新训练的独立基座(30T token 多模态预训练)。官方博客对它的定位一句话:“Frontier Intelligence, Flash Cost”——前沿智能,Flash 价格。
3. 两家对标的 Opus 不是一代。 Qwen 对标 Opus 4.6,GLM 对标 Opus 4.8。别直接拿两句宣传语互相比——下文基准一节单独说怎么读。
二、"激活 6B"到底省在哪:给 Java 工程师的 MoE 速成
不理解"激活参数",就看不懂这一夜两炸的技术含金量。用 Java 同行熟悉的方式讲:
传统稠密(Dense)模型像一个全员大会:模型有 125B 参数,每个 token 进来都要过全部 125B 参数的计算——相当于公司 200 人全进会议室讨论每一封邮件,不管邮件是关于财务还是食堂菜单。
MoE(Mixture of Experts)模型像一套按需点名的专家制度:参数分成若干"专家"(Expert)网络,每个 token 到来时由路由器(Router/门控)只点名少数几个相关专家参与计算,其余参数原地不动。计算成本近似正比于激活参数,而不是总参数。
所以 Qwen3.8-Flash 是"125B 的身材,6B 的饭量":知识容量按总参数存(存进显存),推理成本按激活参数算(算力、时间、电费)。这也是它能把 API 价格打到 1 元/百万输入的结构性原因——便宜不是补贴出来的,是架构省出来的。
GLM-5.3-Flash 同理,只是配方不同:320B 身材、18B 饭量。饭量是 Qwen 的 3 倍,但换来的知识容量和智能上限更接近前沿旗舰——这是两家哲学分野的根源,下一节展开。
两家还各自把"省"卷到了注意力层:
- Qwen 的 GDN + QSA:Gated DeltaNet 高效压缩历史信息,Qwen Sparse Attention(QSA)在微块(micro-block)粒度上用轻量索引器筛掉不重要的上下文——长序列注意力的计算量大幅下降。1M 上下文能按这个价格卖,注意力稀疏化是前提。
- GLM 的线性 + 稀疏交替:三层线性注意力与一层稀疏注意力交替堆叠,IndexPool 把 4 组 Indexer Key 加权压缩成 1 组——同样是在"注意力成本"上动刀。
- Qwen 还有一个巧招:N-gram Embedding(51B)。这块嵌入表不走 GPU 主计算,可以卸载到主机内存、用异步预取与模型计算重叠——相当于把一个 51B 的资料柜放在客厅,不占厨房的操作台,用时提前取。
一句话总结:这一夜两家都在告诉行业——长上下文的成本问题,正在被架构级创新正面拆解,而不是靠堆卡硬扛。
三、基准怎么读:57 分、6B 超 Opus,与"评测友好"的差距
先看 GLM-5.3-Flash 官方给出的六项 Coding/Agent 评测(对比 GLM-5.2 与 Claude Opus 4.8):
| Terminal Bench 2.1 | 84.3 | 81.0 | 85.0 |
| DeepSWE v1.1 | 63.4 | 46.2 | 58.0 |
| Agents’ Last Exam | 26.3 | 20.4 | 27.0 |
| AutomationBench | 48.8 | 26.2 | 41.0 |
| HLE w/ Tools | 55.3 | 54.7 | 57.9 |
| GDPval-AA v2 | 1773 | 1504 | 1582 |
DeepSWE、AutomationBench、GDPval 三项反超 Opus 4.8,其余贴身跟随——这是"AA 指数 57 = Opus 4.8"的底气。但注意两个来自官方口径的限定:
- Z.ai Code Bench 的 max 档上,GLM-5.3-Flash 正确率 29.0%(逼近 Opus 4.8 的 29.5%),但平均输出约 14 万 token——思考拉满的成本不小;复杂 Coding 上 GLM-5.3 本体(34.5%)仍更强。官方自己给的定位是:Flash 是"日常 Agent 任务的默认起点",极难任务(一次失败代价高)仍然上 GLM-5.3 或 Opus。
- Qwen 侧,"6B 激活超越 Opus 4.6"是官方宣传口径(媒体报道一致),开源技术报告确认了在编码与办公任务上强于 Qwen3.7-Plus。细节数据以官方博客与 tech_report 为准。
给 Java 工程师的读法(本博客一贯的纪律):
四、成本账:一个 Java Agent 服务的月账单模拟
拿一个典型场景算账:某 Java 后端的文档问答 + 客服 Agent,日均 50 万输入 token(多轮对话上下文重放占大头)、5 万输出 token,按 30 天计——月输入 1500 万、输出 150 万。
| Qwen3.8-Flash | ¥1/M | ¥3/M | ¥15 + ¥4.5 ≈ ¥19.5 |
| GLM-5.3-Flash 标准价 | $0.15/M | $0.50/M | $2.25 + $0.75 = $3(折合约 ¥22) |
| GLM 促销价(至 09-09) | $0.075/M | $0.25/M | $1.5 |
| Claude Opus 4.8 | $5/M | $25/M | $75 + $37.5 = $112.5(折合约 ¥810) |
三家价格口径不同币种,折算仅作量级示意。但结论非常清晰:
- 两家 Flash 月账单都在 20 元量级,Opus 在 800 元量级,差约 40 倍;
- GLM 的缓存输入 $0.03/M 值得专门设计:多轮 Agent 会话里系统提示词 + 工具描述 + 前几轮历史反复重放,缓存命中能把这些的边际成本打到 1/5;
- 提醒一句现实:DeepSeek V4 的峰谷分时计费(高峰输出价最高涨至旧价 4.7 倍)说明低价不保证永久,价格核算要留缓冲,别把 20 元/月写进 SLA。
另外一笔账要算在"账单外":思考 token 也计费。GLM-5.3-Flash 的 thinking 不可关闭(下一节细说),复杂 Agent 任务平均输出 14 万 token 的例子就是它的成本上限形态。批处理任务用 reasoning_effort 从低档起测,是官方给的成本纪律。
五、Java 接入实战:其实是一根线,两个插头
最好消息:两家都兼容 OpenAI 协议(也都额外兼容 Anthropic Messages 协议)。也就是说,你在 Spring AI / LangChain4j 里调 OpenAI 的那一套,换个 base-url 和 model 名就能跑——这是《2026 年了,Java 程序员做 AI 为什么不用转 Python》里"模型可换"架构的又一次现场验证。
5.1 Spring AI 2.0.1 路径
依赖还是那个 OpenAI starter,BOM 用当前稳定版 2.0.1:
<dependencyManagement>
<dependencies>
<dependency>
<groupId>org.springframework.ai</groupId>
<artifactId>spring-ai-bom</artifactId>
<version>2.0.1</version>
<type>pom</type>
<scope>import</scope>
</dependency>
</dependencies>
</dependencyManagement>
<dependencies>
<dependency>
<groupId>org.springframework.ai</groupId>
<artifactId>spring-ai-starter-model-openai</artifactId>
</dependency>
</dependencies>
接 Qwen(百炼 OpenAI 兼容模式)——注意 2.0 的配置键没有 .options 段(spring.ai.openai.chat.model,1.x 老写法 chat.options.model 已废弃,这正是升级篇里的高频踩坑点):
spring:
ai:
openai:
api-key: ${DASHSCOPE_API_KEY}
base-url: https://dashscope.aliyuncs.com/compatible–mode # 默认 completions-path /v1/chat/completions
chat:
model: qwen3.8–flash
接 GLM(Z.ai / 智谱开放平台):
spring:
ai:
openai:
api-key: ${ZAI_API_KEY}
base-url: https://api.z.ai/api/paas/v4
chat:
completions-path: /chat/completions # 注意:智谱兼容路径是 /v4 而非 OpenAI 默认的 /v1
model: glm–5.3–flash
这里有个真实的坑:Spring AI 默认把请求拼成 {base-url}/v1/chat/completions,而智谱的 OpenAI 兼容端点挂在 /v4 路径下——所以要么显式改 completions-path,要么 base-url 里带版本路径后自行核对拼出来的完整 URL。国内站端点为 open.bigmodel.cn(同样 /api/paas/v4),具体以智谱官方接入文档为准。
两家的差异在配置文件里就此消失,业务代码完全同构:
@Bean
CommandLineRunner flashDemo(ChatClient.Builder builder) {
return args -> {
var client = builder.build();
String answer = client.prompt()
.user("用一句话向 Java 程序员解释:MoE 模型的'激活参数'是什么")
.call()
.content();
System.out.println(answer);
};
}
想同时保留两根线?用两个 OpenAiChatModel Bean(各自 base-url/model),再套一层你自己的路由(按任务类型/成本上限分流)——这层"模型路由"做大就是企业 AI 网关的雏形,后面会专门写。
5.2 LangChain4j 1.19.0 路径
LangChain4j 的 baseUrl 语义是"拼上 /chat/completions 的完整前缀",和 Spring AI 的拼法不同,所以路径要写到 /v1(DashScope):
ChatModel qwen = OpenAiChatModel.builder()
.baseUrl("https://dashscope.aliyuncs.com/compatible-mode/v1")
.apiKey(System.getenv("DASHSCOPE_API_KEY"))
.modelName("qwen3.8-flash")
.build();
ChatModel glm = OpenAiChatModel.builder()
.baseUrl("https://api.z.ai/api/paas/v4")
.apiKey(System.getenv("ZAI_API_KEY"))
.modelName("glm-5.3-flash")
.build();
(API 细节随版本变化,以 LangChain4j 官方文档为准。)
5.3 坑清单:两家实测要注意的事
{
"model": "glm-5.3-flash",
"messages": [{
"role": "user",
"content": [
{"type": "image_url", "image_url": {"url": "https://example.com/ui.png"}},
{"type": "text", "text": "检查这个页面的布局问题,并给出修改方案"}
]
}],
"thinking": {"type": "enabled"},
"stream": true
}
六、选型决策树:接哪根线
把前文事实压成一棵树(从上往下走):
你的任务是什么形态?
├─ 批量简单任务(抽取/分类/OCR/翻译,量大、单价敏感)
│ → Qwen3.8-Flash(¥1 输入 + 思考可控,月账单压到极致)
├─ Coding / 多步 Agent(SWE、终端、自动化流水线)
│ → GLM-5.3-Flash(DeepSWE、AutomationBench 反超 Opus 4.8)
│ └─ 极难任务(一次失败代价高)→ 仍上 GLM-5.3 / Opus 档
├─ 需要看图/看视频改代码(视觉进循环)
│ → GLM-5.3-Flash(原生多模态 + 视觉 Coding Loop)
├─ 要私有化部署
│ → Qwen(GGUF/MLX/N-gram 嵌入表卸载,消费级硬件有戏)
│ └─ vs GLM:320B 权重 8bit 仍需 300GB 级显存,先掂量集群
├─ 已订阅 GLM Coding Plan
│ → 直接用 Flash(同订阅 3 倍额度,非高峰再打 5 折)
└─ 都要 / 不确定
→ 两根线都留着:ChatModel 抽象 + 你自己的模型路由
(这就是"别赌模型,赌架构")
三条个人观点,供参考:
结语
8 月 26 日深夜这两声炸响,与其说是两家国产厂商的对台戏,不如说是给整个行业划了条新水位线:Opus 级的能力坐标 + Flash 级的价格坐标,从此是"及格线"而非"天花板"。
而 Java 侧的答案其实很平静:两根线都插在同一个插座上。把你的 ChatModel 抽象、评测回归集、成本核算准备好,下个月再来一次"双炸",你换模型的动作应该只是一次 pull request 里的两行 diff。
网硕互联帮助中心



评论前必须登录!
注册