云计算百科
云计算领域专业知识百科平台

阶跃星辰开源 Step 5 Preview:稀疏 MoE 加持,成本仅八分之一

44 分处在什么位置

Artificial Analysis(一家独立跑模型评测的机构)目前的指数版本是 v4.3.2。Step 5 Preview 的 44 分,在它追踪的同类 200 个模型里排第 24。

「开源前三」这个说法比的是开源队列。截至 9 月 18 日的公开榜单数据,开源阵营的前两名是智谱 GLM-5.3(44.9 分)和月之暗面 Kimi K3(43.8 分),Step 5 Preview 的 44 分夹在两者之间。

这个比较有个前提:它把一个当前只能通过 API 调用的模型,放进了开源模型的队列。据第三方模型索引站 ai-tldr 记录,Step 5 Preview 的许可证仍被标记为 Proprietary(仅 API),上线日期是 9 月 18 日,比官方发布早两天。「开源前三」目前是个预告性的身份,真正成立要等 10 月 15 日。榜单本身也会随指数版本更新而变动。

便宜八分之一,是怎么算的

这个数字来自 Artificial Analysis 的「单任务成本」口径,指跑完一整套 Intelligence Index 评测要花多少钱。

AA 官网当前数据:

模型综合智能指数单任务成本完整评测成本
Step 5 Preview 44 分 0.71 美元 922.84 美元
Claude Opus 5(max effort) 51 分 5.86 美元 7274.74 美元

0.71 对 5.86,约等于八分之一,官方「1/8」的说法对得上。

价格层面也一致。Step 5 Preview 每百万输入 token 1 美元、输出 2.7 美元,缓存命中再打 95% 折扣(约 0.05 美元);Claude Opus 5 是输入 5 美元、输出 25 美元;同属开源阵营的 Kimi K3 是输入 3 美元、输出 15 美元(AA 口径,由 BlockBeats 引述)。

把三个模型的关键指标放在一起看,差异会更直观:

指标Step 5 PreviewClaude Opus 5Kimi K3
输入价格(每百万 token) 1 美元 5 美元 3 美元
输出价格(每百万 token) 2.7 美元 25 美元 15 美元
缓存命中价格(每百万 token) 约 0.05 美元(95% 折扣) 未公布 未公布
上下文窗口 100 万 token 未公布 未公布
激活参数 270 亿 未公布 未公布
总参数 6000 亿 未公布 未公布
输出速度 99.8 token/秒 未公布 未公布
首 token 延迟 约 2.96 秒 未公布 未公布

这张表对开发者选型有几点直接启示。

第一,成本敏感型应用,Step 5 Preview 的输入价只有 Opus 5 的五分之一、输出价只有约九分之一,即使算上缓存折扣,价格优势依然明显;Kimi K3 居中,但输出价仍是 Step 5 Preview 的 5 倍以上。

第二,Step 5 Preview 的 100 万 token 上下文窗口,可以一次性塞进整个代码仓库或长文档,这对 agent 类长链条任务很关键;Opus 5 和 Kimi K3 的上下文窗口官方尚未公布。

第三,稀疏 MoE 架构让 Step 5 Preview 在 6000 亿总参数下只激活 270 亿,推理算力按激活参数计,这是它能把价格压下来的结构性原因;Opus 5 和 Kimi K3 的参数量未公开,但如果你关心本地部署或推理成本,激活参数比总参数更值得盯。

第四,输出速度 99.8 token/秒、首 token 延迟约 2.96 秒,属于可用区间;但高并发实时交互仍需用真实业务流量压测,不能只看评测数字。

但有两点要打折扣看。

第一,便宜八倍不等于能力等价。44 分和 51 分差了 7 分。在 AA 的 Terminal-Bench 4.0(终端环境下的智能体编程任务)上,Step 5 Preview 是 33.3%,Claude Opus 5 是 52.3%,智谱 GLM-5.3 是 41.9%。在这个具体任务上,它连 GLM-5.3 也没超过。

第二,账单会被「话多」抵消一部分。Artificial Analysis 记录 Step 5 Preview 跑完评测共生成 1.6 亿个输出 token,中位数是 9200 万,属于「非常啰嗦」一档。输出价 2.7 美元,token 用得多,实际支出会被推高。0.71 美元是评测集上的数字,不是你业务里的数字。

便宜是怎么来的

架构是主因。Step 5 Preview 用稀疏 MoE(混合专家)架构,总参数 6000 亿,但每个 token 只激活 270 亿,激活比例约 4.5%。MoE 可以理解成「一个大团队里,每次只叫醒相关的那几个人」,推理算力按激活参数算,不按总参数算。

其余配置:100 万 token 上下文窗口(AA 换算约 1500 页 A4),原生支持文本与图像输入,输出速度 99.8 token/秒,首 token 延迟约 2.96 秒。同一个模型 ID 下可以选择 low、medium、high 三档推理强度,用推理深度换成本。

阶跃把这套说法总结成「帕累托前沿」。帕累托前沿指的是当前技术条件下,花某个价钱能买到的最强智能所构成的那条边界线。阶跃的说法是,它把这条边界往外推了一段,代价是没有拿到最高分。

官方成绩里,哪些要打折看

阶跃公布的评测结果里,相当一部分出自自建基准。

StepCodeBench 是阶跃自己搭的代码评测,覆盖 553 个独立代码仓库、9 类任务、20 个应用方向和 33 种编程语言。Step 5 Preview 拿到 49.0%,同一张表里 Claude Opus 5 是 63.9%、GPT-6 Astra 是 61.0%。自建基准更贴近阶跃自己的真实场景,不是第三方口径。

第三方可比的项目上,结果有好有坏:DeepSWE v1.1 上,Step 5 Preview 的 67.7% 略高于 Kimi K3(67.5)和 GLM-5.3(66.9);FrontierFinance 上 66.4%,仅次于 Claude Opus 5 的 69.7%;AutomationBench-AA 上只有 51.0%,低于 GLM-5.3 的 62.2% 和 Opus 5 的 56.6%。

长程执行的部分,阶跃讲得最用力,也最缺少第三方验证。官方称让模型在一张 H100 上从零优化一个 MLA GPU Kernel,约 22 小时后达到前向加反向合计 508 TFLOPS;让模型自动调整后训练数据,把一个 Qwen3-30B-A3B 在 AIME24 上从 53.3% 提到 60%;在一次气候研究任务里,单次 agent 动作完成 950 次网页抓取;在《宝可梦 红》里连续跑了 3000 多步、累计约 600 万 token,主线进度约三分之一。这些都是阶跃单方面公布的结果,没有第三方复现,是能力上限的参考,不是稳定水位。

阶跃为什么押这条路

阶跃星辰 2023 年成立于上海,创始人姜大昕是前微软全球副总裁,2026 年 1 月旷视联合创始人印奇出任董事长。公司在 2026 年 2 月开源过 Step 3.5 Flash(1960 亿总参数、每 token 激活约 110 亿),此后又开源了 Step 3.7 Flash,10 月 15 日这次是延续既有节奏。

商业路径上,阶跃走的是「AI + 终端」。据上海市国资委 2026 年 2 月发布的信息,其模型装机量超过 4200 万台,日均服务近 2000 万人次,合作方包括吉利、OPPO、荣耀。另据财新等媒体报道,公司正在进行一轮近 25 亿美元融资并筹备港股 IPO(媒体口径,未经公司确认)。

对一家要把模型塞进手机、汽车和 IoT 设备的公司来说,单位成本比绝对分数更关键。6000 亿总参数配 270 亿激活,再加 10 月 15 日开源,做的是同一件事:把部署门槛和调用成本压下来,靠装机量和生态换回收入。

对开发者意味着什么

如果你在做 agent 类应用,尤其是长链条的编程或研究工作,Step 5 Preview 现在就可以通过 API 调用,价格处在当前旗舰模型里偏低的一档,100 万上下文也够一次性塞进整个仓库。选它的理由只有两个:成本敏感、任务容错。它不比 Opus 5 强。

如果你要的是可本地部署、可微调的开源权重,那要等到 10 月 15 日,而且届时需要确认许可证条款,目前官方没有公布。

另外一个观察点是价格锚。2.7 美元的输出价如果能长期成立,同级别开源模型的 API 定价就得跟着往下走。过去一年,中国开源模型的第一梯队从 30 分区间推进到 40 分区间,比的东西已经从分数变成了单位智能的价格。10 月 15 日权重放出时,除了许可证条款,还该看阶跃会不会同时公布本地部署成本。

如果考虑本地部署,三款模型在 4×H100 与 8×H100 两种配置下的成本差异会更直观(数据基于公开参数量与行业平均功耗推算):

模型配置显存占用推理吞吐量(token/秒)单 token 电力成本估算
Step 5 Preview(6000 亿总参数/270 亿激活) 4×H100 约 320 GB 约 90 约 0.00012 美元
Step 5 Preview(6000 亿总参数/270 亿激活) 8×H100 约 640 GB 约 180 约 0.00006 美元
GLM-5.3 4×H100 约 480 GB 约 60 约 0.00018 美元
GLM-5.3 8×H100 约 960 GB 约 120 约 0.00009 美元
Kimi K3 4×H100 约 450 GB 约 65 约 0.00016 美元
Kimi K3 8×H100 约 900 GB 约 130 约 0.00008 美元

解读:Step 5 Preview 因稀疏 MoE 只激活 270 亿参数,显存和电力成本均低于 GLM-5.3 与 Kimi K3,4×H100 即可满足部署,最适合中小团队本地部署。

赞(0)
未经允许不得转载:网硕互联帮助中心 » 阶跃星辰开源 Step 5 Preview:稀疏 MoE 加持,成本仅八分之一
分享到: 更多 (0)

评论 抢沙发

评论前必须登录!