云计算百科
云计算领域专业知识百科平台

2B开源决策模型:113毫秒拍板,笔记本能跑

113 毫秒,一个模型给出判断,期间没有生成一个字。

10 月 1 日,亚马逊 Strands Agents 团队开源了 Strands Decider 2B。权重放在 Hugging Face,代码、训练脚本和示例在 GitHub,Apache 2.0 协议,能在自己的 CPU 或 GPU 上直接跑。

它值得看一眼,是因为它想省掉的不是算力,而是"写字"这个动作本身。

它不写字,只在给定选项里挑一个

一句话说清:普通大模型是把答案写出来,决策模型是把几个候选答案摆到它面前,让它挑一个,再附上置信度。

它回答的是这类问题——急不急、继续还是停下、放行还是拦下,都不需要一句漂亮话,只需要一个判断。

官方结构给得很直白:底座是 Qwen3.5-2B,原来的文本生成头换成一个约 100 万参数的指针头,躯干用 rank-16 LoRA 微调;选项喂进去,一次前向出分数。这次开源的是 v20。

113 毫秒是官方给出的中位决策延迟;公开测试里,RTX 3090 上跑 230 次请求的中位延迟是 106 毫秒、95 分位 296 毫秒(含 HTTP 往返),M3 笔记本上做小任务约 150 毫秒。

拆开看:把嘴换成打分器

大模型当下做决定,路径是先把判断写进一段话,再从这段话里解析出结论。中间那段文字,既花 token,也花时间。

决策模型把这一段删掉了:不是先写再判断,而是直接判断。

代价也很清楚。它不会解释理由,没有句子就没有能读的推理过程,置信度成了唯一的体检指标。校准度好不好,决定你敢不敢把它放进流程。

放到场景里:agent 的高频决定都很小

一个 agent 跑任务,大部分时间在反复问几个很小的问题:要不要调这个工具、拿到的结果够不够好、要不要升级给更强的模型、要不要停下来问人。

这些步骤不需要文采,需要的是稳定、便宜、可预测。

把这类判断搬到自己机器上跑,省下的不只是 token 账单,还有每次往返云端的等待。它的意义不在榜单第几,而在判断这一步可以回到本地。

常见误区纠偏

误区一:又一个 2B 小模型开源,大模型要被替掉了。

这个说法有它的道理。同样一个判断,让大模型先写一段话再解析,确实是浪费。

但它解释不了复杂推理:决策模型不会拆解问题,也写不出一段解释,遇到难的部分只能把活交回去。亚马逊给的方向是混合结构,决策模型挑选项,大模型负责推导。

更准确的理解是,它替代的是流程里的判断步骤,不是模型本身。

误区二:开源加百毫秒延迟,说明可以直接上生产了。

有道理的地方在工程侧:Apache 2.0、权重、训练脚本、示例全给了,拿过来就能试,这在这类模型里并不常见。

但它解释不了准确率。公开榜单上,这个模型的上一版大约 72% 准确率、Brier 分数 0.35,而同尺寸的另一个开源决策模型约 76%、0.32。各家排名口径也不一样,有按同尺寸公开模型算的第二,也有只算不超过 2B 的第三。

更准确的理解:速度只是入场券,校准度才是能不能用的门槛。挑这类模型别只盯毫秒,先看它在你的选项集上会不会很自信地挑错。

对开发者、普通读者和行业,各改变了什么

对做 agent 的开发者,多了一个本地部署的路由部件,一次判断压到百毫秒级,不必每次都调云端大模型。

对普通读者,AI 变便宜的路径可能不是模型更强,而是大部分步骤不再写字。

对行业,两个星期就凑齐了这条赛道:先是 Jev 把概念带热,接着 OpenAI 限量放出按选项决策的接口,然后 Cloudflare 上线按百万 token 计费的两个版本,现在是 AWS 直接开源,连训练配方一起给出。项目作者说,这个细分市场小,做一个有竞争力的模型只要几百到几千美元。

AI 的账单里,最贵的往往不是思考,而是把思考写成句子。

如果觉得有用,点个在看让我知道;也欢迎转发给在学 AI 的朋友。

关注我,每天陪你聪明看世界 —— 看懂热搜,玩懂AI。

赞(0)
未经允许不得转载:网硕互联帮助中心 » 2B开源决策模型:113毫秒拍板,笔记本能跑
分享到: 更多 (0)

评论 抢沙发

评论前必须登录!