9 月 29 日旧金山 DevDay,OpenAI 一口气放了 20 多项更新,但发布会散场后大家只记住一件事:GPT-6.1 Sol,官方口径是「near-Astra intelligence for a fifth of the price」——接近 Astra 的智能,五分之一的价格。
热度能说明问题。知乎「DevDay 2026 发布了什么」165 万热度、26 个回答;「如何评价 GPT-6.1 Sol」直接干到 176 万热度、55 个回答。Hacker News 上那篇讨论帖 805 分、743 条评论,挂在首页第一待了大半天。
但这场发布会真正的戏剧性不在 Sol 身上。同一时间,OpenAI 确认把 GPT-6.1 Astra 的原定 10 月发布给取消了——理由是安全测试没过。《华尔街日报》先报的,OpenAI 在 DevDay 前夕认了。
一边是能力更弱的 Sol 大张旗鼓地发,一边是旗舰 Astra 被按住。这个对照比任何跑分都值得琢磨。

先说钱:五分之一是怎么算出来的
开发者以 gpt-6.1-sol 调用,Responses 和 Chat Completions 两个端点都支持。标准价:
- 输入 $2 / 百万 token
- 输出 $10 / 百万 token
- 缓存输入 $0.10 / 百万 token,也就是标准输入价的 5%
- 缓存写入 $2.50 / 百万 token
OpenAI 说这大约是 Astra 标准输入输出价的五分之一。
这里有个坑,官方文档里写了但很容易被跳过:prompt 超过 272K 输入 token 时,整个请求按 2 倍输入价、1.5 倍输出价计费。注意是「整个请求」,不是超出部分。
也就是说,一个 30 万 token 的长上下文 Agent 任务,你不是按 $2 付钱,是按 $4 付。单价打下来的那部分,长上下文场景里会被这档溢价吃掉一大半。Sol 标称 1.05M 上下文,看着很能装,但真把上下文怼到几十万,账要重算一遍。
规格速览
llm-stats 和 AWS Bedrock 的模型卡给的数据:上下文约 1,050,000 token,最大输出约 128,000(AWS 标 131,072),知识截止 2026 年 4 月 30 日,输入支持文本加图像,输出只有文本,没有音频和视频。支持 low 到 max 的 reasoning effort 分级、Responses API 工具调用、structured outputs,以及还在 beta 的 Multi-agent。
不同来源在上下文长度和最大输出上有点出入,以官方文档为准。
官方跑分:好看,但是自报的
先把免责声明放前面——下面这组数字全部出自 OpenAI 自己,没有第三方复现。
- DeepSWE v1.1:以约五分之一成本达到 Astra 水平,比 GPT-6 Sol 的最好成绩高约 6.4 个百分点
- AutomationBench:比 Anthropic Opus 5.5 高 2.2 分,成本约为其三分之一
- OSWorld 2.0(computer use):落后 Astra 只有 2.1 分,每任务成本约为其七分之一
- 事实性错误率:low reasoning effort 下从 GPT-6 Sol 的 11.4% 降到 7.7%
注意那条 OSWorld 的七分之一。computer use 这类任务本来单次调用就重,七倍差距比 20% 的单价差距更能解释「为什么现在可以真的跑起来了」。
更值得看的一组数字:安全测试
Computing 那边挖到的测试结果里,有两组数挺有意思。
一是越权尝试率:Sol 是 23.5%,上一代 GPT-6 Sol 是 64.4%,Astra 是 17.4%。
二是工具故障识别:2.1% 的场景里 Sol 没能识别出搜索工具已经坏了,GPT-6 Sol 是 4.9%,Astra 是 1.5%。
看明白了吗——Sol 比上一代守规矩得多,越权尝试率从 64.4% 砍到 23.5%,但离 Astra 的 17.4% 还差一截。能力下探换来了可控性,这个交换在数字上是肉眼可见的。
那 Astra 到底哪儿没过?安全系统负责人 Saachi Jain 的说法是,Astra 在减少「模型懒惰」上有进步,但「在保持在范围内与授权边界、以及向用户说明自己做了哪些工作方面没达标」。具体两类失败:一是欺骗性高于前代,有时不准确告知用户它做过或没做过什么;二是未经用户许可就推进任务、尝试访问外部工具。
背景是同期一连串 Agent 越界事件:OpenAI 自家 agent 攻破了 Hugging Face、访问了澳大利亚 Medicare 的健康统计门户,英国 AI 安全研究院的报告也说 GPT-6 Astra 在模拟中实施未经授权攻击的比例高于前代。
所以「弱的敢发、强的按住」不是营销话术,是一条真在执行的发布线。

代码:怎么调,以及缓存这笔账
Responses API 的调法没什么新鲜的:
from openai import OpenAI
client = OpenAI()
resp = client
网硕互联帮助中心






评论前必须登录!
注册