你手上有 Claude Fable 5 的 API Key,正在评估要不要切到 Claude Opus 5。11 个核心 benchmark,Opus 5 赢了 8 个输了 3 个——但输的那 3 个,恰恰是最不能忽略的那几个场景。
懒人版结论
| 综合智能 (AA Index) | 61 (榜首) | 60 | Opus 5 |
| Agent 编程 (Frontier-Bench) | 43.3% | 33.7% | Opus 5 |
| 创新解题 (ARC-AGI 3) | 30.2% | 未公布 | Opus 5 |
| 计算机操作 (OSWorld 2.0) | 70.6% | 66.1% | Opus 5 |
| 知识工作 (GDPval-AA) | 1861 Elo | 1747 Elo | Opus 5 |
| 代码修复 (DeepSWE v1.1) | 68.8% | 69.7% | Fable 5 |
| 幻觉率 (AA-Omniscience) | 50% | 更低 | Fable 5 |
| 安全评分 (Misalignment) | 2.3 (历史最低) | 更高 | Opus 5 |
| API 价格 (每M tokens) | $5 / $25 | $10 / $50 | Opus 5 |
| 单任务成本 (AA数据) | $2.03 | $2.75 | Opus 5 |
| 数据保留要求 | 无 | 30天 | Opus 5 |
30 秒结论:预算敏感、追求编码智能和 Agent 能力的团队,Opus 5 明显更优;对幻觉容忍度低、做高精度代码修复的场景,需谨慎评估。
Opus 5 到底是什么定位
从定价策略就能看出 Anthropic 的意图。Opus 5 输入 $5、输出 $25(每百万 tokens),而 Fable 5 是 $10 / $50 —— Opus 5 直接打了五折。它的对手 GPT-5.6 Sol($5 / $30)也在同一档位。
Opus 5 还有个 “Fast mode”:$10 / $50,价格翻倍但速度快 2.5 倍。Anthropic 把速度也变成了商品——你要快,就加钱。
pricing = {
"Opus 5": {"input": 5, "output": 25},
"Opus 5 Fast": {"input": 10, "output": 50}, # 2x price, 2.5x speed
"Fable 5": {"input": 10, "output": 50},
"GPT-5.6 Sol": {"input": 5, "output": 30},
}
在 AA Intelligence Index 上,Opus 5 拿下了 61 分(排名第一),比 Fable 5(60 分)高出 1 分,也比 GPT-5.6 Sol(59 分)和 Kimi K3(57 分)领先。榜单头部的 1 分差距意味着能力质变。
所以呢:如果你的团队对 API 账单敏感,Opus 5 是当前按 AA Index 评分计算智能—价格比最优的选择之一。Fable 5 的价格完全没有竞争力。
全面对比 — 11 项 benchmark 全景
| AA Intelligence Index | 综合智力 | 61 | 60 | 59 |
| Frontier-Bench v0.1 | Agent 编程 | 43.3% | 33.7% | 34.4% |
| ARC-AGI 3 | 创新问题求解 | 30.2% | — | 7.8% |
| OSWorld 2.0 | 计算机操作 | 70.6% | 66.1% | 62.6% |
| GDPval-AA v2 | 知识工作 (Elo) | 1861 | 1747 | 1736 |
| AA-Briefcase | 综合能力 (Elo) | 1720 | 1574 | — |
| DeepSWE v1.1 | 代码修复 | 68.8% | 69.7% | 72.7% |
| AA-Omniscience | 幻觉率 | 50% | 更低 | 更低 |
| 单任务成本 | 经济性 | $2.03 | $2.75 | $1.04 |
| Misalignment | 安全性 | 2.3 | 更高 | — |
| 数据保留 | 隐私 | 无要求 | 30天 | — |
Opus 5 在 8 项上领先,3 项上落后。但核心问题是:它输在哪,你有多在意?
哪里领先:编码与 Agent 的绝对统治
Frontier-Bench v0.1:Agent 编程碾压
Opus 5 得分 43.3%,比 Fable 5(33.7%)高出近 10 个百分点,比 GPT-5.6 Sol(34.4%)高出近 9 个百分点。这个基准测试的是模型自主编程能力——给定一个复杂任务,看它能在多大程度上独立完成。
frontier_bench = {
"Opus 5": 43.3, # +9.6pp vs Fable 5
"GPT-5.6 Sol": 34.4,
"Fable 5": 33.7,
}
所以呢:如果你在做 AI 辅助编程或 Agent 工作流,Fable 5 到 Opus 5 的迁移是能力质变。10pp 的差距在 coding agent 场景下就是「能跑通」和「跑不通」的区别。
ARC-AGI 3:创新解题断崖式领先
Opus 5 得分 30.2%,GPT-5.6 Sol 仅 7.8%——前者是后者的 3.87 倍。这是最能区分模型"真正智能"的测试之一,要求模型处理从未见过的模式识别问题。Fable 5 甚至没有公布在这个测试上的分数。
所以呢:如果你常遇到"文档里没有、训练数据里也没有"的 open-ended 问题,Opus 5 是目前唯一靠谱的选择。
OSWorld 2.0 + Safety:全面高于对手
OSWorld 2.0(计算机操作)Opus 5 得 70.6%,领先 Fable 5 的 66.1%,也高于 GPT-5.6 Sol 的 62.6%。这是 Computer Use 场景的关键测试。
安全方面,Opus 5 的 misalignment 评分 2.3 是史上最低,意味着它更少偏离用户意图。Classifier 干预比 Fable 5 减少约 85%,意味着合理请求被拒绝的概率大幅降低。不过需注意,Opus 5 在网络安全对抗方面仍落后于 Mythos 5。在隐私方面,Opus 5 无数据保留要求,而 Fable 5 有 30 天保留期——对合规要求高的团队这很关键。
所以呢:在需要模型操作 GUI、浏览器或执行复杂工作流的场景,Opus 5 更可靠。隐私方面也有优势。
哪里落后:幻觉、代码修复与成本
AA-Omniscience:50% 幻觉率——最大的隐忧
这是本文最重要的数据。在 AA-Omniscience 基准上,Opus 5 的幻觉率高达 50%,比 Opus 4.8 还高出 14 个百分点。也就是说,它生成的回答有一半存在事实性错误。Fable 5 虽然未公布具体数字,但已知更低。
Model Hallucination Rate
──────────────────────────────
Opus 5 50% ← 本文关键发现
Opus 4.8 36% ← 上一代反而更好
Fable 5 ? (未公布但已知更低)
Opus 5 的智能提升了,但幻觉问题显著恶化。这是性能提升的典型副作用——更强的生成能力意味着模型更"自信"地犯错。
所以呢:如果你做的是事实核查、文档生成或任何对准确性要求严格的场景,必须在 Opus 5 输出后加一层事实校验(RAG 或人工审核)。不要盲目信任。
DeepSWE v1.1:代码修复排名第三
Opus 5 在 DeepSWE v1.1 上得分 68.8%,不仅落后于 GPT-5.6 Sol(72.7%),也落后于 Fable 5(69.7%)。DeepSWE 和 Frontier-Bench 不同,它测试的是模型修复复杂代码仓库中真实 bug 的能力——更接近实际开发的场景。
所以呢:如果你的主要场景是阅读和修改已有代码,Fable 5 甚至 GPT-5.6 Sol 可能比 Opus 5 更合适。不要被 Frontier-Bench 的光鲜数据蒙蔽。
单任务成本:GPT-5.6 Sol 更经济
从 AA 数据看,Opus 5 每任务 $2.03,Fable 5 $2.75,但 GPT-5.6 Sol 仅 $1.04——几乎只有 Opus 5 的一半。你的主场景如果在 Sol 的能力范围内,成本优势非常明显。
Cost per task (AA benchmark):
Opus 5 $2.03
Fable 5 $2.75
GPT-5.6 Sol $1.04 ← 最经济
所以呢:做成本—效益分析时,不能只看 API 单价。单任务成本反映了实际支出——Opus 5 比 Fable 5 省钱,但 GPT-5.6 Sol 是成本最优解。
所以开发者该怎么选
选 Opus 5 的场景
- 你需要顶级 Agent 编程能力(Frontier-Bench 43.3%)
- 你处理的是开放性问题、新颖问题(ARC-AGI 领先近 4 倍)
- 你需要低成本解决大量任务(比 Fable 5 便宜约 26%)
- 你要求高安全性和低隐私风险
不选 Opus 5 的场景
- 对幻觉零容忍——50% 幻觉率是硬伤
- 核心工作是修复已有代码——DeepSWE 上排第三
- 已经在 GPT-5.6 Sol 生态且能力够用——成本差一倍
def recommend(current_model, use_case):
if use_case == "agentic_coding":
return "Opus 5"
if use_case == "bug_fixing":
return "GPT-5.6 Sol"
if use_case == "low_hallucination":
return "考虑 Fable 5"
if use_case == "cost_first":
return "GPT-5.6 Sol"
return "Opus 5"
总结
Opus 5 是当前综合智能最强的模型之一,在编码、Agent、计算机操作和安全领域全面领先 Fable 5,且价格便宜一半。但 50% 的幻觉率和 DeepSWE 上第三名的表现说明它并非万能。没有完美的模型,只有最适合你场景的选择。
数据来源:Anthropic 官方发布、AA Intelligence Index、Frontier-Bench、ARC-AGI、OSWorld、DeepSWE 等公开基准测试数据。截至 2026 年 7 月。
网硕互联帮助中心






评论前必须登录!
注册