云计算百科
云计算领域专业知识百科平台

Opus 5 八胜三负:Claude Fable 5 该不该换?

你手上有 Claude Fable 5 的 API Key,正在评估要不要切到 Claude Opus 5。11 个核心 benchmark,Opus 5 赢了 8 个输了 3 个——但输的那 3 个,恰恰是最不能忽略的那几个场景。

懒人版结论

决策维度Opus 5Fable 5胜者
综合智能 (AA Index) 61 (榜首) 60 Opus 5
Agent 编程 (Frontier-Bench) 43.3% 33.7% Opus 5
创新解题 (ARC-AGI 3) 30.2% 未公布 Opus 5
计算机操作 (OSWorld 2.0) 70.6% 66.1% Opus 5
知识工作 (GDPval-AA) 1861 Elo 1747 Elo Opus 5
代码修复 (DeepSWE v1.1) 68.8% 69.7% Fable 5
幻觉率 (AA-Omniscience) 50% 更低 Fable 5
安全评分 (Misalignment) 2.3 (历史最低) 更高 Opus 5
API 价格 (每M tokens) $5 / $25 $10 / $50 Opus 5
单任务成本 (AA数据) $2.03 $2.75 Opus 5
数据保留要求 30天 Opus 5

30 秒结论:预算敏感、追求编码智能和 Agent 能力的团队,Opus 5 明显更优;对幻觉容忍度低、做高精度代码修复的场景,需谨慎评估。


Opus 5 到底是什么定位

从定价策略就能看出 Anthropic 的意图。Opus 5 输入 $5、输出 $25(每百万 tokens),而 Fable 5 是 $10 / $50 —— Opus 5 直接打了五折。它的对手 GPT-5.6 Sol($5 / $30)也在同一档位。

Opus 5 还有个 “Fast mode”:$10 / $50,价格翻倍但速度快 2.5 倍。Anthropic 把速度也变成了商品——你要快,就加钱。

pricing = {
"Opus 5": {"input": 5, "output": 25},
"Opus 5 Fast": {"input": 10, "output": 50}, # 2x price, 2.5x speed
"Fable 5": {"input": 10, "output": 50},
"GPT-5.6 Sol": {"input": 5, "output": 30},
}

在 AA Intelligence Index 上,Opus 5 拿下了 61 分(排名第一),比 Fable 5(60 分)高出 1 分,也比 GPT-5.6 Sol(59 分)和 Kimi K3(57 分)领先。榜单头部的 1 分差距意味着能力质变。

所以呢:如果你的团队对 API 账单敏感,Opus 5 是当前按 AA Index 评分计算智能—价格比最优的选择之一。Fable 5 的价格完全没有竞争力。


全面对比 — 11 项 benchmark 全景

基准测试测试内容Opus 5Fable 5GPT-5.6 Sol
AA Intelligence Index 综合智力 61 60 59
Frontier-Bench v0.1 Agent 编程 43.3% 33.7% 34.4%
ARC-AGI 3 创新问题求解 30.2% 7.8%
OSWorld 2.0 计算机操作 70.6% 66.1% 62.6%
GDPval-AA v2 知识工作 (Elo) 1861 1747 1736
AA-Briefcase 综合能力 (Elo) 1720 1574
DeepSWE v1.1 代码修复 68.8% 69.7% 72.7%
AA-Omniscience 幻觉率 50% 更低 更低
单任务成本 经济性 $2.03 $2.75 $1.04
Misalignment 安全性 2.3 更高
数据保留 隐私 无要求 30天

Opus 5 在 8 项上领先,3 项上落后。但核心问题是:它输在哪,你有多在意?


哪里领先:编码与 Agent 的绝对统治

Frontier-Bench v0.1:Agent 编程碾压

Opus 5 得分 43.3%,比 Fable 5(33.7%)高出近 10 个百分点,比 GPT-5.6 Sol(34.4%)高出近 9 个百分点。这个基准测试的是模型自主编程能力——给定一个复杂任务,看它能在多大程度上独立完成。

frontier_bench = {
"Opus 5": 43.3, # +9.6pp vs Fable 5
"GPT-5.6 Sol": 34.4,
"Fable 5": 33.7,
}

所以呢:如果你在做 AI 辅助编程或 Agent 工作流,Fable 5 到 Opus 5 的迁移是能力质变。10pp 的差距在 coding agent 场景下就是「能跑通」和「跑不通」的区别。

ARC-AGI 3:创新解题断崖式领先

Opus 5 得分 30.2%,GPT-5.6 Sol 仅 7.8%——前者是后者的 3.87 倍。这是最能区分模型"真正智能"的测试之一,要求模型处理从未见过的模式识别问题。Fable 5 甚至没有公布在这个测试上的分数。

所以呢:如果你常遇到"文档里没有、训练数据里也没有"的 open-ended 问题,Opus 5 是目前唯一靠谱的选择。

OSWorld 2.0 + Safety:全面高于对手

OSWorld 2.0(计算机操作)Opus 5 得 70.6%,领先 Fable 5 的 66.1%,也高于 GPT-5.6 Sol 的 62.6%。这是 Computer Use 场景的关键测试。

安全方面,Opus 5 的 misalignment 评分 2.3 是史上最低,意味着它更少偏离用户意图。Classifier 干预比 Fable 5 减少约 85%,意味着合理请求被拒绝的概率大幅降低。不过需注意,Opus 5 在网络安全对抗方面仍落后于 Mythos 5。在隐私方面,Opus 5 无数据保留要求,而 Fable 5 有 30 天保留期——对合规要求高的团队这很关键。

所以呢:在需要模型操作 GUI、浏览器或执行复杂工作流的场景,Opus 5 更可靠。隐私方面也有优势。


哪里落后:幻觉、代码修复与成本

AA-Omniscience:50% 幻觉率——最大的隐忧

这是本文最重要的数据。在 AA-Omniscience 基准上,Opus 5 的幻觉率高达 50%,比 Opus 4.8 还高出 14 个百分点。也就是说,它生成的回答有一半存在事实性错误。Fable 5 虽然未公布具体数字,但已知更低。

Model Hallucination Rate
──────────────────────────────
Opus 5 50% ← 本文关键发现
Opus 4.8 36% ← 上一代反而更好
Fable 5 ? (未公布但已知更低)

Opus 5 的智能提升了,但幻觉问题显著恶化。这是性能提升的典型副作用——更强的生成能力意味着模型更"自信"地犯错。

所以呢:如果你做的是事实核查、文档生成或任何对准确性要求严格的场景,必须在 Opus 5 输出后加一层事实校验(RAG 或人工审核)。不要盲目信任。

DeepSWE v1.1:代码修复排名第三

Opus 5 在 DeepSWE v1.1 上得分 68.8%,不仅落后于 GPT-5.6 Sol(72.7%),也落后于 Fable 5(69.7%)。DeepSWE 和 Frontier-Bench 不同,它测试的是模型修复复杂代码仓库中真实 bug 的能力——更接近实际开发的场景。

所以呢:如果你的主要场景是阅读和修改已有代码,Fable 5 甚至 GPT-5.6 Sol 可能比 Opus 5 更合适。不要被 Frontier-Bench 的光鲜数据蒙蔽。

单任务成本:GPT-5.6 Sol 更经济

从 AA 数据看,Opus 5 每任务 $2.03,Fable 5 $2.75,但 GPT-5.6 Sol 仅 $1.04——几乎只有 Opus 5 的一半。你的主场景如果在 Sol 的能力范围内,成本优势非常明显。

Cost per task (AA benchmark):
Opus 5 $2.03
Fable 5 $2.75
GPT-5.6 Sol $1.04 ← 最经济

所以呢:做成本—效益分析时,不能只看 API 单价。单任务成本反映了实际支出——Opus 5 比 Fable 5 省钱,但 GPT-5.6 Sol 是成本最优解。


所以开发者该怎么选

选 Opus 5 的场景

  • 你需要顶级 Agent 编程能力(Frontier-Bench 43.3%)
  • 你处理的是开放性问题、新颖问题(ARC-AGI 领先近 4 倍)
  • 你需要低成本解决大量任务(比 Fable 5 便宜约 26%)
  • 你要求高安全性和低隐私风险

不选 Opus 5 的场景

  • 对幻觉零容忍——50% 幻觉率是硬伤
  • 核心工作是修复已有代码——DeepSWE 上排第三
  • 已经在 GPT-5.6 Sol 生态且能力够用——成本差一倍

def recommend(current_model, use_case):
if use_case == "agentic_coding":
return "Opus 5"
if use_case == "bug_fixing":
return "GPT-5.6 Sol"
if use_case == "low_hallucination":
return "考虑 Fable 5"
if use_case == "cost_first":
return "GPT-5.6 Sol"
return "Opus 5"


总结

Opus 5 是当前综合智能最强的模型之一,在编码、Agent、计算机操作和安全领域全面领先 Fable 5,且价格便宜一半。但 50% 的幻觉率和 DeepSWE 上第三名的表现说明它并非万能。没有完美的模型,只有最适合你场景的选择。

数据来源:Anthropic 官方发布、AA Intelligence Index、Frontier-Bench、ARC-AGI、OSWorld、DeepSWE 等公开基准测试数据。截至 2026 年 7 月。

赞(0)
未经允许不得转载:网硕互联帮助中心 » Opus 5 八胜三负:Claude Fable 5 该不该换?
分享到: 更多 (0)

评论 抢沙发

评论前必须登录!