Claude Opus 5 是什么?
Claude Opus 5 是美国 AI 公司 Anthropic 于 2026 年 7 月 24 日发布的顶级通用 AI 模型。'通用'指同一个模型能广泛处理写代码、总结文档、资料调研、操作电脑等工作;'前沿(frontier)'是业界对当下技术最领先模型的称呼。
Anthropic 最聪明的模型是 Fable 5,而 Opus 5 以约一半的价格接近其智能水平。公司将其定位为'为每天使用而设计'的模型:Claude Max 的默认模型,也是 Claude Pro 上可用的最强模型。
开发者可在 Claude API 上以模型名 claude-opus-5 直接调用。此外还提供速度约 2.5 倍的 Fast 模式,以两倍基础价格换取更快的响应。
价格不变,性能提升
价格为每百万输入 token 5 美元、每百万输出 token 25 美元。token 是 AI 读写文本时计数的单位,大致一个英文单词约 1~2 个 token。关键是:这与上一代 Opus 4.8 的价格完全相同。
也就是说,花同样的钱,产出质量更高。Anthropic 称其'以与 Opus 4.8 相同的成本大幅提升性能'。在大多数基准上,Opus 5 以更低成本取得更高分数。
模型带有 effort(努力)设置,让客户在更快回答与更深入思考之间选择。在 high、extra-high、max 档位下,Opus 5 的单位成本性能优于其他模型。
基准测试说明了什么
基准测试是让多个模型做同一批任务并打分的成绩单。Opus 5 尤其擅长软件开发、编程、计算机操作和业务自动化。
简单说:软件任务上以更低价格取得上一代两倍以上的分数;编程上以一半成本逼近最强模型峰值的 0.5% 以内。在像人一样点击、输入来操作电脑的 OSWorld 上,任何成本水平都排第一。
| 基准测试 | 领域 | 结果 |
|---|---|---|
| Frontier-Bench v0.1 | 软件工程 | 以更低成本取得 Opus 4.8 两倍以上的分数 |
| CursorBench 3.2 | 编程(智能体) | 最高 effort 下以一半成本达到 Fable 5 峰值的 0.5% 以内 |
| ARC-AGI 3 | 解决新问题 | 次优模型分数的 3 倍 |
| Zapier AutomationBench | 业务自动化(端到端) | 通过率约为次优模型的 1.5 倍 |
| OSWorld 2.0 | 计算机操作 | 在任何成本水平上均为全模型第一 |
| 有机化学 / 蛋白质(内部评测) | 科学研究 | 较 Opus 4.8 分别高 10.2 / 7.7 个百分点 |
作为智能体,它强在哪里
如今 AI 的价值主要不在一问一答,而在'智能体'方式——模型自行完成多步骤任务。Opus 5 在这方面明显更强。Anthropic 表示它更擅长'验证自己的工作并谨慎迭代'。
也就是说,它不是写完代码就停,而是自己运行、找出错误、再次尝试。衡量端到端完成业务任务的 AutomationBench 上,其通过率约为次优模型的 1.5 倍,正是同一逻辑。
它的计算机操作能力和视觉输出生成也有提升。对实际工作而言,它更像'一条指令就能自行处理多步'的助手。
对管理者的意义——以及局限
从管理角度看,重点不是性能本身,而是成本—性能的拐点。同样预算下性能翻倍,意味着去年因'太贵'而搁置的自动化,今年可能越过盈亏平衡点。'再看看'的有效期又缩短了。
在编程、计算机操作、重复性事务等耗费人力的领域,这一变化最先被感知。若评估落地,宜从'当前由人反复做、且模型能从头到尾完成'的工作入手。
但局限同样清楚。Anthropic 自己指出,Opus 5 在攻击性网络安全和生物学研究等专门领域落后于专用模型 Mythos 5(详见公司的 System Card)。通用最强并非样样最强——某些高风险、专业领域仍需其他工具。
如何开始使用
最简单的方式是订阅 Claude。开通 Claude Pro 或 Max 后,App 和网页的模型列表中会出现 Opus 5(Max 为默认),直接对话即可;需要更快响应时开启 Fast 模式。
开发者在 Claude API 中将模型名指定为 claude-opus-5 调用。按用量计费(每百万 token 输入 5 美元、输出 25 美元),需要更深推理时调高 effort。
首次在组织内落地时,建议先选一两个重复性任务,在小范围验证结果后再扩大。性能虽提升,但'把什么交给它'并核对结果,仍是人的工作。
