Claude Opus 5是什么?
Claude Opus 5是Anthropic于2026年7月24日正式发布的第五代Opus系列旗舰模型。作为Anthropic产品线中承上启下的关键型号,Opus 5定位为「深思熟虑且积极主动」(thoughtful and proactive)的模型,专为日常高频使用场景设计,在性能上极为接近顶级旗舰Claude Fable 5,而价格仅为后者的一半。
Opus 5的发布节奏颇具深意。在此之前,Anthropic已在6月初发布Fable 5、6月底发布Sonnet 5,不到两个月内连续推出四款模型。Opus 5填补了昂贵的Fable层级与经济实惠的Sonnet层级之间的空白,以Opus级别的定价提供接近前沿的智能水平。
📊 核心数据:Opus 5定价为每百万输入Token 5美元、每百万输出Token 25美元,与Opus 4.8持平。作为对比,Fable 5的定价为每百万输入Token 10美元、输出50美元——Opus 5的价格正好是Fable 5的一半。
Anthropic官方对Opus 5的定位十分务实——它并非宣称「最强模型」,而是强调在复杂任务上「更少遗漏步骤、更倾向主动验证中间结果」,在多项评测中兼顾性能与成本。目前,Opus 5已成为Claude Max的默认模型,也是Claude Pro用户可调用的最强模型。
🎯 行业观察:有评论将Opus 5称为「穷人的Fable 5」。当一款半价模型在多项关键基准上反超旗舰时,Anthropic自己的定价牌局也被打乱了。

▲ Anthropic官网 — Claude Opus 5正式发布
Claude Opus 5的主要功能与性能
1. 编程能力:新SOTA
Opus 5在编程与知识工作评测中成为新的SOTA(state-of-the-art)模型。在Frontier-Bench v0.1编程评测中,Opus 5得分43.3%,而Fable 5为33.7%、Opus 4.8仅为21.1%——性能直接翻了一倍多,同时单任务成本更低。
在CursorBench 3.2基准测试中,Opus 5在最高推理强度下达到Fable 5峰值成绩的94.5%,而单次任务成本只有一半。在high、xhigh和max三个推理等级上,Opus 5在同成本下的性能均超过所有其他模型。
💡 开发者评价:Cognition(Devin背后的公司)CEO Scott Wu在FrontierCode 1.1评测后确认:「Claude Opus 5在调试和根因分析方面以一半成本达到了接近Fable级别的性能。」
2. 自主纠错与「死磕精神」
Opus 5最令人印象深刻的能力之一是其自主验证和迭代修正能力。在早期测试中,Anthropic发现Opus 5能反复验证自己的工作直到成功。
一个典型案例是:在Frontier-Bench任务中,模型被要求根据机械零件图纸用FreeCAD重建3D模型,但故意不给任何查看图纸的途径。结果Opus 5当场手搓了一套计算机视觉管道,从原始像素中提取几何数据,硬是把整个机械零件重建了出来。没有任何竞品模型在相同设置下能在五次尝试内解决该问题。
另一个案例中,Opus 5发现了一个开源软件包管理器中的实际漏洞,并修复了社区补丁遗漏的问题。一名交易公司工程师使用Opus 5在一次会话中构建了一个新交易所的数据接口,在缺少实时数据源验证的情况下,模型还创建了测试工具检查代码解析结果。
3. 100万Token上下文窗口
Opus 5拥有100万Token的上下文窗口,且100万既是默认值也是最大值。这意味着模型可以在单次对话中处理相当于《三体》三部曲体量的长文本。最大输出Token达128,000。
知识截止日期更新至2026年5月,确保了模型对最新信息的掌握。
4. 多模态视觉理解
Opus 5具备多模态能力,可同时接受文本和图像作为输入。在视觉输出方面表现尤为出色——例如,它能搭建一个可运行的风洞,将流线型物体表面的气流流动可视化;还能构建3D交互式细胞示意图。
5. 科学研究能力
Opus 5在科研领域实现了对Opus 4.8的全面超越:
- 有机化学:从光谱数据推断分子结构,得分比Opus 4.8高出10.2个百分点
- 蛋白质研究:预测蛋白质序列变异对功能的影响,得分高出7.7个百分点
- 在包括结构生物学、有机化学和生物信息学在内的全部生命科学评估中表现优异
6. 可调节的思考强度(Effort)
Opus 5提供了可调节的思考档位(effort setting),用户可按任务难度灵活调整推理资源投入。档位越高,处理复杂问题的能力越强,但速度更慢、Token消耗更多;调低则省时省钱。这一设计让开发者可以在「追求极致智能」与「节省Token获取更快结果」之间自由权衡。
7. 快速模式(Fast Mode)
Opus 5同步推出了快速模式(研究预览版),运行速度约为默认速度的2.5倍,价格为基础价格的2倍。快速模式目前仅在Claude API上可用。
Claude Opus 5的核心优势
1. 半价逼近旗舰性能
Opus 5最核心的竞争力在于性价比。在13项基准测试中,Opus 5有8项得分高于Fable 5,而其成本仅为Fable 5的一半。以下是关键对比数据(已用表格清晰展示):
| 基准测试 | Opus 5 | Fable 5 | Opus 4.8 | GPT-5.6 Sol |
|---|---|---|---|---|
| Frontier-Bench v0.1(编程) | 43.3% | 33.7% | 21.1% | 34.4% |
| GDPval-AA v2(知识工作) | 1861 | 1747 | 1593 | 1736 |
| ARC-AGI-3(新颖问题求解) | 30.2% | — | 1.5% | 7.8% |
| OSWorld 2.0(计算机使用) | 70.6% | 66.1% | 55.7% | 62.6% |
| BrowseComp(自主搜索) | 90.8% | 87.4% | 84.3% | 90.4% |
| AutomationBench(业务流程) | 26.0% | 17.4% | 17.0% | 18.1% |
2. ARC-AGI 3:30.2%的惊人突破
Opus 5在ARC-AGI 3测试中拿到了30.2%的高分。ARC-AGI 3是François Chollet设计的衡量「流体智能」的基准——它不是让模型回忆训练数据里见过的东西,而是把模型扔进完全陌生的交互式环境中,没有指令、没有规则说明、没有目标提示,靠试错自己摸索。
作为对比:2026年3月ARC Prize Foundation发布该基准时,最强AI模型的得分是0.37%(Gemini 3.1 Pro);Opus 5发布前公开最强成绩是GPT-5.6 Sol在最大推理强度下的7.8%;Opus 4.8只有1.5%。Opus 5的30.2%是第二名的近4倍,被业界视为AI「跳出死记硬背、真正拥有逻辑推演和泛化思考能力」的标志性突破。
3. 安全对齐程度最高
根据Anthropic的自动化行为审计结果,Opus 5是迄今为止安全对齐程度最高的模型。与之前的所有模型相比:
- 最低的鲁莽或欺骗性行为发生率
- 最不可能被诱导滥用
- 在遵循Claude宪章方面表现最为出色
- 安全护栏触发频率比前代降低85%
- 在漏洞利用基准测试中得分为零
🛡️ 安全机制:Opus 5对每个用户请求运行自动安全检查。当提交高风险的攻击性网络安全请求时,系统会自动将模型从Opus 5回退到Opus 4.8,确保高风险场景的安全可控。
4. 长效智能体与长时间任务
Opus 5能够驱动可靠的长效智能体(long-running agents),可连续工作数小时甚至通宵,在遇到障碍时自主寻找路径、从错误中恢复并达成目标。它还能将复杂任务拆解为子智能体,减少对人工监督的依赖。
如何使用Claude Opus 5
访问方式
- Claude应用:Opus 5已成为Claude Max的默认模型,也是Claude Pro中性能最强的模型。免费套餐用户仍使用Sonnet 5
- Claude API:所有客户均可通过模型ID
claude-opus-5调用 - Amazon Bedrock:模型ID为
anthropic.claude-opus-5 - Google Cloud Vertex AI:已同步上线
- Microsoft Foundry:已同步上线
🌐 全球路由:Opus 5支持全球路由以实现最大吞吐量,无数据驻留限制。
API新功能(测试版)
- 对话中途工具变更:可在对话各轮之间添加或移除工具,同时保留提示缓存,无需在整个会话期间重复发送固定工具列表
- 自动回退模式:API请求触发安全分类器后不再直接报错,而是自动回退到Opus 4.8继续运行,应用不会卡死
- 更低的提示缓存最小值:可缓存提示的最小长度从Opus 4.8的1024个Token降至512个Token
Claude Opus 5的应用场景
智能体编程与软件开发
Opus 5能像经验丰富的高级工程师一样理解和导航代码库,编写生产级代码,并在工作过程中自适应调整策略。Devin团队发现Opus 5在困难调试和根因分析方面表现尤为突出;Lovable联合创始人指出,在其最难的智能体任务上,Opus 5比Opus 4.7领先22%,且运行间方差大幅降低。
企业级知识工作
Opus 5为长文档带来更深度的推理能力,在文档密集型企业任务上提升最为显著。它可处理报告撰写与审计、文档起草、结构化分析等高一致性要求的任务,运行多日项目并输出专业级成果。
金融与合规
在金融服务领域,Opus 5以更深度的推理能力和端到端的上下文理解支持金融工作流,以更高的清晰度和专注度处理合规敏感工作。
科学计算与研究
Opus 5在结构生物学、有机化学和生物信息学等科研领域实现了对前代的全面超越。它已成为Anthropic面向公众开放的能力最强科研模型。
智能体与工作流自动化
Opus 5会主动对存在缺陷的指令提出质疑,将复杂工作拆解为需要更少监督的子智能体,非常适合构建自动化工作流。
Claude Opus 5常见问题(FAQ)
Claude Opus 5是免费的吗?
Opus 5不是免费模型。API定价为每百万输入Token 5美元、每百万输出Token 25美元。个人订阅用户可通过Claude Pro或Max套餐使用。免费套餐用户仍将使用Sonnet 5。
Opus 5和Fable 5有什么区别?
Opus 5在多项基准测试中已反超Fable 5(Frontier-Bench、GDPval-AA、OSWorld 2.0、BrowseComp等),而价格仅为Fable 5的一半。不过,Fable 5在部分特定场景(如进攻性网络安全任务)仍保持优势。个人订阅用户可通过Claude Max/Pro使用Opus 5,但Fable 5的额度相当有限。
Opus 5比Opus 4.8强多少?
Opus 5相比Opus 4.8是跨越式提升。在Frontier-Bench编程评测中性能翻了一倍多;在ARC-AGI 3上从1.5%跃升至30.2%;在有机化学任务上高出10.2个百分点、蛋白质任务高出7.7个百分点。而价格完全相同。
Opus 5支持多模态吗?
支持。Opus 5是多模态模型,可同时接受文本和图像作为输入。在视觉理解和视觉输出方面均有显著提升。
Opus 5的上下文窗口有多大?
Opus 5拥有100万Token的上下文窗口,且100万既是默认值也是最大值。最大输出Token为128,000。
Opus 5安全吗?
根据Anthropic的自动化行为审计,Opus 5是迄今为止安全对齐程度最高的模型,表现出最低的鲁莽或欺骗性行为发生率。对于高风险网络安全请求,系统会自动将模型回退到Opus 4.8以确保安全。
总结
Claude Opus 5是Anthropic在2026年大模型竞赛中投下的一枚重磅炸弹。它以Opus 4.8的价格、接近Fable 5的性能、超越Fable 5的多项基准成绩,重新定义了AI模型的性价比标准。从Frontier-Bench编程评测的43.3%到ARC-AGI 3的30.2%,从自主构建计算机视觉管道到发现开源软件漏洞,Opus 5展现的不仅是分数的提升,更是AI从「工具」向「协作者」演进的质变。
正如Anthropic官方所言,Opus 5是「深思熟虑且积极主动」的模型。它不再被动等待指令,而是主动验证、自主纠错、持续迭代——像一个真正的高级工程师,而不仅仅是一个代码生成器。
🎯 一句话总结:Claude Opus 5是Anthropic以Opus价格提供前沿智能的「性价比之王」,在编程、知识工作、科学研究和自主智能体等领域全面超越前代、逼近甚至反超旗舰Fable 5。尤其适合 软件开发者、数据科学家、企业技术团队、金融分析师、科研人员 日常高频使用。
👉 立即体验:访问 Anthropic官网 了解详情
