Claude Opus 4
Anthropic · Claude 谱系 · 2025.05.22 发布 · 在 2 项基准上留有 2 条公开成绩。数字全部取自官方发布材料、第三方评测机构与站内已查证档案,评测口径(版本 / 算力档 / 脚手架)标在备注里;因训练数据污染撤榜的成绩不收录。仅作记录,不构成选型建议。
官方冠名「世界最强编码模型」,早测客户见证它连续七小时自主重构。从 3.5 的「答得好」到 4 的「干得完」,agent 时代的火药就位。
◈ 评分卡 SCORECARD
| 维度 | 基准 | 成绩 | 相对前沿 | 该维度当前最高 | 日期 |
|---|---|---|---|---|---|
| 编码 | SWE-bench Verified | 72.5% | 74.7 | Muse Spark 1.3 75.4% | 2025.05.22 |
◈ 身份卡 IDENTITY
| 实验室 LAB | Anthropic |
| 谱系 FAMILY | Claude |
| 发布日 RELEASE | |
| 定位 TIER | 旗舰 |
| 上下文 CONTEXT | 200K |
| 价格 PRICE | $15 / $75 每百万 token 输入 / 输出 |
| 权重 WEIGHTS | 闭源 CLOSED |
| 状态 STATUS | 在役 ACTIVE |
| 信源 SOURCE | www.anthropic.com/news/claude-4 |
| 站内档案 ARCHIVE | 档案 #17 » |
◈ 全部公开成绩 ALL RESULTS2 条
| 基准 | 分数 | 日期 | 口径 / 备注 | 信源 |
|---|---|---|---|---|
| SWE-bench Verified | 72.5% | 官方自报;并行计算加成下 79.4% | 原文 ↗ | |
| Terminal-Bench | 43.2% | 2025 年初版题库 · 官方自报 | 原文 ↗ |
◈ 同谱系 LINEAGEAnthropic · Claude · 由旧到新
◈ 相关档案 RELATED RECORDS按模型名在档案库检索 · 含正史与野史
Opus 4 与 Sonnet 4 同日双发,官方冠名「世界最强编码模型」:SWE-bench 72.5%,早测客户见证它连续七小时自主重构。Cursor 首发接入,随后 Sonnet 4 慢速池被挤停数日——需求超出了所有人的产能预估。
出口管制解除的同一天,Anthropic 加更 Sonnet 5:agent 能力接近 Opus 4.8,中档价再打 33% 折,Cursor 当日上架。旗舰尚未回岗,替补先把便宜的活全接了下来。
Opus 4.8 发布,Cursor 同日上架。值得立档的细节在别处:Anthropic 的官方公告直接拿 CursorBench 当成绩单——一家编辑器公司的内部评测,成了模型厂发布会的通用度量衡。
Opus 4.7 发布,Cursor 当日上架,价格照旧。真正的新闻藏在措辞里:官方承认它「不如 Mythos Preview 全面」——那个只向少数机构开放的受限旗舰,日后将以 Fable 5 之名面世。
十二天内三声枪响:11 月 12 日 GPT-5.1 打头,18 日 Gemini 3 进场,24 日 Opus 4.5 收官,三家实验室在同一个月里各自交出「史上最强编码模型」。榜首的保质期,从此开始按周计算。
Sonnet 4.5 发布,号称当时全球最强编码模型,价格不变;八周后 Opus 4.5 跟进,价格砍到上代的三分之一,Cursor 同步开「按 Sonnet 价试用」。最强称号,一个秋天换了两次持有人。