UMBRELLA 4365UMBRELLA 4365 · Cursor 战地纪实 CAPABILITY ASSAY · 能力评测

SWE-bench Verified

SWE-bench Verified 是由 OpenAI 人工核验的 500 道真实 GitHub 问题修复题,考察模型在真实代码库里独立完成修复的能力,是编码模型最常被引用的成绩单。本页汇总各实验室模型在该基准上的公开成绩,并标出「前沿线」——历史最高分每一次被刷新的时刻。数字全部取自官方发布材料、第三方评测机构与站内已查证档案,评测口径(版本 / 算力档 / 脚手架)标在备注里;因训练数据污染撤榜的成绩不收录。仅作记录,不构成选型建议。

模型 45 个成绩 46 条前沿刷新 15 次2024.08.13 → 2026.08.19

◈ 当前榜 CURRENT BOARD每个模型取最近一次公开成绩

#模型成绩相对前沿日期口径 / 备注
1 Claude Opus 5
Anthropic
97% 100 Vals AI 第三方统一 harness(bash-only)· 榜首 原文 ↗
2 DeepSeek-V4-Pro
DeepSeek
96.4% 99.4 V4-Pro-0813 · Vals AI 第三方统一 harness(bash-only)· 榜上第二、开源第一 原文 ↗
3 Claude Fable 5
Anthropic
95.5% 98.5 官方自报 原文 ↗
4 Claude Opus 4.8
Anthropic
88.6% 91.3 llm-stats 第三方 tracker(2026-06) 原文 ↗
5 Claude Opus 4.7
Anthropic
87.6% 90.3 llm-stats 第三方 tracker(2026-06) 原文 ↗
6 Claude Opus 4.5
Anthropic
80.9% 83.4 官方自报 原文 ↗
7 Claude Opus 4.6
Anthropic
80.8% 83.3 据 Gemini 3.1 Pro 发布对照 / llm-stats tracker 原文 ↗
8 Gemini 3.1 Pro
Google DeepMind
80.6% 83.1 官方发布对照 · 与 GPT-5.4 持平 原文 ↗
9 GPT-5.4
OpenAI
80.6% 83.1 据 Gemini 3.1 Pro 发布对照 原文 ↗
10 MiniMax-M3
MiniMax
80.5% 83 llm-stats 第三方 tracker(2026-06) 原文 ↗
11 Qwen3.7-Max
阿里 · Qwen
80.4% 82.9 第三方 tracker 观测(llmreference · 全榜第 9) 原文 ↗
12 MiniMax-M2.5
MiniMax
80.2% 82.7 官方自报 · Claude Code 脚手架 · 四次均值 原文 ↗
13 GPT-5.2
OpenAI
80% 82.5 xhigh 档 · 据智谱 GLM-5 发布对照表 原文 ↗
14 GPT-5.1-Codex-Max
OpenAI
77.9% 80.3 xhigh 档 · 官方自报 原文 ↗
15 GLM-5
智谱 · GLM
77.8% 80.2 官方自报 · OpenHands 口径(Thinking) 原文 ↗
16 Claude Sonnet 4.5
Anthropic
77.2% 79.6 官方自报;并行计算加成下 82.0% 原文 ↗
17 Kimi K2.5
月之暗面 · Kimi
76.8% 79.2 据智谱 GLM-5 发布对照表 · OpenHands 口径(Thinking) 原文 ↗
18 Gemini 3 Pro
Google DeepMind
76.2% 78.6 官方自报 原文 ↗
19 GPT-5
OpenAI
74.9% 77.2 官方自报(477 题可复现子集) 原文 ↗
20 Claude Opus 4.1
Anthropic
74.5% 76.8 官方自报 原文 ↗
21 GLM-4.7
智谱 · GLM
73.8% 76.1 官方自报 · OpenHands 口径 原文 ↗
22 DeepSeek-V4-Flash
DeepSeek
73.7% 76 技术报告自报(第三方 tracker 另录 79.0) 原文 ↗
23 Claude Haiku 4.5
Anthropic
73.3% 75.6 官方自报 原文 ↗
24 DeepSeek-V3.2
DeepSeek
73.1% 75.4 据智谱 GLM-5 发布对照表 · OpenHands 口径(Thinking) 原文 ↗
25 Claude Sonnet 4
Anthropic
72.7% 74.9 官方自报;并行计算加成下 80.2% 原文 ↗
26 Claude Opus 4
Anthropic
72.5% 74.7 官方自报;并行计算加成下 79.4% 原文 ↗
27 Kimi K2 Thinking
月之暗面 · Kimi
71.3% 73.5 官方自报 原文 ↗
28 grok-code-fast-1
xAI / SpaceXAI
70.8% 73 官方自报 · 内部 harness 原文 ↗
29 Qwen3-Coder
阿里 · Qwen
69.6% 71.8 480B-A35B-Instruct · 官方发布图表 · 无测试时扩展 原文 ↗
30 Qwen3-Max
阿里 · Qwen
69.6% 71.8 Instruct 版 · 官方自报(云栖大会) 原文 ↗
31 o3
OpenAI
69.1% 71.2 官方自报 原文 ↗
32 GLM-4.6
智谱 · GLM
68% 70.1 据 GLM-4.7 发布对照表 · OpenHands 口径 原文 ↗
33 DeepSeek-V3.1
DeepSeek
66% 68 官方更新日志自报 原文 ↗
34 Kimi K2
月之暗面 · Kimi
65.8% 67.8 官方自报 · agentic 单次 原文 ↗
35 GLM-4.5
智谱 · GLM
64.2% 66.2 官方自报 · OpenHands 脚手架 原文 ↗
36 Gemini 2.5 Pro
Google DeepMind
63.8% 65.8 官方自报 · 自定义 agent 配置 原文 ↗
37 Claude 3.7 Sonnet
Anthropic
62.3% 64.2 官方自报;自定义脚手架下 70.3% 原文 ↗
38 MiniMax-M1
MiniMax
56% 57.7 M1-80k · 官方自报 原文 ↗
39 GPT-4.1
OpenAI
54.6% 56.3 官方自报 原文 ↗
40 DeepSeek-R1
DeepSeek
49.2% 50.7 技术报告自报 原文 ↗
41 Claude 3.5 Sonnet
Anthropic
49% 50.5 10 月升级版(官方自报) 原文 ↗
42 o1
OpenAI
48.9% 50.4 o1 系统卡 · Agentless 脚手架 原文 ↗
43 DeepSeek-V3
DeepSeek
42% 43.3 技术报告自报 原文 ↗
44 GPT-4.5
OpenAI
38% 39.2 系统卡自报 原文 ↗
45 GPT-4o
OpenAI
33.2% 34.2 OpenAI 发布 Verified 子集时的基线成绩 原文 ↗

◈ 能力曲线 CAPABILITY CURVE

204060801002025.012025.072026.012026.07今日%GPT-4o · 33.2% · 2024-08-13 · OpenAI 发布 Verified 子集时的基线成绩Claude 3.5 Sonnet · 49% · 2024-10-22 · 10 月升级版(官方自报)o1 · 48.9% · 2024-12-05 · o1 系统卡 · Agentless 脚手架DeepSeek-V3 · 42% · 2024-12-26 · 技术报告自报DeepSeek-R1 · 49.2% · 2025-01-20 · 技术报告自报Claude 3.7 Sonnet · 62.3% · 2025-02-24 · 官方自报;自定义脚手架下 70.3%GPT-4.5 · 38% · 2025-02-27 · 系统卡自报Gemini 2.5 Pro · 63.8% · 2025-03-25 · 官方自报 · 自定义 agent 配置GPT-4.1 · 54.6% · 2025-04-14 · 官方自报o3 · 69.1% · 2025-04-16 · 官方自报Claude Sonnet 4 · 72.7% · 2025-05-22 · 官方自报;并行计算加成下 80.2%Claude Opus 4 · 72.5% · 2025-05-22 · 官方自报;并行计算加成下 79.4%MiniMax-M1 · 56% · 2025-06-16 · M1-80k · 官方自报Kimi K2 · 65.8% · 2025-07-11 · 官方自报 · agentic 单次Qwen3-Coder · 69.6% · 2025-07-22 · 480B-A35B-Instruct · 官方发布图表 · 无测试时扩展GLM-4.5 · 64.2% · 2025-07-28 · 官方自报 · OpenHands 脚手架Claude Opus 4.1 · 74.5% · 2025-08-05 · 官方自报GPT-5 · 74.9% · 2025-08-07 · 官方自报(477 题可复现子集)DeepSeek-V3.1 · 66% · 2025-08-21 · 官方更新日志自报grok-code-fast-1 · 70.8% · 2025-08-28 · 官方自报 · 内部 harnessQwen3-Max · 69.6% · 2025-09-24 · Instruct 版 · 官方自报(云栖大会)Claude Sonnet 4.5 · 77.2% · 2025-09-29 · 官方自报;并行计算加成下 82.0%Claude Haiku 4.5 · 73.3% · 2025-10-15 · 官方自报Kimi K2 Thinking · 71.3% · 2025-11-06 · 官方自报Gemini 3 Pro · 76.2% · 2025-11-18 · 官方自报GPT-5.1-Codex-Max · 77.9% · 2025-11-19 · xhigh 档 · 官方自报Claude Opus 4.5 · 80.9% · 2025-11-24 · 官方自报GLM-4.7 · 73.8% · 2025-12-22 · 官方自报 · OpenHands 口径GLM-4.6 · 68% · 2025-12-22 · 据 GLM-4.7 发布对照表 · OpenHands 口径MiniMax-M2.5 · 80.2% · 2026-02-12 · 官方自报 · Claude Code 脚手架 · 四次均值GPT-5.2 · 80% · 2026-02-12 · xhigh 档 · 据智谱 GLM-5 发布对照表GLM-5 · 77.8% · 2026-02-12 · 官方自报 · OpenHands 口径(Thinking)Kimi K2.5 · 76.8% · 2026-02-12 · 据智谱 GLM-5 发布对照表 · OpenHands 口径(Thinking)DeepSeek-V3.2 · 73.1% · 2026-02-12 · 据智谱 GLM-5 发布对照表 · OpenHands 口径(Thinking)Claude Opus 4.6 · 80.8% · 2026-02-19 · 据 Gemini 3.1 Pro 发布对照 / llm-stats trackerGemini 3.1 Pro · 80.6% · 2026-02-19 · 官方发布对照 · 与 GPT-5.4 持平GPT-5.4 · 80.6% · 2026-03-05 · 据 Gemini 3.1 Pro 发布对照DeepSeek-V4-Flash · 73.7% · 2026-04-24 · 技术报告自报(第三方 tracker 另录 79.0)Claude Opus 4.8 · 88.6% · 2026-06-01 · llm-stats 第三方 tracker(2026-06)Claude Opus 4.7 · 87.6% · 2026-06-01 · llm-stats 第三方 tracker(2026-06)DeepSeek-V4-Pro · 80.6% · 2026-06-01 · V4-Pro-Max 预览版配置 · llm-stats 第三方 tracker(2026-06)MiniMax-M3 · 80.5% · 2026-06-01 · llm-stats 第三方 tracker(2026-06)Qwen3.7-Max · 80.4% · 2026-06-07 · 第三方 tracker 观测(llmreference · 全榜第 9)Claude Fable 5 · 95.5% · 2026-06-09 · 官方自报Claude Opus 5 · 97% · 2026-08-19 · Vals AI 第三方统一 harness(bash-only)· 榜首DeepSeek-V4-Pro · 96.4% · 2026-08-19 · V4-Pro-0813 · Vals AI 第三方统一 harness(bash-only)· 榜上第二、开源第一GPT-4o 33.2%Claude 3.5 Sonnet 49%Claude Sonnet 4 72.7%Claude Opus 4.5 80.9%Claude Fable 5 95.5%Claude Opus 5 97%
● 公开成绩(悬停看读数,点击进档案)◆ 刷新纪录的成绩— 前沿线(历史最高分的阶梯)

◈ 前沿刷新记录 FRONTIER BREAKS榜首的保质期

日期刷新者分数提升在位
GPT-4o OpenAI 33.2% 首个记录 70 天
Claude 3.5 Sonnet Anthropic 49% +15.8 90 天
DeepSeek-R1 DeepSeek 49.2% +0.2 35 天
Claude 3.7 Sonnet Anthropic 62.3% +13.1 29 天
Gemini 2.5 Pro Google DeepMind 63.8% +1.5 22 天
o3 OpenAI 69.1% +5.3 36 天
Claude Sonnet 4 Anthropic 72.7% +3.6 75 天
Claude Opus 4.1 Anthropic 74.5% +1.8 2 天
GPT-5 OpenAI 74.9% +0.4 53 天
Claude Sonnet 4.5 Anthropic 77.2% +2.3 51 天
GPT-5.1-Codex-Max OpenAI 77.9% +0.7 5 天
Claude Opus 4.5 Anthropic 80.9% +3.0 189 天
Claude Opus 4.8 Anthropic 88.6% +7.7 8 天
Claude Fable 5 Anthropic 95.5% +6.9 71 天
Claude Opus 5 Anthropic 97% +1.5 在位中 · 29 天
⇱ 返回完整时间树 UMBRELLA 4365 · 双线对照 · 由新到旧 · 全部档案