SWE-bench Verified
SWE-bench Verified 是由 OpenAI 人工核验的 500 道真实 GitHub 问题修复题,考察模型在真实代码库里独立完成修复的能力,是编码模型最常被引用的成绩单。本页汇总各实验室模型在该基准上的公开成绩,并标出「前沿线」——历史最高分每一次被刷新的时刻。数字全部取自官方发布材料、第三方评测机构与站内已查证档案,评测口径(版本 / 算力档 / 脚手架)标在备注里;因训练数据污染撤榜的成绩不收录。仅作记录,不构成选型建议。
模型 45 个成绩 46 条前沿刷新 15 次2024.08.13 → 2026.08.19
◈ 当前榜 CURRENT BOARD每个模型取最近一次公开成绩
| # | 模型 | 成绩 | 相对前沿 | 日期 | 口径 / 备注 |
|---|---|---|---|---|---|
| 1 | Claude Opus 5 Anthropic |
97% | 100 | Vals AI 第三方统一 harness(bash-only)· 榜首 原文 ↗ | |
| 2 | DeepSeek-V4-Pro DeepSeek |
96.4% | 99.4 | V4-Pro-0813 · Vals AI 第三方统一 harness(bash-only)· 榜上第二、开源第一 原文 ↗ | |
| 3 | Claude Fable 5 Anthropic |
95.5% | 98.5 | 官方自报 原文 ↗ | |
| 4 | Claude Opus 4.8 Anthropic |
88.6% | 91.3 | llm-stats 第三方 tracker(2026-06) 原文 ↗ | |
| 5 | Claude Opus 4.7 Anthropic |
87.6% | 90.3 | llm-stats 第三方 tracker(2026-06) 原文 ↗ | |
| 6 | Claude Opus 4.5 Anthropic |
80.9% | 83.4 | 官方自报 原文 ↗ | |
| 7 | Claude Opus 4.6 Anthropic |
80.8% | 83.3 | 据 Gemini 3.1 Pro 发布对照 / llm-stats tracker 原文 ↗ | |
| 8 | Gemini 3.1 Pro Google DeepMind |
80.6% | 83.1 | 官方发布对照 · 与 GPT-5.4 持平 原文 ↗ | |
| 9 | GPT-5.4 OpenAI |
80.6% | 83.1 | 据 Gemini 3.1 Pro 发布对照 原文 ↗ | |
| 10 | MiniMax-M3 MiniMax |
80.5% | 83 | llm-stats 第三方 tracker(2026-06) 原文 ↗ | |
| 11 | Qwen3.7-Max 阿里 · Qwen |
80.4% | 82.9 | 第三方 tracker 观测(llmreference · 全榜第 9) 原文 ↗ | |
| 12 | MiniMax-M2.5 MiniMax |
80.2% | 82.7 | 官方自报 · Claude Code 脚手架 · 四次均值 原文 ↗ | |
| 13 | GPT-5.2 OpenAI |
80% | 82.5 | xhigh 档 · 据智谱 GLM-5 发布对照表 原文 ↗ | |
| 14 | GPT-5.1-Codex-Max OpenAI |
77.9% | 80.3 | xhigh 档 · 官方自报 原文 ↗ | |
| 15 | GLM-5 智谱 · GLM |
77.8% | 80.2 | 官方自报 · OpenHands 口径(Thinking) 原文 ↗ | |
| 16 | Claude Sonnet 4.5 Anthropic |
77.2% | 79.6 | 官方自报;并行计算加成下 82.0% 原文 ↗ | |
| 17 | Kimi K2.5 月之暗面 · Kimi |
76.8% | 79.2 | 据智谱 GLM-5 发布对照表 · OpenHands 口径(Thinking) 原文 ↗ | |
| 18 | Gemini 3 Pro Google DeepMind |
76.2% | 78.6 | 官方自报 原文 ↗ | |
| 19 | GPT-5 OpenAI |
74.9% | 77.2 | 官方自报(477 题可复现子集) 原文 ↗ | |
| 20 | Claude Opus 4.1 Anthropic |
74.5% | 76.8 | 官方自报 原文 ↗ | |
| 21 | GLM-4.7 智谱 · GLM |
73.8% | 76.1 | 官方自报 · OpenHands 口径 原文 ↗ | |
| 22 | DeepSeek-V4-Flash DeepSeek |
73.7% | 76 | 技术报告自报(第三方 tracker 另录 79.0) 原文 ↗ | |
| 23 | Claude Haiku 4.5 Anthropic |
73.3% | 75.6 | 官方自报 原文 ↗ | |
| 24 | DeepSeek-V3.2 DeepSeek |
73.1% | 75.4 | 据智谱 GLM-5 发布对照表 · OpenHands 口径(Thinking) 原文 ↗ | |
| 25 | Claude Sonnet 4 Anthropic |
72.7% | 74.9 | 官方自报;并行计算加成下 80.2% 原文 ↗ | |
| 26 | Claude Opus 4 Anthropic |
72.5% | 74.7 | 官方自报;并行计算加成下 79.4% 原文 ↗ | |
| 27 | Kimi K2 Thinking 月之暗面 · Kimi |
71.3% | 73.5 | 官方自报 原文 ↗ | |
| 28 | grok-code-fast-1 xAI / SpaceXAI |
70.8% | 73 | 官方自报 · 内部 harness 原文 ↗ | |
| 29 | Qwen3-Coder 阿里 · Qwen |
69.6% | 71.8 | 480B-A35B-Instruct · 官方发布图表 · 无测试时扩展 原文 ↗ | |
| 30 | Qwen3-Max 阿里 · Qwen |
69.6% | 71.8 | Instruct 版 · 官方自报(云栖大会) 原文 ↗ | |
| 31 | o3 OpenAI |
69.1% | 71.2 | 官方自报 原文 ↗ | |
| 32 | GLM-4.6 智谱 · GLM |
68% | 70.1 | 据 GLM-4.7 发布对照表 · OpenHands 口径 原文 ↗ | |
| 33 | DeepSeek-V3.1 DeepSeek |
66% | 68 | 官方更新日志自报 原文 ↗ | |
| 34 | Kimi K2 月之暗面 · Kimi |
65.8% | 67.8 | 官方自报 · agentic 单次 原文 ↗ | |
| 35 | GLM-4.5 智谱 · GLM |
64.2% | 66.2 | 官方自报 · OpenHands 脚手架 原文 ↗ | |
| 36 | Gemini 2.5 Pro Google DeepMind |
63.8% | 65.8 | 官方自报 · 自定义 agent 配置 原文 ↗ | |
| 37 | Claude 3.7 Sonnet Anthropic |
62.3% | 64.2 | 官方自报;自定义脚手架下 70.3% 原文 ↗ | |
| 38 | MiniMax-M1 MiniMax |
56% | 57.7 | M1-80k · 官方自报 原文 ↗ | |
| 39 | GPT-4.1 OpenAI |
54.6% | 56.3 | 官方自报 原文 ↗ | |
| 40 | DeepSeek-R1 DeepSeek |
49.2% | 50.7 | 技术报告自报 原文 ↗ | |
| 41 | Claude 3.5 Sonnet Anthropic |
49% | 50.5 | 10 月升级版(官方自报) 原文 ↗ | |
| 42 | o1 OpenAI |
48.9% | 50.4 | o1 系统卡 · Agentless 脚手架 原文 ↗ | |
| 43 | DeepSeek-V3 DeepSeek |
42% | 43.3 | 技术报告自报 原文 ↗ | |
| 44 | GPT-4.5 OpenAI |
38% | 39.2 | 系统卡自报 原文 ↗ | |
| 45 | GPT-4o OpenAI |
33.2% | 34.2 | OpenAI 发布 Verified 子集时的基线成绩 原文 ↗ |
◈ 能力曲线 CAPABILITY CURVE
● 公开成绩(悬停看读数,点击进档案)◆ 刷新纪录的成绩— 前沿线(历史最高分的阶梯)
◈ 前沿刷新记录 FRONTIER BREAKS榜首的保质期
| 日期 | 刷新者 | 分数 | 提升 | 在位 |
|---|---|---|---|---|
| GPT-4o OpenAI | 33.2% | 首个记录 | 70 天 | |
| Claude 3.5 Sonnet Anthropic | 49% | +15.8 | 90 天 | |
| DeepSeek-R1 DeepSeek | 49.2% | +0.2 | 35 天 | |
| Claude 3.7 Sonnet Anthropic | 62.3% | +13.1 | 29 天 | |
| Gemini 2.5 Pro Google DeepMind | 63.8% | +1.5 | 22 天 | |
| o3 OpenAI | 69.1% | +5.3 | 36 天 | |
| Claude Sonnet 4 Anthropic | 72.7% | +3.6 | 75 天 | |
| Claude Opus 4.1 Anthropic | 74.5% | +1.8 | 2 天 | |
| GPT-5 OpenAI | 74.9% | +0.4 | 53 天 | |
| Claude Sonnet 4.5 Anthropic | 77.2% | +2.3 | 51 天 | |
| GPT-5.1-Codex-Max OpenAI | 77.9% | +0.7 | 5 天 | |
| Claude Opus 4.5 Anthropic | 80.9% | +3.0 | 189 天 | |
| Claude Opus 4.8 Anthropic | 88.6% | +7.7 | 8 天 | |
| Claude Fable 5 Anthropic | 95.5% | +6.9 | 71 天 | |
| Claude Opus 5 Anthropic | 97% | +1.5 | 在位中 · 29 天 |