SWE-bench Pro
SWE-bench Pro 是 Scale AI 推出的加难版:题目更长、跨文件更多、含商业代码库私有集,用来区分「刷穿 Verified」之后的前沿模型。本页汇总公开成绩与前沿刷新记录。数字全部取自官方发布材料、第三方评测机构与站内已查证档案,评测口径(版本 / 算力档 / 脚手架)标在备注里;因训练数据污染撤榜的成绩不收录。仅作记录,不构成选型建议。
模型 4 个成绩 4 条前沿刷新 3 次2026.04.08 → 2026.06.09
◈ 当前榜 CURRENT BOARD每个模型取最近一次公开成绩
| # | 模型 | 成绩 | 相对前沿 | 日期 | 口径 / 备注 |
|---|---|---|---|---|---|
| 1 | Claude Fable 5 Anthropic |
80.3% | 100 | 官方自报 原文 ↗ | |
| 2 | Qwen3.7-Max 阿里 · Qwen |
60.6% | 75.5 | 第三方 tracker 观测(llmreference) 原文 ↗ | |
| 3 | MiniMax-M3 MiniMax |
59% | 73.5 | 官方自报 原文 ↗ | |
| 4 | GLM-5.1 智谱 · GLM |
58.4% | 72.7 | 官方自报 · 国产首次超过 Opus 4.6 原文 ↗ |
◈ 能力曲线 CAPABILITY CURVE
● 公开成绩(悬停看读数,点击进档案)◆ 刷新纪录的成绩— 前沿线(历史最高分的阶梯)
◈ 前沿刷新记录 FRONTIER BREAKS榜首的保质期
| 日期 | 刷新者 | 分数 | 提升 | 在位 |
|---|---|---|---|---|
| GLM-5.1 智谱 · GLM | 58.4% | 首个记录 | 42 天 | |
| Qwen3.7-Max 阿里 · Qwen | 60.6% | +2.2 | 20 天 | |
| Claude Fable 5 Anthropic | 80.3% | +19.7 | 在位中 · 100 天 |