UMBRELLA 4365UMBRELLA 4365 · Cursor 战地纪实 CAPABILITY ASSAY · 能力评测

SWE-bench Pro

SWE-bench Pro 是 Scale AI 推出的加难版:题目更长、跨文件更多、含商业代码库私有集,用来区分「刷穿 Verified」之后的前沿模型。本页汇总公开成绩与前沿刷新记录。数字全部取自官方发布材料、第三方评测机构与站内已查证档案,评测口径(版本 / 算力档 / 脚手架)标在备注里;因训练数据污染撤榜的成绩不收录。仅作记录,不构成选型建议。

模型 4 个成绩 4 条前沿刷新 3 次2026.04.08 → 2026.06.09

◈ 当前榜 CURRENT BOARD每个模型取最近一次公开成绩

#模型成绩相对前沿日期口径 / 备注
1 Claude Fable 5
Anthropic
80.3% 100 官方自报 原文 ↗
2 Qwen3.7-Max
阿里 · Qwen
60.6% 75.5 第三方 tracker 观测(llmreference) 原文 ↗
3 MiniMax-M3
MiniMax
59% 73.5 官方自报 原文 ↗
4 GLM-5.1
智谱 · GLM
58.4% 72.7 官方自报 · 国产首次超过 Opus 4.6 原文 ↗

◈ 能力曲线 CAPABILITY CURVE

◈ 前沿刷新记录 FRONTIER BREAKS榜首的保质期

日期刷新者分数提升在位
GLM-5.1 智谱 · GLM 58.4% 首个记录 42 天
Qwen3.7-Max 阿里 · Qwen 60.6% +2.2 20 天
Claude Fable 5 Anthropic 80.3% +19.7 在位中 · 100 天
⇱ 返回完整时间树 UMBRELLA 4365 · 双线对照 · 由新到旧 · 全部档案