DeepSWE v1.1
DeepSWE 考察模型端到端自主完成复杂工程问题的能力,验证器严、题目抗污染,2026 年起成为 Google 与 DeepSeek 发布材料的主战场之一。本页汇总 v1.1 版本的公开成绩与前沿刷新记录。数字全部取自官方发布材料、第三方评测机构与站内已查证档案,评测口径(版本 / 算力档 / 脚手架)标在备注里;因训练数据污染撤榜的成绩不收录。仅作记录,不构成选型建议。
模型 13 个成绩 13 条前沿刷新 1 次2026.09.02 → 2026.09.10
◈ 当前榜 CURRENT BOARD每个模型取最近一次公开成绩
| # | 模型 | 成绩 | 相对前沿 | 日期 | 口径 / 备注 |
|---|---|---|---|---|---|
| 1 | Muse Spark 1.3 Meta |
75.4% | 100 | 官方对照表 · max 档(发布时未对公众开放,xhigh 为当日可调用档) 原文 ↗ | |
| 2 | DeepSeek-V4.1-Flash DeepSeek |
74.2% | 98.4 | 官方更新日志自报 · 超过 GPT-6 Astra 的 74.1 原文 ↗ | |
| 3 | GPT-6 Astra OpenAI |
74.1% | 98.3 | 官方自报 · 最大努力档 原文 ↗ | |
| 4 | Claude Opus 5 Anthropic |
74% | 98.1 | 据 Gemini 3.8 Flash 发布对照表 原文 ↗ | |
| 5 | Gemini 3.8 Flash Google DeepMind |
73.7% | 97.7 | 官方自报 · 发布后更新的数字(发布当日表为 71.0) 原文 ↗ | |
| 6 | SWE-2 Cognition(Devin) |
73% | 96.8 | 官方自报 · 各档最佳 原文 ↗ | |
| 7 | GPT-5.6 Sol OpenAI |
72.7% | 96.4 | 据 Gemini 3.8 Flash 发布对照表 原文 ↗ | |
| 8 | Claude Fable 5 Anthropic |
69.9% | 92.7 | 据 GPT-6 Astra 发布对照表 · xhigh 档(Cognition 注:Max 档 69.7 反而更低) 原文 ↗ | |
| 9 | Kimi K3 月之暗面 · Kimi |
68.5% | 90.8 | 据 Cognition SWE-2 发布对照表 · Devin CLI harness 原文 ↗ | |
| 10 | Grok 4.6 xAI / SpaceXAI |
67.5% | 89.5 | 据 Cognition SWE-2 发布对照表 · Grok Build harness 原文 ↗ | |
| 11 | Claude Fable 5.1 Anthropic |
67.4% | 89.4 | 据 GPT-6 Astra 发布对照表 · 最大努力档 原文 ↗ | |
| 12 | Gemini 3.7 Flash Google DeepMind |
65.3% | 86.6 | 据 Gemini 3.8 Flash 发布对照表 原文 ↗ | |
| 13 | Claude Sonnet 5 Anthropic |
53.8% | 71.4 | 据 Gemini 3.8 Flash 发布对照表 原文 ↗ |
◈ 能力曲线 CAPABILITY CURVE
● 公开成绩(悬停看读数,点击进档案)◆ 刷新纪录的成绩— 前沿线(历史最高分的阶梯)
◈ 前沿刷新记录 FRONTIER BREAKS榜首的保质期
| 日期 | 刷新者 | 分数 | 提升 | 在位 |
|---|---|---|---|---|
| Muse Spark 1.3 Meta | 75.4% | 首个记录 | 在位中 · 15 天 |