UMBRELLA 4365UMBRELLA 4365 · Cursor 战地纪实 CAPABILITY ASSAY · 能力评测

DeepSWE v1.1

DeepSWE 考察模型端到端自主完成复杂工程问题的能力,验证器严、题目抗污染,2026 年起成为 Google 与 DeepSeek 发布材料的主战场之一。本页汇总 v1.1 版本的公开成绩与前沿刷新记录。数字全部取自官方发布材料、第三方评测机构与站内已查证档案,评测口径(版本 / 算力档 / 脚手架)标在备注里;因训练数据污染撤榜的成绩不收录。仅作记录,不构成选型建议。

模型 13 个成绩 13 条前沿刷新 1 次2026.09.02 → 2026.09.10

◈ 当前榜 CURRENT BOARD每个模型取最近一次公开成绩

#模型成绩相对前沿日期口径 / 备注
1 Muse Spark 1.3
Meta
75.4% 100 官方对照表 · max 档(发布时未对公众开放,xhigh 为当日可调用档) 原文 ↗
2 DeepSeek-V4.1-Flash
DeepSeek
74.2% 98.4 官方更新日志自报 · 超过 GPT-6 Astra 的 74.1 原文 ↗
3 GPT-6 Astra
OpenAI
74.1% 98.3 官方自报 · 最大努力档 原文 ↗
4 Claude Opus 5
Anthropic
74% 98.1 据 Gemini 3.8 Flash 发布对照表 原文 ↗
5 Gemini 3.8 Flash
Google DeepMind
73.7% 97.7 官方自报 · 发布后更新的数字(发布当日表为 71.0) 原文 ↗
6 SWE-2
Cognition(Devin)
73% 96.8 官方自报 · 各档最佳 原文 ↗
7 GPT-5.6 Sol
OpenAI
72.7% 96.4 据 Gemini 3.8 Flash 发布对照表 原文 ↗
8 Claude Fable 5
Anthropic
69.9% 92.7 据 GPT-6 Astra 发布对照表 · xhigh 档(Cognition 注:Max 档 69.7 反而更低) 原文 ↗
9 Kimi K3
月之暗面 · Kimi
68.5% 90.8 据 Cognition SWE-2 发布对照表 · Devin CLI harness 原文 ↗
10 Grok 4.6
xAI / SpaceXAI
67.5% 89.5 据 Cognition SWE-2 发布对照表 · Grok Build harness 原文 ↗
11 Claude Fable 5.1
Anthropic
67.4% 89.4 据 GPT-6 Astra 发布对照表 · 最大努力档 原文 ↗
12 Gemini 3.7 Flash
Google DeepMind
65.3% 86.6 据 Gemini 3.8 Flash 发布对照表 原文 ↗
13 Claude Sonnet 5
Anthropic
53.8% 71.4 据 Gemini 3.8 Flash 发布对照表 原文 ↗

◈ 能力曲线 CAPABILITY CURVE

506070802026.052026.072026.092026.112027.01今日%Muse Spark 1.3 · 75.4% · 2026-09-02 · 官方对照表 · max 档(发布时未对公众开放,xhigh 为当日可调用档)Claude Opus 5 · 74% · 2026-09-02 · 据 Gemini 3.8 Flash 发布对照表Gemini 3.8 Flash · 73.7% · 2026-09-02 · 官方自报 · 发布后更新的数字(发布当日表为 71.0)GPT-5.6 Sol · 72.7% · 2026-09-02 · 据 Gemini 3.8 Flash 发布对照表Gemini 3.7 Flash · 65.3% · 2026-09-02 · 据 Gemini 3.8 Flash 发布对照表Claude Sonnet 5 · 53.8% · 2026-09-02 · 据 Gemini 3.8 Flash 发布对照表GPT-6 Astra · 74.1% · 2026-09-03 · 官方自报 · 最大努力档Claude Fable 5 · 69.9% · 2026-09-03 · 据 GPT-6 Astra 发布对照表 · xhigh 档(Cognition 注:Max 档 69.7 反而更低)Claude Fable 5.1 · 67.4% · 2026-09-03 · 据 GPT-6 Astra 发布对照表 · 最大努力档DeepSeek-V4.1-Flash · 74.2% · 2026-09-10 · 官方更新日志自报 · 超过 GPT-6 Astra 的 74.1SWE-2 · 73% · 2026-09-10 · 官方自报 · 各档最佳Kimi K3 · 68.5% · 2026-09-10 · 据 Cognition SWE-2 发布对照表 · Devin CLI harnessGrok 4.6 · 67.5% · 2026-09-10 · 据 Cognition SWE-2 发布对照表 · Grok Build harnessMuse Spark 1.3 75.4%
● 公开成绩(悬停看读数,点击进档案)◆ 刷新纪录的成绩— 前沿线(历史最高分的阶梯)

◈ 前沿刷新记录 FRONTIER BREAKS榜首的保质期

日期刷新者分数提升在位
Muse Spark 1.3 Meta 75.4% 首个记录 在位中 · 15 天
⇱ 返回完整时间树 UMBRELLA 4365 · 双线对照 · 由新到旧 · 全部档案