UMBRELLA 4365UMBRELLA 4365 · Cursor 战地纪实 CAPABILITY ASSAY · 能力评测

FrontierCode 1.1 Main

FrontierCode 由 Cognition(Devin)出品,评判标准不是「测试通过」而是「这个 PR 维护者会不会合并」:150 道由开源维护者亲自出题的任务,Main 取其中最难的 100 道,踩到任一阻断项即记零分。2026 年 9 月起 OpenAI 的 GPT-6 Astra 与 Cognition 的 SWE-2 发布材料都以它为主战场,前沿模型的分数挤在 50% 上下。本页汇总 1.1 Main 子集的公开成绩与前沿刷新记录。数字全部取自官方发布材料、第三方评测机构与站内已查证档案,评测口径(版本 / 算力档 / 脚手架)标在备注里;因训练数据污染撤榜的成绩不收录。仅作记录,不构成选型建议。

模型 10 个成绩 10 条前沿刷新 2 次2026.07.08 → 2026.09.10

◈ 当前榜 CURRENT BOARD每个模型取最近一次公开成绩

#模型成绩相对前沿日期口径 / 备注
1 Claude Fable 5
Anthropic
53.5% 100 据 GPT-6 Astra 发布对照表(Extended 64.9) 原文 ↗
2 Claude Opus 5
Anthropic
53.4% 99.8 据 GPT-6 Astra 发布对照表(Extended 63.6) 原文 ↗
3 GPT-6 Astra
OpenAI
53.3% 99.6 官方自报 · 最大努力档(Extended 子集 64.5) 原文 ↗
4 Claude Fable 5.1
Anthropic
50.9% 95.1 据 GPT-6 Astra 发布对照表,与 Cognition SWE-2 表一致(Extended 63.6) 原文 ↗
5 SWE-2
Cognition(Devin)
50% 93.5 官方自报 · 各档最佳 原文 ↗
6 Grok 4.6
xAI / SpaceXAI
48% 89.7 据 Cognition SWE-2 发布对照表 · Grok Build harness 原文 ↗
7 GPT-5.6 Sol
OpenAI
47.5% 88.8 据 GPT-6 Astra 发布对照表(Extended 60.6) 原文 ↗
8 Kimi K3
月之暗面 · Kimi
44.2% 82.6 据 Cognition SWE-2 发布对照表 · Devin CLI harness 原文 ↗
9 Gemini 3.8 Flash
Google DeepMind
43.6% 81.5 据 GPT-6 Astra 发布对照表(Extended 56.3) 原文 ↗
10 SWE-1.7
Cognition(Devin)
42.3% 79.1 官方自报(SWE-2 对照表中记为 42.0) 原文 ↗

◈ 能力曲线 CAPABILITY CURVE

◈ 前沿刷新记录 FRONTIER BREAKS榜首的保质期

日期刷新者分数提升在位
SWE-1.7 Cognition(Devin) 42.3% 首个记录 57 天
Claude Fable 5 Anthropic 53.5% +11.2 在位中 · 14 天
⇱ 返回完整时间树 UMBRELLA 4365 · 双线对照 · 由新到旧 · 全部档案