FrontierCode 1.1 Main
FrontierCode 由 Cognition(Devin)出品,评判标准不是「测试通过」而是「这个 PR 维护者会不会合并」:150 道由开源维护者亲自出题的任务,Main 取其中最难的 100 道,踩到任一阻断项即记零分。2026 年 9 月起 OpenAI 的 GPT-6 Astra 与 Cognition 的 SWE-2 发布材料都以它为主战场,前沿模型的分数挤在 50% 上下。本页汇总 1.1 Main 子集的公开成绩与前沿刷新记录。数字全部取自官方发布材料、第三方评测机构与站内已查证档案,评测口径(版本 / 算力档 / 脚手架)标在备注里;因训练数据污染撤榜的成绩不收录。仅作记录,不构成选型建议。
模型 10 个成绩 10 条前沿刷新 2 次2026.07.08 → 2026.09.10
◈ 当前榜 CURRENT BOARD每个模型取最近一次公开成绩
| # | 模型 | 成绩 | 相对前沿 | 日期 | 口径 / 备注 |
|---|---|---|---|---|---|
| 1 | Claude Fable 5 Anthropic |
53.5% | 100 | 据 GPT-6 Astra 发布对照表(Extended 64.9) 原文 ↗ | |
| 2 | Claude Opus 5 Anthropic |
53.4% | 99.8 | 据 GPT-6 Astra 发布对照表(Extended 63.6) 原文 ↗ | |
| 3 | GPT-6 Astra OpenAI |
53.3% | 99.6 | 官方自报 · 最大努力档(Extended 子集 64.5) 原文 ↗ | |
| 4 | Claude Fable 5.1 Anthropic |
50.9% | 95.1 | 据 GPT-6 Astra 发布对照表,与 Cognition SWE-2 表一致(Extended 63.6) 原文 ↗ | |
| 5 | SWE-2 Cognition(Devin) |
50% | 93.5 | 官方自报 · 各档最佳 原文 ↗ | |
| 6 | Grok 4.6 xAI / SpaceXAI |
48% | 89.7 | 据 Cognition SWE-2 发布对照表 · Grok Build harness 原文 ↗ | |
| 7 | GPT-5.6 Sol OpenAI |
47.5% | 88.8 | 据 GPT-6 Astra 发布对照表(Extended 60.6) 原文 ↗ | |
| 8 | Kimi K3 月之暗面 · Kimi |
44.2% | 82.6 | 据 Cognition SWE-2 发布对照表 · Devin CLI harness 原文 ↗ | |
| 9 | Gemini 3.8 Flash Google DeepMind |
43.6% | 81.5 | 据 GPT-6 Astra 发布对照表(Extended 56.3) 原文 ↗ | |
| 10 | SWE-1.7 Cognition(Devin) |
42.3% | 79.1 | 官方自报(SWE-2 对照表中记为 42.0) 原文 ↗ |
◈ 能力曲线 CAPABILITY CURVE
● 公开成绩(悬停看读数,点击进档案)◆ 刷新纪录的成绩— 前沿线(历史最高分的阶梯)
◈ 前沿刷新记录 FRONTIER BREAKS榜首的保质期
| 日期 | 刷新者 | 分数 | 提升 | 在位 |
|---|---|---|---|---|
| SWE-1.7 Cognition(Devin) | 42.3% | 首个记录 | 57 天 | |
| Claude Fable 5 Anthropic | 53.5% | +11.2 | 在位中 · 14 天 |