UMBRELLA 4365UMBRELLA 4365 · Cursor 战地纪实 CAPABILITY ASSAY · 能力评测

Terminal-Bench 2.1

Terminal-Bench 2.1 是 2026 年上半年前沿模型发布材料最常引用的终端 agent 题库版本——Fable 5、Kimi K3、GPT-5.6 Sol、DeepSeek V4 与 Gemini 3.8 Flash 都在这张表上对过分。本页收录该版本的公开成绩与前沿刷新记录。数字全部取自官方发布材料、第三方评测机构与站内已查证档案,评测口径(版本 / 算力档 / 脚手架)标在备注里;因训练数据污染撤榜的成绩不收录。仅作记录,不构成选型建议。

模型 18 个成绩 18 条前沿刷新 5 次2026.05.19 → 2026.09.10

◈ 当前榜 CURRENT BOARD每个模型取最近一次公开成绩

#模型成绩相对前沿日期口径 / 备注
1 SWE-2
Cognition(Devin)
92.8% 100 官方自报 · 各档最佳 · 对照表最高 原文 ↗
2 Claude Fable 5.1
Anthropic
91.4% 98.5 据 Cognition SWE-2 发布对照表 · Claude Code harness 原文 ↗
3 DeepSeek-V4.1-Flash
DeepSeek
90.6% 97.6 官方更新日志自报 原文 ↗
4 GPT-6 Astra
OpenAI
89.9% 96.9 据 Cognition SWE-2 发布对照表 · Codex harness 原文 ↗
5 Gemini 3.8 Flash
Google DeepMind
89.4% 96.3 官方自报(发布对照表) 原文 ↗
6 Claude Opus 5
Anthropic
89.1% 96 据 Gemini 3.8 Flash 发布对照表 原文 ↗
7 GPT-5.6 Sol
OpenAI
88.8% 95.7 据 Kimi K3 技术报告对照表 · max 档 原文 ↗
8 Muse Spark 1.3
Meta
88.8% 95.7 官方对照表 · 与 GPT-5.6 Sol 持平 原文 ↗
9 Grok 4.6
xAI / SpaceXAI
88.4% 95.3 据 Cognition SWE-2 发布对照表 · Grok Build harness 原文 ↗
10 Kimi K3
月之暗面 · Kimi
88.3% 95.2 技术报告自报 · max 档 原文 ↗
11 Claude Fable 5
Anthropic
88% 94.8 官方自报 原文 ↗
12 DeepSeek-V4-Pro
DeepSeek
87.9% 94.7 V4-Pro-0813 · 官方更新日志自报 原文 ↗
13 Claude Opus 4.8
Anthropic
84.6% 91.2 据 Kimi K3 技术报告对照表 · max 档 原文 ↗
14 GPT-5.5
OpenAI
83.4% 89.9 据 Kimi K3 技术报告对照表 · xhigh 档 原文 ↗
15 GLM-5.2
智谱 · GLM
82.7% 89.1 据 Kimi K3 技术报告对照表 · max 档 原文 ↗
16 DeepSeek-V4-Flash
DeepSeek
82.7% 89.1 V4-Flash-0731 · 官方更新日志自报 原文 ↗
17 SWE-1.7
Cognition(Devin)
81.5% 87.8 官方自报 原文 ↗
18 Gemini 3.5 Flash
Google DeepMind
76.2% 82.1 官方自报 原文 ↗

◈ 能力曲线 CAPABILITY CURVE

7075808590951002026.042026.052026.062026.072026.082026.092026.102026.11今日%Gemini 3.5 Flash · 76.2% · 2026-05-19 · 官方自报Claude Fable 5 · 88% · 2026-06-09 · 官方自报SWE-1.7 · 81.5% · 2026-07-08 · 官方自报GPT-5.6 Sol · 88.8% · 2026-07-16 · 据 Kimi K3 技术报告对照表 · max 档Kimi K3 · 88.3% · 2026-07-16 · 技术报告自报 · max 档Claude Opus 4.8 · 84.6% · 2026-07-16 · 据 Kimi K3 技术报告对照表 · max 档GPT-5.5 · 83.4% · 2026-07-16 · 据 Kimi K3 技术报告对照表 · xhigh 档GLM-5.2 · 82.7% · 2026-07-16 · 据 Kimi K3 技术报告对照表 · max 档DeepSeek-V4-Flash · 82.7% · 2026-07-31 · V4-Flash-0731 · 官方更新日志自报DeepSeek-V4-Pro · 87.9% · 2026-08-13 · V4-Pro-0813 · 官方更新日志自报Gemini 3.8 Flash · 89.4% · 2026-09-02 · 官方自报(发布对照表)Claude Opus 5 · 89.1% · 2026-09-02 · 据 Gemini 3.8 Flash 发布对照表Muse Spark 1.3 · 88.8% · 2026-09-02 · 官方对照表 · 与 GPT-5.6 Sol 持平SWE-2 · 92.8% · 2026-09-10 · 官方自报 · 各档最佳 · 对照表最高Claude Fable 5.1 · 91.4% · 2026-09-10 · 据 Cognition SWE-2 发布对照表 · Claude Code harnessDeepSeek-V4.1-Flash · 90.6% · 2026-09-10 · 官方更新日志自报GPT-6 Astra · 89.9% · 2026-09-10 · 据 Cognition SWE-2 发布对照表 · Codex harnessGrok 4.6 · 88.4% · 2026-09-10 · 据 Cognition SWE-2 发布对照表 · Grok Build harnessClaude Fable 5 88%GPT-5.6 Sol 88.8%SWE-2 92.8%
● 公开成绩(悬停看读数,点击进档案)◆ 刷新纪录的成绩— 前沿线(历史最高分的阶梯)

◈ 前沿刷新记录 FRONTIER BREAKS榜首的保质期

日期刷新者分数提升在位
Gemini 3.5 Flash Google DeepMind 76.2% 首个记录 21 天
Claude Fable 5 Anthropic 88% +11.8 37 天
GPT-5.6 Sol OpenAI 88.8% +0.8 48 天
Gemini 3.8 Flash Google DeepMind 89.4% +0.6 8 天
SWE-2 Cognition(Devin) 92.8% +3.4 在位中 · 7 天
⇱ 返回完整时间树 UMBRELLA 4365 · 双线对照 · 由新到旧 · 全部档案