Terminal-Bench 4.0
Terminal-Bench 4.0 是 2026 年的终端 agent 题库版本,Fable 5.1 与 Mythos 5.1 的发布材料以它为主战场之一。本页收录该版本的公开成绩与前沿刷新记录。数字全部取自官方发布材料、第三方评测机构与站内已查证档案,评测口径(版本 / 算力档 / 脚手架)标在备注里;因训练数据污染撤榜的成绩不收录。仅作记录,不构成选型建议。
模型 11 个成绩 13 条前沿刷新 1 次2026.09.01 → 2026.09.10
◈ 当前榜 CURRENT BOARD每个模型取最近一次公开成绩
| # | 模型 | 成绩 | 相对前沿 | 日期 | 口径 / 备注 |
|---|---|---|---|---|---|
| 1 | Claude Mythos 5.1 Anthropic |
60.9% | 100 | 官方自报(受限通道模型) 原文 ↗ | |
| 2 | GPT-6 Astra OpenAI |
57.9% | 95.1 | 官方自报 · 最大努力档 原文 ↗ | |
| 3 | Claude Fable 5.1 Anthropic |
55.8% | 91.6 | 官方自报 原文 ↗ | |
| 4 | Claude Opus 5 Anthropic |
51.8% | 85.1 | 据 Gemini 3.8 Flash 发布对照表 原文 ↗ | |
| 5 | Claude Fable 5 Anthropic |
44.5% | 73.1 | 据 GPT-6 Astra 发布对照表(Anthropic 自家表为 42.0) 原文 ↗ | |
| 6 | GPT-5.6 Sol OpenAI |
37.3% | 61.2 | 据 GPT-6 Astra 发布对照表 · 最大努力档 原文 ↗ | |
| 7 | DeepSeek-V4.1-Flash DeepSeek |
31.2% | 51.2 | 官方更新日志自报 原文 ↗ | |
| 8 | SWE-2 Cognition(Devin) |
27.3% | 44.8 | 官方自报 · 各档最佳 原文 ↗ | |
| 9 | Kimi K3 月之暗面 · Kimi |
21.5% | 35.3 | 据 Cognition SWE-2 发布对照表 · Devin CLI harness 原文 ↗ | |
| 10 | Grok 4.6 xAI / SpaceXAI |
20.3% | 33.3 | 据 Cognition SWE-2 发布对照表 · Grok Build harness 原文 ↗ | |
| 11 | Gemini 3.8 Flash Google DeepMind |
19.1% | 31.4 | 官方自报(发布对照表) 原文 ↗ |
◈ 能力曲线 CAPABILITY CURVE
● 公开成绩(悬停看读数,点击进档案)◆ 刷新纪录的成绩— 前沿线(历史最高分的阶梯)
◈ 前沿刷新记录 FRONTIER BREAKS榜首的保质期
| 日期 | 刷新者 | 分数 | 提升 | 在位 |
|---|---|---|---|---|
| Claude Mythos 5.1 Anthropic | 60.9% | 首个记录 | 在位中 · 16 天 |