UMBRELLA 4365UMBRELLA 4365 · Cursor 战地纪实 CAPABILITY ASSAY · 能力评测

Terminal-Bench-Science 0.1

Terminal-Bench-Science 测试 agent 能否在命令行环境里完成科学研究任务(数据处理、建模、复现),以通过率计分,是 2026 年随 Fable 5.1 发布进入公众视野的新基准。本页收录公开成绩与前沿刷新记录。数字全部取自官方发布材料、第三方评测机构与站内已查证档案,评测口径(版本 / 算力档 / 脚手架)标在备注里;因训练数据污染撤榜的成绩不收录。仅作记录,不构成选型建议。

模型 5 个成绩 5 条前沿刷新 2 次2026.09.01 → 2026.09.03

◈ 当前榜 CURRENT BOARD每个模型取最近一次公开成绩

#模型成绩相对前沿日期口径 / 备注
1 GPT-6 Astra
OpenAI
64.6% 100 官方自报 原文 ↗
2 Claude Fable 5.1
Anthropic
52.6% 81.4 官方自报 原文 ↗
3 Claude Opus 5
Anthropic
29% 44.9 据 Fable 5.1 发布材料的对照数字 原文 ↗
4 Claude Fable 5
Anthropic
24.7% 38.2 据 Fable 5.1 发布材料的对照数字 原文 ↗
5 GPT-5.6 Sol
OpenAI
22.4% 34.7 据 Fable 5.1 发布对照表 原文 ↗

◈ 能力曲线 CAPABILITY CURVE

◈ 前沿刷新记录 FRONTIER BREAKS榜首的保质期

日期刷新者分数提升在位
Claude Fable 5.1 Anthropic 52.6% 首个记录 2 天
GPT-6 Astra OpenAI 64.6% +12.0 在位中 · 14 天
⇱ 返回完整时间树 UMBRELLA 4365 · 双线对照 · 由新到旧 · 全部档案