Terminal-Bench-Science 0.1
Terminal-Bench-Science 测试 agent 能否在命令行环境里完成科学研究任务(数据处理、建模、复现),以通过率计分,是 2026 年随 Fable 5.1 发布进入公众视野的新基准。本页收录公开成绩与前沿刷新记录。数字全部取自官方发布材料、第三方评测机构与站内已查证档案,评测口径(版本 / 算力档 / 脚手架)标在备注里;因训练数据污染撤榜的成绩不收录。仅作记录,不构成选型建议。
模型 5 个成绩 5 条前沿刷新 2 次2026.09.01 → 2026.09.03
◈ 当前榜 CURRENT BOARD每个模型取最近一次公开成绩
| # | 模型 | 成绩 | 相对前沿 | 日期 | 口径 / 备注 |
|---|---|---|---|---|---|
| 1 | GPT-6 Astra OpenAI |
64.6% | 100 | 官方自报 原文 ↗ | |
| 2 | Claude Fable 5.1 Anthropic |
52.6% | 81.4 | 官方自报 原文 ↗ | |
| 3 | Claude Opus 5 Anthropic |
29% | 44.9 | 据 Fable 5.1 发布材料的对照数字 原文 ↗ | |
| 4 | Claude Fable 5 Anthropic |
24.7% | 38.2 | 据 Fable 5.1 发布材料的对照数字 原文 ↗ | |
| 5 | GPT-5.6 Sol OpenAI |
22.4% | 34.7 | 据 Fable 5.1 发布对照表 原文 ↗ |
◈ 能力曲线 CAPABILITY CURVE
● 公开成绩(悬停看读数,点击进档案)◆ 刷新纪录的成绩— 前沿线(历史最高分的阶梯)
◈ 前沿刷新记录 FRONTIER BREAKS榜首的保质期
| 日期 | 刷新者 | 分数 | 提升 | 在位 |
|---|---|---|---|---|
| Claude Fable 5.1 Anthropic | 52.6% | 首个记录 | 2 天 | |
| GPT-6 Astra OpenAI | 64.6% | +12.0 | 在位中 · 14 天 |