Terminal-Bench
Terminal-Bench 让模型在真实终端环境里完成端到端任务(编译、部署、排障、数据处理),是衡量 agent 自主执行能力的主流基准。本页收录 2025 年初版题库的成绩;题库改版后的 2.0 / 4.0 因不可比而分列独立页面。数字全部取自官方发布材料、第三方评测机构与站内已查证档案,评测口径(版本 / 算力档 / 脚手架)标在备注里;因训练数据污染撤榜的成绩不收录。仅作记录,不构成选型建议。
模型 2 个成绩 2 条前沿刷新 1 次2025.05.22 → 2025.08.21
◈ 当前榜 CURRENT BOARD每个模型取最近一次公开成绩
| # | 模型 | 成绩 | 相对前沿 | 日期 | 口径 / 备注 |
|---|---|---|---|---|---|
| 1 | Claude Opus 4 Anthropic |
43.2% | 100 | 2025 年初版题库 · 官方自报 原文 ↗ | |
| 2 | DeepSeek-V3.1 DeepSeek |
31.3% | 72.5 | 初版题库 · 官方更新日志自报 原文 ↗ |
◈ 能力曲线 CAPABILITY CURVE
● 公开成绩(悬停看读数,点击进档案)◆ 刷新纪录的成绩— 前沿线(历史最高分的阶梯)
◈ 前沿刷新记录 FRONTIER BREAKS榜首的保质期
| 日期 | 刷新者 | 分数 | 提升 | 在位 |
|---|---|---|---|---|
| Claude Opus 4 Anthropic | 43.2% | 首个记录 | 在位中 · 483 天 |