Terminal-Bench 3.0
Terminal-Bench 3.0 是 2026 年中改版的终端 agent 题库,难度陡增——前沿开源模型的首批成绩多在个位数到二三十分之间。本页收录该版本的公开成绩与前沿刷新记录。数字全部取自官方发布材料、第三方评测机构与站内已查证档案,评测口径(版本 / 算力档 / 脚手架)标在备注里;因训练数据污染撤榜的成绩不收录。仅作记录,不构成选型建议。
模型 3 个成绩 3 条前沿刷新 2 次2026.08.14 → 2026.09.10
◈ 当前榜 CURRENT BOARD每个模型取最近一次公开成绩
| # | 模型 | 成绩 | 相对前沿 | 日期 | 口径 / 备注 |
|---|---|---|---|---|---|
| 1 | DeepSeek-V4.1-Flash DeepSeek |
30% | 100 | 官方更新日志自报 原文 ↗ | |
| 2 | GLM-5.3 智谱 · GLM |
28.3% | 94.3 | 官方发布材料 原文 ↗ | |
| 3 | GLM-5.2 智谱 · GLM |
4.6% | 15.3 | 据 GLM-5.3 发布材料对照 原文 ↗ |
◈ 能力曲线 CAPABILITY CURVE
● 公开成绩(悬停看读数,点击进档案)◆ 刷新纪录的成绩— 前沿线(历史最高分的阶梯)
◈ 前沿刷新记录 FRONTIER BREAKS榜首的保质期
| 日期 | 刷新者 | 分数 | 提升 | 在位 |
|---|---|---|---|---|
| GLM-5.3 智谱 · GLM | 28.3% | 首个记录 | 27 天 | |
| DeepSeek-V4.1-Flash DeepSeek | 30% | +1.7 | 在位中 · 7 天 |