Terminal-Bench 2.0
Terminal-Bench 2.0 是 2025 年末改版的终端 agent 题库,题目更长、验证更严,前沿模型发布材料自 Gemini 3 起普遍引用。本页收录该版本的公开成绩与前沿刷新记录。数字全部取自官方发布材料、第三方评测机构与站内已查证档案,评测口径(版本 / 算力档 / 脚手架)标在备注里;因训练数据污染撤榜的成绩不收录。仅作记录,不构成选型建议。
模型 4 个成绩 4 条前沿刷新 3 次2025.11.18 → 2026.05.20
◈ 当前榜 CURRENT BOARD每个模型取最近一次公开成绩
| # | 模型 | 成绩 | 相对前沿 | 日期 | 口径 / 备注 |
|---|---|---|---|---|---|
| 1 | Qwen3.7-Max 阿里 · Qwen |
69.7% | 100 | Terminus 脚手架 · 第三方 tracker 观测(llmreference) 原文 ↗ | |
| 2 | DeepSeek-V4-Pro DeepSeek |
67.9% | 97.4 | 预览版 · 发布材料 原文 ↗ | |
| 3 | Gemini 3 Pro Google DeepMind |
54.2% | 77.8 | 官方自报 原文 ↗ | |
| 4 | GLM-4.7 智谱 · GLM |
41% | 58.8 | 官方自报 原文 ↗ |
◈ 能力曲线 CAPABILITY CURVE
● 公开成绩(悬停看读数,点击进档案)◆ 刷新纪录的成绩— 前沿线(历史最高分的阶梯)
◈ 前沿刷新记录 FRONTIER BREAKS榜首的保质期
| 日期 | 刷新者 | 分数 | 提升 | 在位 |
|---|---|---|---|---|
| Gemini 3 Pro Google DeepMind | 54.2% | 首个记录 | 157 天 | |
| DeepSeek-V4-Pro DeepSeek | 67.9% | +13.7 | 26 天 | |
| Qwen3.7-Max 阿里 · Qwen | 69.7% | +1.8 | 在位中 · 120 天 |