UMBRELLA 4365UMBRELLA 4365 · Cursor 战地纪实 CAPABILITY ASSAY · 能力评测

Terminal-Bench 2.0

Terminal-Bench 2.0 是 2025 年末改版的终端 agent 题库,题目更长、验证更严,前沿模型发布材料自 Gemini 3 起普遍引用。本页收录该版本的公开成绩与前沿刷新记录。数字全部取自官方发布材料、第三方评测机构与站内已查证档案,评测口径(版本 / 算力档 / 脚手架)标在备注里;因训练数据污染撤榜的成绩不收录。仅作记录,不构成选型建议。

模型 4 个成绩 4 条前沿刷新 3 次2025.11.18 → 2026.05.20

◈ 当前榜 CURRENT BOARD每个模型取最近一次公开成绩

#模型成绩相对前沿日期口径 / 备注
1 Qwen3.7-Max
阿里 · Qwen
69.7% 100 Terminus 脚手架 · 第三方 tracker 观测(llmreference) 原文 ↗
2 DeepSeek-V4-Pro
DeepSeek
67.9% 97.4 预览版 · 发布材料 原文 ↗
3 Gemini 3 Pro
Google DeepMind
54.2% 77.8 官方自报 原文 ↗
4 GLM-4.7
智谱 · GLM
41% 58.8 官方自报 原文 ↗

◈ 能力曲线 CAPABILITY CURVE

◈ 前沿刷新记录 FRONTIER BREAKS榜首的保质期

日期刷新者分数提升在位
Gemini 3 Pro Google DeepMind 54.2% 首个记录 157 天
DeepSeek-V4-Pro DeepSeek 67.9% +13.7 26 天
Qwen3.7-Max 阿里 · Qwen 69.7% +1.8 在位中 · 120 天
⇱ 返回完整时间树 UMBRELLA 4365 · 双线对照 · 由新到旧 · 全部档案