UMBRELLA 4365UMBRELLA 4365 · Cursor 战地纪实 CAPABILITY ASSAY · 能力评测

Terminal-Bench

Terminal-Bench 让模型在真实终端环境里完成端到端任务(编译、部署、排障、数据处理),是衡量 agent 自主执行能力的主流基准。本页收录 2025 年初版题库的成绩;题库改版后的 2.0 / 4.0 因不可比而分列独立页面。数字全部取自官方发布材料、第三方评测机构与站内已查证档案,评测口径(版本 / 算力档 / 脚手架)标在备注里;因训练数据污染撤榜的成绩不收录。仅作记录,不构成选型建议。

模型 2 个成绩 2 条前沿刷新 1 次2025.05.22 → 2025.08.21

◈ 当前榜 CURRENT BOARD每个模型取最近一次公开成绩

#模型成绩相对前沿日期口径 / 备注
1 Claude Opus 4
Anthropic
43.2% 100 2025 年初版题库 · 官方自报 原文 ↗
2 DeepSeek-V3.1
DeepSeek
31.3% 72.5 初版题库 · 官方更新日志自报 原文 ↗

◈ 能力曲线 CAPABILITY CURVE

◈ 前沿刷新记录 FRONTIER BREAKS榜首的保质期

日期刷新者分数提升在位
Claude Opus 4 Anthropic 43.2% 首个记录 在位中 · 483 天
⇱ 返回完整时间树 UMBRELLA 4365 · 双线对照 · 由新到旧 · 全部档案