SWE-bench Pro (Multilingual)
SWE-bench Pro (Multilingual) 基准上各模型的公开成绩,按时间排列。数字全部取自官方发布材料、第三方评测机构与站内已查证档案,评测口径(版本 / 算力档 / 脚手架)标在备注里;因训练数据污染撤榜的成绩不收录。仅作记录,不构成选型建议。
模型 2 个成绩 2 条前沿刷新 1 次2026.09.22 → 2026.09.28
◈ 当前榜 CURRENT BOARD每个模型取最近一次公开成绩
| # | 模型 | 成绩 | 相对前沿 | 日期 | 口径 / 备注 |
|---|---|---|---|---|---|
| 1 | Claude Opus 5.5 Anthropic |
93.9% | 100 | 官方系统卡 · max 档 · 300 题九语言 原文 ↗ | |
| 2 | Claude Sonnet 5.5 Anthropic |
90.3% | 96.2 | 官方系统卡 · max 档 · 300 题九语言 原文 ↗ |
◈ 能力曲线 CAPABILITY CURVE
● 公开成绩(悬停看读数,点击进档案)◆ 刷新纪录的成绩— 前沿线(历史最高分的阶梯)
SWE-bench Verified · 46HLE · 22DeepSWE v1.1 · 18Terminal-Bench 2.1 · 18Terminal-Bench 4.0 · 18FrontierCode 1.1 Main · 13AA Intelligence Index · 12CursorBench 4.0 · 8SWE-bench Pro · 8AA Coding Agent Index · 7Terminal-Bench-Science 0.1 · 7CursorBench · 5Terminal-Bench 2.0 · 4Terminal-Bench 3.0 · 3SWE-bench Pro (Multimodal) · 2Terminal-Bench · 2
◈ 前沿刷新记录 FRONTIER BREAKS榜首的保质期
| 日期 | 刷新者 | 分数 | 提升 | 在位 |
|---|---|---|---|---|
| Claude Opus 5.5 Anthropic | 93.9% | 首个记录 | 在位中 · 12 天 |