GPT-5
OpenAI · GPT 谱系 · 2025.08.07 发布 · 在 2 项基准上留有 2 条公开成绩。数字全部取自官方发布材料、第三方评测机构与站内已查证档案,评测口径(版本 / 算力档 / 脚手架)标在备注里;因训练数据污染撤榜的成绩不收录。仅作记录,不构成选型建议。
OpenAI 统一旗舰,Cursor 零时差接入并联合开一周免费额度。此前两度求购 Cursor 被拒的 OpenAI,第一次把新旗舰的首发红毯铺到了它门口。
◈ 评分卡 SCORECARD
| 维度 | 基准 | 成绩 | 相对前沿 | 该维度当前最高 | 日期 |
|---|---|---|---|---|---|
| 编码 | SWE-bench Verified | 74.9% | 77.2 | Muse Spark 1.3 75.4% | 2025.08.07 |
| 前沿推理 | HLE | 24.8% | 40.7 | Claude Fable 5.1 60.9% | 2025.08.07 |
◈ 身份卡 IDENTITY
| 实验室 LAB | OpenAI |
| 谱系 FAMILY | GPT |
| 发布日 RELEASE | |
| 定位 TIER | 旗舰 |
| 上下文 CONTEXT | 400K |
| 价格 PRICE | $1.25 / $10 每百万 token 输入 / 输出 |
| 权重 WEIGHTS | 闭源 CLOSED |
| 状态 STATUS | 在役 ACTIVE |
| 信源 SOURCE | openai.com/index/introducing-gpt-5/ |
| 站内档案 ARCHIVE | 档案 #24 » |
◈ 全部公开成绩 ALL RESULTS2 条
| 基准 | 分数 | 日期 | 口径 / 备注 | 信源 |
|---|---|---|---|---|
| HLE | 24.8% | 无工具 · 官方自报 | 原文 ↗ | |
| SWE-bench Verified | 74.9% | 官方自报(477 题可复现子集) | 原文 ↗ |
◈ 同谱系 LINEAGEOpenAI · GPT · 由旧到新
◈ 相关档案 RELATED RECORDS按模型名在档案库检索 · 含正史与野史
OpenAI 发布 GPT-5,Cursor 零时差接入,并联合给全体付费用户开一周免费额度。此前两度求购被拒的 OpenAI,第一次把新旗舰的首发红毯铺到了 Cursor 门口——买不下来,就把模型卖给它。
交割前两天,Cursor 与 SpaceXAI 联合发布 Grok 4.6:主攻长任务 agent,智能指数与 GPT-5.6 Sol 打平,新增 Extra High 算力档。公告抬头第一顺位的名字,已经换了。
紧随 Grok 4.5 发布,OpenAI 甩出 GPT-5.6 家族:旗舰 Sol、均衡 Terra、走量 Luna。Coding Agent Index 80 分反超 Fable 5 近 3 分且便宜三成。数周之内,四张王牌全部亮出。
OpenAI 发布 GPT-5.5,API 开放次日进 Cursor,联合促销五折到 5 月 2 日。官方通稿里有一句耐人寻味:「这对用户托付给 Cursor 的长程工作最重要。」供货节奏至此跑成惯例:旗舰零时差。
十二天内三声枪响:11 月 12 日 GPT-5.1 打头,18 日 Gemini 3 进场,24 日 Opus 4.5 收官,三家实验室在同一个月里各自交出「史上最强编码模型」。榜首的保质期,从此开始按周计算。
GPT-5 上架同日,Cursor 放出第二件东西:Cursor CLI 早期测试——一行命令装好,终端里直接对 agent 下令,订阅内模型通吃,可并行或无头运行。官方自注:仍在 beta,护栏尚在演进,风险自负。终端这块地,此前只有 Claude Code 与 Codex 在种。