UMBRELLA 4365UMBRELLA 4365 · Cursor 战地纪实 STRAIN DOSSIER · 毒株档案 · OpenAI

GPT-5

OpenAI · GPT 谱系 · 2025.08.07 发布 · 在 2 项基准上留有 2 条公开成绩。数字全部取自官方发布材料、第三方评测机构与站内已查证档案,评测口径(版本 / 算力档 / 脚手架)标在备注里;因训练数据污染撤榜的成绩不收录。仅作记录,不构成选型建议。

OpenAI 统一旗舰,Cursor 零时差接入并联合开一周免费额度。此前两度求购 Cursor 被拒的 OpenAI,第一次把新旗舰的首发红毯铺到了它门口。

◈ 评分卡 SCORECARD

综合分 · 相对前沿59.0
总排名#23 / 27
已测维度2 / 6
综合分 = 各已测维度「相对前沿分」的平均:每个维度取该模型最近一次公开成绩,除以该维度当前最高分(最高 = 100)。至少两个维度有成绩才入总榜,覆盖维度数标在分数旁;未测不等于不行,只是没人公开考过。
维度基准成绩相对前沿该维度当前最高日期
编码 SWE-bench Verified 74.9% 77.2 Muse Spark 1.3 75.4% 2025.08.07
前沿推理 HLE 24.8% 40.7 Claude Fable 5.1 60.9% 2025.08.07

◈ 身份卡 IDENTITY

实验室 LABOpenAI
谱系 FAMILYGPT
发布日 RELEASE
定位 TIER旗舰
上下文 CONTEXT400K
价格 PRICE$1.25 / $10 每百万 token 输入 / 输出
权重 WEIGHTS闭源 CLOSED
状态 STATUS在役 ACTIVE
信源 SOURCEopenai.com/index/introducing-gpt-5/
站内档案 ARCHIVE档案 #24 »

◈ 全部公开成绩 ALL RESULTS2 条

基准分数日期口径 / 备注信源
HLE 24.8% 无工具 · 官方自报 原文 ↗
SWE-bench Verified 74.9% 官方自报(477 题可复现子集) 原文 ↗

◈ 同谱系 LINEAGEOpenAI · GPT · 由旧到新

◈ 相关档案 RELATED RECORDS按模型名在档案库检索 · 含正史与野史

正史反攻
GPT-5 首发进驻,免费一周

OpenAI 发布 GPT-5,Cursor 零时差接入,并联合给全体付费用户开一周免费额度。此前两度求购被拒的 OpenAI,第一次把新旗舰的首发红毯铺到了 Cursor 门口——买不下来,就把模型卖给它。

正史整合
Grok 4.6:交割前最后联名

交割前两天,Cursor 与 SpaceXAI 联合发布 Grok 4.6:主攻长任务 agent,智能指数与 GPT-5.6 Sol 打平,新增 Extra High 算力档。公告抬头第一顺位的名字,已经换了。

正史夺榜
GPT-5.6 三连星夺回榜首

紧随 Grok 4.5 发布,OpenAI 甩出 GPT-5.6 家族:旗舰 Sol、均衡 Terra、走量 Luna。Coding Agent Index 80 分反超 Fable 5 近 3 分且便宜三成。数周之内,四张王牌全部亮出。

正史军备
GPT-5.5 进场:官方五折

OpenAI 发布 GPT-5.5,API 开放次日进 Cursor,联合促销五折到 5 月 2 日。官方通稿里有一句耐人寻味:「这对用户托付给 Cursor 的长程工作最重要。」供货节奏至此跑成惯例:旗舰零时差。

正史军备
GPT、Gemini、Opus 十一月连发

十二天内三声枪响:11 月 12 日 GPT-5.1 打头,18 日 Gemini 3 进场,24 日 Opus 4.5 收官,三家实验室在同一个月里各自交出「史上最强编码模型」。榜首的保质期,从此开始按周计算。

正史破壁
Cursor CLI:Agent 走出编辑器

GPT-5 上架同日,Cursor 放出第二件东西:Cursor CLI 早期测试——一行命令装好,终端里直接对 agent 下令,订阅内模型通吃,可并行或无头运行。官方自注:仍在 beta,护栏尚在演进,风险自负。终端这块地,此前只有 Claude Code 与 Codex 在种。

⇱ 返回完整时间树 UMBRELLA 4365 · 双线对照 · 由新到旧 · 全部档案