GPT-5.6 Sol
OpenAI · GPT 谱系 · 2026.07.09 发布 · 在 9 项基准上留有 10 条公开成绩。数字全部取自官方发布材料、第三方评测机构与站内已查证档案,评测口径(版本 / 算力档 / 脚手架)标在备注里;因训练数据污染撤榜的成绩不收录。仅作记录,不构成选型建议。
GPT-5.6 家族旗舰,编码 Agent 指数刷新纪录、反超 Fable 5 且便宜三成。GA 当天 Cursor 未同步上架,数日后才进原生选择器;随后连环降价。
◈ 评分卡 SCORECARD
综合分 · 相对前沿74.9
总排名#11 / 27
已测维度6 / 6
综合分 = 各已测维度「相对前沿分」的平均:每个维度取该模型最近一次公开成绩,除以该维度当前最高分(最高 = 100)。至少两个维度有成绩才入总榜,覆盖维度数标在分数旁;未测不等于不行,只是没人公开考过。
| 维度 | 基准 | 成绩 | 相对前沿 | 该维度当前最高 | 日期 |
|---|---|---|---|---|---|
| 编码 | DeepSWE v1.1 | 72.7% | 96.4 | Muse Spark 1.3 75.4% | 2026.09.02 |
| 终端 Agent | Terminal-Bench 4.0 | 37.3% | 61.2 | Claude Mythos 5.1 60.9% | 2026.09.03 |
| 科研 Agent | Terminal-Bench-Science 0.1 | 22.4% | 34.7 | GPT-6 Astra 64.6% | 2026.09.01 |
| Cursor 考卷 | CursorBench | 67.2% | 91.6 | Claude Fable 5.1 73.4% | 2026.09.01 |
| 综合智能 | AA Intelligence Index | 61 分 | 92.4 | Claude Fable 5.1 66 分 | 2026.09.01 |
| 前沿推理 | HLE | 44.5% | 73.1 | Claude Fable 5.1 60.9% | 2026.07.16 |
◈ 身份卡 IDENTITY
| 实验室 LAB | OpenAI |
| 谱系 FAMILY | GPT |
| 发布日 RELEASE | |
| 定位 TIER | 旗舰 |
| 上下文 CONTEXT | — |
| 价格 PRICE | $5 / $30 每百万 token 输入 / 输出 |
| 权重 WEIGHTS | 闭源 CLOSED |
| 状态 STATUS | 在役 ACTIVE |
| 信源 SOURCE | openai.com/index/gpt-5-6/ |
| 站内档案 ARCHIVE | 档案 #63 » |
◈ 全部公开成绩 ALL RESULTS10 条
| 基准 | 分数 | 日期 | 口径 / 备注 | 信源 |
|---|---|---|---|---|
| AA Coding Agent Index | 65.1 分 | v1.4 版指数 · 据 GPT-6 Astra 发布对照表(7 月发布时口径为 80,指数已重算) | 原文 ↗ | |
| AA Coding Agent Index | 80 分 | 第三方 · 刷新纪录,超 Fable 5 约 2.8 分 | 原文 ↗ | |
| AA Intelligence Index | 61 分 | 2026-09 版指数 | 原文 ↗ | |
| CursorBench | 67.2% | CursorBench 3.2 · 据 Fable 5.1 发布对照表 | 原文 ↗ | |
| DeepSWE v1.1 | 72.7% | 据 Gemini 3.8 Flash 发布对照表 | 原文 ↗ | |
| FrontierCode 1.1 Main | 47.5% | 据 GPT-6 Astra 发布对照表(Extended 60.6) | 原文 ↗ | |
| HLE | 44.5% | 无工具 · 据 Kimi K3 技术报告对照表(带工具 58.0) | 原文 ↗ | |
| Terminal-Bench 2.1 | 88.8% | 据 Kimi K3 技术报告对照表 · max 档 | 原文 ↗ | |
| Terminal-Bench 4.0 | 37.3% | 据 GPT-6 Astra 发布对照表 · 最大努力档 | 原文 ↗ | |
| Terminal-Bench-Science 0.1 | 22.4% | 据 Fable 5.1 发布对照表 | 原文 ↗ |
◈ 同谱系 LINEAGEOpenAI · GPT · 由旧到新
◈ 相关档案 RELATED RECORDS按模型名在档案库检索 · 含正史与野史
正史夺榜
GPT-5.6 三连星夺回榜首
紧随 Grok 4.5 发布,OpenAI 甩出 GPT-5.6 家族:旗舰 Sol、均衡 Terra、走量 Luna。Coding Agent Index 80 分反超 Fable 5 近 3 分且便宜三成。数周之内,四张王牌全部亮出。
正史整合
Grok 4.6:交割前最后联名
交割前两天,Cursor 与 SpaceXAI 联合发布 Grok 4.6:主攻长任务 agent,智能指数与 GPT-5.6 Sol 打平,新增 Extra High 算力档。公告抬头第一顺位的名字,已经换了。