UMBRELLA 4365UMBRELLA 4365 · Cursor 战地纪实 SERIES FILE · 19 NODES

Cursor 模型大战编年史

Cursor 是大模型厂商的前线阵地:Claude 3.5 改写默认项,GPT-5 免费进驻一周,Grok 匿名入场,Fable 5 断层登顶,GPT-5.6 夺回榜首,Opus 5 半价跟注。本线索记录各家旗舰模型在 Cursor 里的每一次进场、登顶、降价与换防——榜首的保质期,从以年计到以周计。

◈ 事件线索 · 模型军备 · 19 个节点(正史 16 · 野史 3) · 窗口跨度 813 天 · 由旧到新
正史点火
Claude 3.5 Sonnet 改写默认项

Anthropic 发布 3.5 Sonnet:跑分全面超过自家旗舰 Opus,速度翻倍,价格约五分之一。Cursor 团队评测后火速切换默认模型。此后两年的模型军备竞赛,起跑枪是这一声。

正史军备
Claude 4 双发:七小时不下桌

Opus 4 与 Sonnet 4 同日双发,官方冠名「世界最强编码模型」:SWE-bench 72.5%,早测客户见证它连续七小时自主重构。Cursor 首发接入,随后 Sonnet 4 慢速池被挤停数日——需求超出了所有人的产能预估。

正史反攻
GPT-5 首发进驻,免费一周

OpenAI 发布 GPT-5,Cursor 零时差接入,并联合给全体付费用户开一周免费额度。此前两度求购被拒的 OpenAI,第一次把新旗舰的首发红毯铺到了 Cursor 门口——买不下来,就把模型卖给它。

正史进场
代号 sonic:Grok 匿名入场

xAI 发布 grok-code-fast-1:先以代号 sonic 匿名混进各编辑器一周,转正当天宣布在 Cursor 等首发伙伴限时免费。实测快到推理步骤来不及读。当时没人想到,这条便宜快枪是母公司系的先遣部队。

正史双子
4.5 双子:最强称号连庄

Sonnet 4.5 发布,号称当时全球最强编码模型,价格不变;八周后 Opus 4.5 跟进,价格砍到上代的三分之一,Cursor 同步开「按 Sonnet 价试用」。最强称号,一个秋天换了两次持有人。

正史军备
GPT、Gemini、Opus 十一月连发

十二天内三声枪响:11 月 12 日 GPT-5.1 打头,18 日 Gemini 3 进场,24 日 Opus 4.5 收官,三家实验室在同一个月里各自交出「史上最强编码模型」。榜首的保质期,从此开始按周计算。

正史军备
Opus 4.7 与门后的 Mythos

Opus 4.7 发布,Cursor 当日上架,价格照旧。真正的新闻藏在措辞里:官方承认它「不如 Mythos Preview 全面」——那个只向少数机构开放的受限旗舰,日后将以 Fable 5 之名面世。

正史军备
GPT-5.5 进场:官方五折

OpenAI 发布 GPT-5.5,API 开放次日进 Cursor,联合促销五折到 5 月 2 日。官方通稿里有一句耐人寻味:「这对用户托付给 Cursor 的长程工作最重要。」供货节奏至此跑成惯例:旗舰零时差。

正史军备
Opus 4.8 官宣引用 CursorBench

Opus 4.8 发布,Cursor 同日上架。值得立档的细节在别处:Anthropic 的官方公告直接拿 CursorBench 当成绩单——一家编辑器公司的内部评测,成了模型厂发布会的通用度量衡。

正史登顶
Fable 5 登顶:断层近 5 分

Anthropic 打响 Claude 5 世代第一枪:Fable 5,「做了安全处理的 Mythos 级模型」。AA 智能指数 64.9 断层登顶,SWE-Bench Verified 95.5%,CursorBench 刷新纪录。它的第一个完整月,一半时间在停机。

正史平价
Sonnet 5:解封日的加更

出口管制解除的同一天,Anthropic 加更 Sonnet 5:agent 能力接近 Opus 4.8,中档价再打 33% 折,Cursor 当日上架。旗舰尚未回岗,替补先把便宜的活全接了下来。

正史夺榜
GPT-5.6 三连星夺回榜首

紧随 Grok 4.5 发布,OpenAI 甩出 GPT-5.6 家族:旗舰 Sol、均衡 Terra、走量 Luna。Coding Agent Index 80 分反超 Fable 5 近 3 分且便宜三成。数周之内,四张王牌全部亮出。

正史平替
Opus 5:半价逼近 Fable

Anthropic 发布 Opus 5:接近 Fable 5 的智能,价格一半,CursorBench 满力档与 Fable 峰值只差 0.5%。发布前它已在 Cursor 里两度走光——代号 Honeycomb,连报错弹窗都提前泄了底。

正史登顶
Fable 5.1:CursorBench 73.4%

Anthropic 同日放出 Fable 5.1 与 Mythos 5.1:同一套权重,两道护栏。输入输出仍 10 / 50 美元每百万 token,缓存读取砍到四分之一。Cursor 当日上架,CursorBench 3.2 满力档 73.4%,自称测过最强。Mythos 仍只给受审通道。

野史冷眼
门闸观测:榜首要签留存条款

现象:CursorBench 榜首当日进选择器,隐私模式与企业户默认关。取证:须在仪表盘签 Anthropic 三十日留存条款,全队生效。状态:Mythos 5.1 未上架。系统备注:最强模型的说明书,第一页是授权书。

正史纪元
GPT-6 Astra 上线,官方不供

OpenAI 放出 GPT-6 Astra,总裁 Brockman 当众说「欢迎来到 AGI 纪元」。API 每百万 token 10 / 50 美元,对标 Fable 5.1。先给 Daybreak,再放 Plus 与 API。Cursor 官方渠道没有这一款。

野史冷眼
纪元开门:状态页先于模型

现象:发布会上宣告进入 AGI 纪元。取证:Cursor 状态页同日挂出 Grok、Anthropic、OpenAI 三起上游报错。状态:选择器里没有 Astra。系统备注:纪元的第一天,编辑器里能用的还是昨天的模型。

正史军备⌖ DEVIN 战区
SWE-2:Kimi K3 底座,省 64%

Cognition 发布 SWE-2:在月之暗面 2.8 万亿参数的开源模型 Kimi K3 上再做强化学习,FrontierCode 1.1 Main 50.0%,距 Fable 5.1 一分,成本低 64%。不放权重、无 API,只在 Devin 内可用。

野史情报
延期观测:Grok 4.7 卡在长度惩罚

时序:Grok 4.7 的日期四次出自马斯克账号,9 月 11 日改口「再煮几天」:RL 对回答长度罚得太重,难题上过早放弃。取证:9 月 7 日 Cursor 的 Grok Bot 报错「grok-4-7-0907 无效」约 20 分钟;xAI 官方零字。系统备注:创始人是日程表,公司是空白页。

⇱ 返回完整时间树 UMBRELLA 4365 · 双线对照 · 由新到旧 · 全部档案