Cursor 模型大战编年史
Cursor 是大模型厂商的前线阵地:Claude 3.5 改写默认项,GPT-5 免费进驻一周,Grok 匿名入场,Fable 5 断层登顶,GPT-5.6 夺回榜首,Opus 5 半价跟注。本线索记录各家旗舰模型在 Cursor 里的每一次进场、登顶、降价与换防——榜首的保质期,从以年计到以周计。
Anthropic 发布 3.5 Sonnet:跑分全面超过自家旗舰 Opus,速度翻倍,价格约五分之一。Cursor 团队评测后火速切换默认模型。此后两年的模型军备竞赛,起跑枪是这一声。
Opus 4 与 Sonnet 4 同日双发,官方冠名「世界最强编码模型」:SWE-bench 72.5%,早测客户见证它连续七小时自主重构。Cursor 首发接入,随后 Sonnet 4 慢速池被挤停数日——需求超出了所有人的产能预估。
OpenAI 发布 GPT-5,Cursor 零时差接入,并联合给全体付费用户开一周免费额度。此前两度求购被拒的 OpenAI,第一次把新旗舰的首发红毯铺到了 Cursor 门口——买不下来,就把模型卖给它。
xAI 发布 grok-code-fast-1:先以代号 sonic 匿名混进各编辑器一周,转正当天宣布在 Cursor 等首发伙伴限时免费。实测快到推理步骤来不及读。当时没人想到,这条便宜快枪是母公司系的先遣部队。
Sonnet 4.5 发布,号称当时全球最强编码模型,价格不变;八周后 Opus 4.5 跟进,价格砍到上代的三分之一,Cursor 同步开「按 Sonnet 价试用」。最强称号,一个秋天换了两次持有人。
十二天内三声枪响:11 月 12 日 GPT-5.1 打头,18 日 Gemini 3 进场,24 日 Opus 4.5 收官,三家实验室在同一个月里各自交出「史上最强编码模型」。榜首的保质期,从此开始按周计算。
Opus 4.7 发布,Cursor 当日上架,价格照旧。真正的新闻藏在措辞里:官方承认它「不如 Mythos Preview 全面」——那个只向少数机构开放的受限旗舰,日后将以 Fable 5 之名面世。
OpenAI 发布 GPT-5.5,API 开放次日进 Cursor,联合促销五折到 5 月 2 日。官方通稿里有一句耐人寻味:「这对用户托付给 Cursor 的长程工作最重要。」供货节奏至此跑成惯例:旗舰零时差。
Opus 4.8 发布,Cursor 同日上架。值得立档的细节在别处:Anthropic 的官方公告直接拿 CursorBench 当成绩单——一家编辑器公司的内部评测,成了模型厂发布会的通用度量衡。
Anthropic 打响 Claude 5 世代第一枪:Fable 5,「做了安全处理的 Mythos 级模型」。AA 智能指数 64.9 断层登顶,SWE-Bench Verified 95.5%,CursorBench 刷新纪录。它的第一个完整月,一半时间在停机。
出口管制解除的同一天,Anthropic 加更 Sonnet 5:agent 能力接近 Opus 4.8,中档价再打 33% 折,Cursor 当日上架。旗舰尚未回岗,替补先把便宜的活全接了下来。
紧随 Grok 4.5 发布,OpenAI 甩出 GPT-5.6 家族:旗舰 Sol、均衡 Terra、走量 Luna。Coding Agent Index 80 分反超 Fable 5 近 3 分且便宜三成。数周之内,四张王牌全部亮出。
Anthropic 发布 Opus 5:接近 Fable 5 的智能,价格一半,CursorBench 满力档与 Fable 峰值只差 0.5%。发布前它已在 Cursor 里两度走光——代号 Honeycomb,连报错弹窗都提前泄了底。
Anthropic 同日放出 Fable 5.1 与 Mythos 5.1:同一套权重,两道护栏。输入输出仍 10 / 50 美元每百万 token,缓存读取砍到四分之一。Cursor 当日上架,CursorBench 3.2 满力档 73.4%,自称测过最强。Mythos 仍只给受审通道。
现象:CursorBench 榜首当日进选择器,隐私模式与企业户默认关。取证:须在仪表盘签 Anthropic 三十日留存条款,全队生效。状态:Mythos 5.1 未上架。系统备注:最强模型的说明书,第一页是授权书。
OpenAI 放出 GPT-6 Astra,总裁 Brockman 当众说「欢迎来到 AGI 纪元」。API 每百万 token 10 / 50 美元,对标 Fable 5.1。先给 Daybreak,再放 Plus 与 API。Cursor 官方渠道没有这一款。
现象:发布会上宣告进入 AGI 纪元。取证:Cursor 状态页同日挂出 Grok、Anthropic、OpenAI 三起上游报错。状态:选择器里没有 Astra。系统备注:纪元的第一天,编辑器里能用的还是昨天的模型。
Cognition 发布 SWE-2:在月之暗面 2.8 万亿参数的开源模型 Kimi K3 上再做强化学习,FrontierCode 1.1 Main 50.0%,距 Fable 5.1 一分,成本低 64%。不放权重、无 API,只在 Devin 内可用。
时序:Grok 4.7 的日期四次出自马斯克账号,9 月 11 日改口「再煮几天」:RL 对回答长度罚得太重,难题上过早放弃。取证:9 月 7 日 Cursor 的 Grok Bot 报错「grok-4-7-0907 无效」约 20 分钟;xAI 官方零字。系统备注:创始人是日程表,公司是空白页。