UMBRELLA 4365UMBRELLA 4365 · Cursor 战地纪实 STRAIN DOSSIER · 毒株档案 · xAI / SpaceXAI

Grok 4

xAI / SpaceXAI · Grok 谱系 · 2025.07.09 发布 · 在 1 项基准上留有 1 条公开成绩。数字全部取自官方发布材料、第三方评测机构与站内已查证档案,评测口径(版本 / 算力档 / 脚手架)标在备注里;因训练数据污染撤榜的成绩不收录。仅作记录,不构成选型建议。

xAI 旗舰,HLE 与 ARC-AGI-2 上宣称领先;「Heavy」多 agent 版随每月 300 美元的顶配订阅推出。

◈ 评分卡 SCORECARD

综合分 · 相对前沿
总排名未入榜
已测维度1 / 6
仅一个维度有公开成绩,不计综合分。综合分 = 各已测维度「相对前沿分」的平均:每个维度取该模型最近一次公开成绩,除以该维度当前最高分(最高 = 100)。至少两个维度有成绩才入总榜,覆盖维度数标在分数旁;未测不等于不行,只是没人公开考过。
维度基准成绩相对前沿该维度当前最高日期
前沿推理 HLE 25.4% 41.7 Claude Fable 5.1 60.9% 2025.07.09

◈ 身份卡 IDENTITY

实验室 LABxAI / SpaceXAI
谱系 FAMILYGrok
发布日 RELEASE
定位 TIER旗舰
上下文 CONTEXT256K
价格 PRICE$3 / $15 每百万 token 输入 / 输出
权重 WEIGHTS闭源 CLOSED
状态 STATUS在役 ACTIVE
信源 SOURCEx.ai/news/grok-4
站内档案 ARCHIVE

◈ 全部公开成绩 ALL RESULTS1 条

基准分数日期口径 / 备注信源
HLE 25.4% 无工具 · 官方自报(带工具 38.6%) 原文 ↗

◈ 同谱系 LINEAGExAI / SpaceXAI · Grok · 由旧到新

◈ 相关档案 RELATED RECORDS按模型名在档案库检索 · 含正史与野史

野史情报
延期观测:Grok 4.7 卡在长度惩罚

时序:Grok 4.7 的日期四次出自马斯克账号,9 月 11 日改口「再煮几天」:RL 对回答长度罚得太重,难题上过早放弃。取证:9 月 7 日 Cursor 的 Grok Bot 报错「grok-4-7-0907 无效」约 20 分钟;xAI 官方零字。系统备注:创始人是日程表,公司是空白页。

正史整合
Grok 4.6:交割前最后联名

交割前两天,Cursor 与 SpaceXAI 联合发布 Grok 4.6:主攻长任务 agent,智能指数与 GPT-5.6 Sol 打平,新增 Extra High 算力档。公告抬头第一顺位的名字,已经换了。

正史发布
Cursor Start:印度 649 卢比

印度专属套餐上线:月费 649 卢比含税、支持 UPI,包含 Grok 4.5 与 Composer 额度。官方同时披露:印度用户超 300 万,约占全球十一分之一,且每席位 agent 请求数全球第一。区域定价线就此划开。

正史夺榜
GPT-5.6 三连星夺回榜首

紧随 Grok 4.5 发布,OpenAI 甩出 GPT-5.6 家族:旗舰 Sol、均衡 Terra、走量 Luna。Coding Agent Index 80 分反超 Fable 5 近 3 分且便宜三成。数周之内,四张王牌全部亮出。

正史发布
Grok 4.5:联合训练第一枪

算力联姻后的第一件联合作品:Cursor 与 SpaceXAI 共训的 Grok 4.5 上线,训练数据含数万亿 token 的 Cursor 数据。$2/$6 把 Opus 级智能打到地板价。发布帖脚注里埋着一颗雷,随即引爆。

野史扒皮
训练数据混入:自家代码

取证:Grok 4.5 发布帖脚注承认,一份 Cursor 自家代码库快照「意外混入」训练数据,CursorBench 成绩连夜撤榜。舆论鉴定:考题进了复习资料,这分不能算。系统备注:护城河是用别人家的铲子挖的。

⇱ 返回完整时间树 UMBRELLA 4365 · 双线对照 · 由新到旧 · 全部档案