Grok 4
xAI / SpaceXAI · Grok 谱系 · 2025.07.09 发布 · 在 1 项基准上留有 1 条公开成绩。数字全部取自官方发布材料、第三方评测机构与站内已查证档案,评测口径(版本 / 算力档 / 脚手架)标在备注里;因训练数据污染撤榜的成绩不收录。仅作记录,不构成选型建议。
xAI 旗舰,HLE 与 ARC-AGI-2 上宣称领先;「Heavy」多 agent 版随每月 300 美元的顶配订阅推出。
◈ 评分卡 SCORECARD
| 维度 | 基准 | 成绩 | 相对前沿 | 该维度当前最高 | 日期 |
|---|---|---|---|---|---|
| 前沿推理 | HLE | 25.4% | 41.7 | Claude Fable 5.1 60.9% | 2025.07.09 |
◈ 身份卡 IDENTITY
| 实验室 LAB | xAI / SpaceXAI |
| 谱系 FAMILY | Grok |
| 发布日 RELEASE | |
| 定位 TIER | 旗舰 |
| 上下文 CONTEXT | 256K |
| 价格 PRICE | $3 / $15 每百万 token 输入 / 输出 |
| 权重 WEIGHTS | 闭源 CLOSED |
| 状态 STATUS | 在役 ACTIVE |
| 信源 SOURCE | x.ai/news/grok-4 |
| 站内档案 ARCHIVE | — |
◈ 全部公开成绩 ALL RESULTS1 条
◈ 同谱系 LINEAGExAI / SpaceXAI · Grok · 由旧到新
◈ 相关档案 RELATED RECORDS按模型名在档案库检索 · 含正史与野史
时序:Grok 4.7 的日期四次出自马斯克账号,9 月 11 日改口「再煮几天」:RL 对回答长度罚得太重,难题上过早放弃。取证:9 月 7 日 Cursor 的 Grok Bot 报错「grok-4-7-0907 无效」约 20 分钟;xAI 官方零字。系统备注:创始人是日程表,公司是空白页。
交割前两天,Cursor 与 SpaceXAI 联合发布 Grok 4.6:主攻长任务 agent,智能指数与 GPT-5.6 Sol 打平,新增 Extra High 算力档。公告抬头第一顺位的名字,已经换了。
印度专属套餐上线:月费 649 卢比含税、支持 UPI,包含 Grok 4.5 与 Composer 额度。官方同时披露:印度用户超 300 万,约占全球十一分之一,且每席位 agent 请求数全球第一。区域定价线就此划开。
紧随 Grok 4.5 发布,OpenAI 甩出 GPT-5.6 家族:旗舰 Sol、均衡 Terra、走量 Luna。Coding Agent Index 80 分反超 Fable 5 近 3 分且便宜三成。数周之内,四张王牌全部亮出。
算力联姻后的第一件联合作品:Cursor 与 SpaceXAI 共训的 Grok 4.5 上线,训练数据含数万亿 token 的 Cursor 数据。$2/$6 把 Opus 级智能打到地板价。发布帖脚注里埋着一颗雷,随即引爆。
取证:Grok 4.5 发布帖脚注承认,一份 Cursor 自家代码库快照「意外混入」训练数据,CursorBench 成绩连夜撤榜。舆论鉴定:考题进了复习资料,这分不能算。系统备注:护城河是用别人家的铲子挖的。