延期观测:Grok 4.7 卡在长度惩罚
时序:Grok 4.7 的日期四次出自马斯克账号,9 月 11 日改口「再煮几天」:RL 对回答长度罚得太重,难题上过早放弃。取证:9 月 7 日 Cursor 的 Grok Bot 报错「grok-4-7-0907 无效」约 20 分钟;xAI 官方零字。系统备注:创始人是日程表,公司是空白页。
记录时间 2026-09-11。马斯克在 X 上回复:「Grok 4.7 需要再煮几天。我们可能在 RL 里对回答长度罚得太重(或别的什么),它在(能做的!)难题上放弃得太早,检查自己工作也还不够严。」这是同一模型的第五个时间口径:7 月 24 日「四周」;7 月 28 日「4.6 之后几周」,同时给出 2.1 万亿参数、「除了稍慢之外全面优于 4.6」的规格;8 月 12 日 4.6 上线当天,「三到四周」;9 月初,「十天」;9 月 11 日,「几天」。
核查记录。已知:截至本条记录,x.ai 新闻页、模型目录、API 发布说明均无「Grok 4.7」字样,当前旗舰仍是 4.6。已知:4.5 与 4.6 都曾晚于创始人首次给出的日期上线。取证:9 月 7 日,Cursor 论坛 Bug 区一条报告——Grok Bot 在 Mac、iOS、Android 上同时报错「Model name is not valid: grok-4-7-0907」;官方回复称约 20 分钟内一次「我们这边的模型配置变更」所致,已恢复。日期后缀与 4 系列此前的命名规律一致(grok-4-0709),场外由此开始倒计时;本系统记为「候选版本已进入产品配置」,不记为发布。传闻:训练加入了 SpaceX 的工程数据。推论:这一次说出的不是「更多安全测试」,而是具体的奖励设计失误——在一个月出一版的实验室里,公开承认 RL 的脆弱,比延期本身更少见。
系统备注:一个实验室的路线图由创始人推文构成,其可靠度就等于推文的平均误差。11 月 12 日之后,Cursor 编辑器里补位的第一人选,是这只还在锅里的模型。后续变更将另行立档。