Astra 定级 Critical:先设卡再发布
OpenAI 确认下一代模型 Astra 触及「Critical」网络能力阈值——史上首个能在无人指引下发现并利用未知漏洞的模型。仍称「很快」发布,攻防能力只向 Daybreak 联盟少数机构开放。它也是断供通牒里一概不给 Cursor 的那款。
9 月 1 日(周二),OpenAI 发文确认:即将发布的 Astra 是公司第一款越过 Preparedness Framework「Critical」网络安全能力阈值的模型——按其定义,能在多种加固的真实关键系统中不经人工干预地识别并开发各严重等级的零日漏洞利用,或仅凭一个高层目标就设计并执行端到端的新型攻击。此前 GPT-5.6 Sol 的评级是「High」。研究副总裁 Amelia Glaese 对记者的表述更直白:Astra 能找到此前未知的安全缺陷,并在无人逐步引导的情况下开发出利用方式。
时间线:8 月 1 日 OpenAI 确认 Astra 存在,称其解决了十个悬置多年的公开数学问题;8 月 7 日承认「无法排除」Critical 级网络能力,放慢发布节奏、暂停部分内部工作并加装安全控制;公司自述的「Hugging Face 事件」(官方称 Astra 并未卷入)又促使其暂停了部分前沿强化学习训练。9 月 1 日的结论是:安全措施已足以把严重危害的风险降到可发布的水平,Astra「很快」上线但不给时间表,最强的网络能力只向网络安全联盟 Daybreak 内的少数机构开放。官方同时预警:护栏可能误判正常操作——包括与安全无关的长时程 agent 任务——在 ChatGPT 与 Codex 里用户会被要求复核被标记的动作,走 API 则任务直接停止。
把这份公告放回本站的坐标里看:数日前 OpenAI 通知 SpaceX 将于 11 月 12 日停止向 Cursor 供应模型,并明言下一代模型 Astra 一概不予供给;今天它说清了 Astra 是什么——一款连自家都要先设卡再放行的模型。此前 Fable 5 因同类能力被商务部按停 19 天,GPT-5.5-Cyber 只向受审团队发放;模型能力的「危险档」单独发牌照,正从个案变成行业通例。Cursor 用户拿不到 Astra;从公告看,多数人拿到的也不会是完整的它。