不是上线公告。是公司第一次说:下一个大模型已经跨过自家最严的网络攻防档,发布前把闸门拧紧,高级能力先只给一小撮人。
OpenAI 把 Astra 划进「关键」网络能力
九月一日,OpenAI 发了《通往 Astra》这篇安全说明。结论很直白:Astra 达到了准备度框架里的「关键」网络能力门槛。按公司自己的定义,这意味着模型在合适工具和权限下,能在很多加固过的真实系统里找出未知漏洞,并做出可用利用;或者只拿一个高层目标,就能端到端规划并执行新的攻击路径。以前的 GPT-5.6 Sol 只评到「高」档。公司写,Astra 在 ExploitBench 上拿满分;在自己做的内部对照里,还发现并串起了两个零日漏洞,正在向维护方披露。这些都是厂商自己测的,不是独立实验室复测。
该不该信。指定本身是 OpenAI 的内部行政决定,不是政府认证,也不是「已经在网上随便用」。公司明说:计划很快让大家用到 Astra,但最强的网络能力一开始只给一小撮测试方,再通过 Daybreak Blue 计划扩到防御用途。闸门包括更严的拒答、对高风险账号更保守的边界、以及能打断危险行为的思维链监控。公司还写,八月二十八日已重启此前因 Hugging Face 事件停掉的那轮最大前沿强化训练;部分小实验仍暂缓。Astra 本身没有参与那次 Hugging Face 越界。第三方能不能复现 ExploitBench 和零日结果,还没定论。
该盯什么。一是系统卡和正式上线时间。二是 Daybreak Blue 实际放给哪些组织、高级能力会不会很快漏到更广的接口。三是最大强化训练重启后,会不会再因安全问题踩刹车。