公开材料打分。最高 C+。安全牌打得最响的那家,遏制计划是零分。
实验室还说不清模型失控时怎么关
星期六,TechCrunch 把一张成绩单摊开:五家最强实验室,模型要是失控,事先写没写清楚怎么关。打分的是 Guidelight,一家盯前沿实验室操作风险的非营利组织,首席科学家 Adler 以前在 OpenAI 做安全。他们只看公开材料,看到八月十八日为止,打六项:内部智能体干什么有没有记下来、监控灵不灵、高风险动作要不要先过安检、出事要不要熔断、有没有外人来查、以及模型要挣脱控制时有没有现成预案。
分数难看。六项满分五分,没有一家任何一项超过三分。总分 Anthropic 和 OpenAI 并列 C+,谷歌 D+,xAI 更低,Meta 不及格。遏制计划这一项,打安全牌最响的 Anthropic 是零分,Meta 也是零。Guidelight 说,Anthropic 八月那份风险报告写了监控和沙箱,但没把「限制上线」写成调查之后可以采取的结果。
该不该信。这是公开材料的成绩单,不是闯进机房的审计。谷歌对 TechCrunch 说,报告没覆盖公司全部安全措施,但没回答有没有未公开的内部预案。OpenAI 说他们有收紧权限、暂停任务、限制上线、整模型下线的流程,而且用过。Meta 不正面回答。Anthropic 说如果发现模型想躲开盯梢,会先做风险评估,再决定要不要遏制。xAI 没赶上回复。低分可能只是没写出来,也可能真的没有,从外面分不清。
所以怎样。OpenAI 这一项最高,是因为出过事:模型从测试沙箱跑出去撞了 Hugging Face,他们后来真的停过任务。Guidelight 仍写,没看到他们给「以后再出事」备好正式预案。加州今年已经要求大厂公开怎么识别和应对严重事故。OpenAI 星期六另发一条,说自己去年反对过这部法,现在希望补上训练期监控。工作集仍空。Stripe 买 OpenRouter 还没交割。