据动察 Beating 监测,OpenAI 开始主动放慢前沿模型训练。公司一度暂停部分前沿 RL 训练两周,规模最大的几项到现在还没恢复。Astra 的不少训练和评测也还停着。Hugging Face 入侵只是其中一个原因。OpenAI 同时发现,Astra 的网络攻击能力可能已经碰到内部定义的「Critical」门槛。这类高风险训练接下来必须先把隔离、监控和对齐做到更高标准,才能继续。奥特曼之前就说过,如果模型能力跑得比安全措施更快,AI 开发就该减速。Hugging Face 事件后,他也称这是第一次让自己真切感受到前沿模型的安全风险。随后超过 1200 名头部 AI 公司员工联署,要求行业建立统一的减速机制,其中包括多名 OpenAI 核心研究人员。现在 OpenAI 自己先踩了刹车。
所有评论