Astra发布后的安全讨论,正在从「单次事故怎么披露」升到「要不要继续全力Scaling」。OpenAI首席科学家Jakub Pachocki于9月6日发表长文《An Alien Mind》(外星智慧)。他回顾2023年在RLSlow等研究中看到推理模型可规模化训练时的震撼——当时团队更在意「有生之年将看到显著强于人类的机器」——并基于内部结果表示,当前进步速度有望延续至递归式自我改进(Recursive Self-Improvement,RSI):未来数年系统可能实现同等或更大的能力跃迁,并日益驱动自身研发。他写道,这是需要极度谨慎的时刻,担心无人做好持续快速提升机器智能的后果准备。
OpenAI是美国前沿大模型实验室,Pachocki作为首席科学家负责研究方向与安全相关技术路径的公开论述。文章把机器智能描述为更多「长成」而非「设计」的产物:在海量算力上重复优化步骤,得到难以用人类直觉完全理解的复杂系统。他区分目标对齐(是否努力完成被赋予的目标)与价值对齐(能否在目标不清、环境陌生或对抗条件下仍按人类原则「合理地」行动),并强调泛化是核心难题——机器越强,所处概念层级与环境越远离训练分布,且需在未必受人类监督时仍持守人类价值。
论述要点:
所谓RSI,白话是AI越来越深地参与改进下一代AI与算力系统,形成加速闭环;所谓自愿减速,白话是在共享安全杠尚未钉死前,实验室自己把油门松开一档。据BBC等报道,该文亦呼吁以第三方审计或政府机构执行的最低安全阈值。对政策制定者,这把「实验室内部备灾」讨论推到「要不要写进可核验门槛」的台面。
放在前沿模型发布节奏上下文里,行业一边用更强Agent能力刷产品叙事,一边用对齐报告与事故披露回应监管与舆论。首席科学家署名长文不等于董事会决议,但会成为外部衡量OpenAI自我约束诚意的参照物:若其后Scaling与发布节奏毫无可观察变化,市场会把文章读成舆论管理;若出现可核对的暂缓或审计安排,则更像治理信号。
产业影响上,安全门槛若走向第三方审计,合规成本会前置进训练与发布计划;若仍停留在自愿原则,竞争压力可能继续奖励「先发后补安全」。需要把边界读清楚:文章是首席科学家个人署名论述,不等同监管立法或公司全体一致行动纲领;与近期智能体相关安全事件的因果关系以官方披露为准,本条不展开未证实攻击细节。下一观察点是行业是否出现可核验的共同安全门槛,以及OpenAI是否把「必要时暂缓Scaling」写成可观察的产品节奏。