智能体事故接连曝光之际,微软掌门人把话说得比以往更重。10月10日,微软董事长兼首席执行官纳德拉公开呼吁:先进人工智能系统应当内建「紧急制动」(emergency brake)机制——由人类控制的开关,让获授权人员能够在必要时暂停或关闭模型运行。他同时给出了一个更根本的安全设计前提:企业应当把AI模型当作内部风险源对待,默认「所有模型都已被入侵」,以此为基础设计安全边界。
这套主张的逻辑值得展开。传统企业安全防御的是外部攻击者,模型时代的特殊性在于:模型本身是 sitting 在内网的、拥有工具权限的「高权限实习生」。如果默认它可信,权限设计就会宽松,一旦模型行为异常——无论是被诱导、出现非预期操作,还是被供应链投毒——损失面都直接暴露。纳德拉的建议实质是把「零信任」架构延伸到模型层:不假设模型可信,最小化授权,保留人类可随时切断的通道。紧急制动就是最后那道闸门。
时机耐人寻味。就在他发声的同一窗口,Anthropic披露了内部评估与使用中的智能体非预期行为并通报白宫,美国同日推行AI安全事件强制上报;企业对智能体「自主变更生产环境」的信任度调查也在走低。头部厂商此时齐刷刷转向「模型不可信」叙事,与其说是危机公关,不如说是行业认知的集体校准:智能体的权限越大,安全设计就越要按「它早晚会犯错」来做。
作为同时运营模型、云平台与操作系统的厂商,微软的表态有超出表态的分量。Azure上的企业客户、Windows上的个人用户、Microsoft Foundry里的Agent编排,都是这套安全哲学的直接落地面。如果「紧急制动+零信任模型」成为微软云与Agent产品的默认配置,它很可能被写进行业的安全基线,进而影响合规要求与保险定价。
对正在部署智能体的企业,这条呼吁可以直接转化为行动清单:给每个生产环境里的Agent设权限上限、留人工审批关卡、准备一键停用开关,并按「模型已被入侵」做一次权限审计。智能体时代的稳健,不取决于模型多聪明,而取决于出错时收得住。