几秒钟的语音消息,就可能被做成另一句「本人」说的话。国家安全部把这件事从产品能力,改写成公开风险提示。
国家安全部负责国家安全领域的公开警示。7月22日,它指出:人工智能语音克隆的滥用,已经严重扰乱社会秩序,并侵害人民群众财产安全。语音克隆,是拿一段真人录音,合成出音色像本人的新语句。它不是变声特效,而是让听的人以为电话那头就是某个具体的人。
关键变化在样本长度。主流商业平台所需的最短训练材料,已从几十分钟压到3至5秒。一条随手发出的语音、短视频里的人声、一通电话里的简短应答,都落在这个长度里。合成结果在自然度、情感和口音上,已经让人难以分辨。研究显示,在没有任何提示时,普通人识别高质量合成语音的准确率不足50%。不足一半,意味着「听着像」不能再当作身份核验。
三类滥用被单独点出。
声纹是声音里指向某一个人的特征。深度合成,是用生成模型做出原本不存在的音视频。脸和声音在法律上被放在一起:《民法典》规定,对自然人声音的保护,参照肖像权。肖像权管的是未经同意使用人脸;声音被拉进同类,意思是拿别人的声音去合成,同样可以主张权利。
服务侧有两份已生效的规则。《生成式人工智能服务管理暂行办法》和《互联网信息服务深度合成管理规定》要求:做深度合成语音的平台要备案,用户要实名,使用前要做授权核验,输出要带溯源标识。严禁没有约束的声纹克隆。备案是向主管部门登记服务,实名是知道谁在用,授权核验是确认声音主人同意,溯源标识是让成品能追到生成方。
对普通人,短语音不再是发完即弃的碎片。对平台,样本越短,上述四项越不能做成可选项。银行、客服和政务热线若仍把「听声音」当成本人确认,就会和这则提示对着干:提示已经把识别准确率放在不足50%的位置上。
下一步能核对的,是备案、实名和标识有没有被执行,而不是再宣布一次「听起来更像」。个人能做的,是少在公开场合留下可被截取的长段独白;平台能做的,是把授权核验放在生成之前,而不是生成之后再打补丁。