会议录音里最有用的往往不是逐字稿,而是「谁说了什么、废话删干净、专业术语别写错」——Gemini 3.5 Transcribe把转录从听写工具推向可编辑的结构化输入,为播客、会议与Agent工作流提供底层素材。
Google 8月26日发布Gemini 3.5 Transcribe,隶属Gemini Audio产品线,面向多语种转录与口述编辑。官方称相较前代Chirp 3在多语种表现与词错误率(WER)上升级,支持85种以上语言、用户自定义专业词汇表(适配行业术语拼写)、最多三名说话人分离、词级时间戳,并可自动去除「嗯」「啊」等填充词与基础格式化;用户亦可通过语音自然编辑转录文本。
发布范围与路线图:
所谓词错误率,白话是转录文本与真人发言相比错多少字——多语种场景下,错误往往出在专名与混语切换。所谓说话人分离,白话是在重叠不严重的录音里标注「这句话是谁说的」,方便会议纪要归责与剪辑。
产业观察上,音频转录正成为Agent的「耳朵」:上游接会议与播客,下游接摘要、待办与知识库入库。与OpenAI、微软等同类能力对照,Google优势在安卓与Workspace分发与多语种覆盖;短板仍待观察小语种方言、嘈杂环境与多人抢话场景。可以把它想成:给Gemini补上一块长音频硬盘——模型再聪明,也得先听懂。
需要把边界读清楚。85+语种能力在不同口音上差异大;企业合规场景须确认音频是否上云、保留多久。下一观察点是Workspace集成时间表、API定价与相较Chirp 3的独立第三方WER评测。