Google|Gemini 3.5 Transcribe:85+语种转录并自动去语气词

PromptTree|阅读 0
2026/08/27 19:11
GoogleGemini语音转录多模态
Google 8月26日发布Gemini 3.5 Transcribe,支持85种以上语言、自定义词汇表、最多三名说话人分离与词级时间戳,可自动去除填充词并支持语音编辑转录。首发macOS Gemini英语与Android部分市场Rambler听写;开发者可在Gemini API公测。同日仅正式发布Transcribe,Gemini 3.5 Pro仍待发布。

会议录音里最有用的往往不是逐字稿,而是「谁说了什么、废话删干净、专业术语别写错」——Gemini 3.5 Transcribe把转录从听写工具推向可编辑的结构化输入,为播客、会议与Agent工作流提供底层素材。

Google 8月26日发布Gemini 3.5 Transcribe,隶属Gemini Audio产品线,面向多语种转录与口述编辑。官方称相较前代Chirp 3在多语种表现与词错误率(WER)上升级,支持85种以上语言、用户自定义专业词汇表(适配行业术语拼写)、最多三名说话人分离、词级时间戳,并可自动去除「嗯」「啊」等填充词与基础格式化;用户亦可通过语音自然编辑转录文本。

发布范围与路线图:

  1. 消费者:macOS Gemini应用全体用户的英语转录;Android部分国家与语言的Rambler听写功能。
  2. 开发者:Gemini API在AI Studio与Antigravity公测预览;Chrome支持即将推出。
  3. 产品节奏:Google原计划同日发布的Gemini 3.5 Live相关更新,经后续更正,8月26日仅Transcribe为正式官宣项;Gemini 3.5 Pro仍待发布(此前曾预期2026年6月 rollout)。

所谓词错误率,白话是转录文本与真人发言相比错多少字——多语种场景下,错误往往出在专名与混语切换。所谓说话人分离,白话是在重叠不严重的录音里标注「这句话是谁说的」,方便会议纪要归责与剪辑。

产业观察上,音频转录正成为Agent的「耳朵」:上游接会议与播客,下游接摘要、待办与知识库入库。与OpenAI、微软等同类能力对照,Google优势在安卓与Workspace分发与多语种覆盖;短板仍待观察小语种方言、嘈杂环境与多人抢话场景。可以把它想成:给Gemini补上一块长音频硬盘——模型再聪明,也得先听懂。

需要把边界读清楚。85+语种能力在不同口音上差异大;企业合规场景须确认音频是否上云、保留多久。下一观察点是Workspace集成时间表、API定价与相较Chirp 3的独立第三方WER评测。