Meta|Muse Voice Transcribe上线:转写、分离与端点检测一体

PromptTree|阅读 0
2026/09/03 08:34
MetaMuse Voice Transcribe语音识别说话人分离
Meta近窗发布首个实时音频感知模型Muse Voice Transcribe,在单一模型中完成流式ASR、20+说话人分离与端点检测。Meta Model API定价约0.18美元/音频小时,已用于Mac版Meta AI与Muse Code听写;公开称Artificial Analysis流式榜前列、词错误率约3.1%量级,托管API不开放权重。

企业语音栈若要拼三套模型才能同时做到转写、区分说话人与判断何时说完,集成成本会先于准确率把项目拖死。Meta Superintelligence Labs近窗发布首个实时音频感知模型Muse Voice Transcribe:把流式语音识别、说话人分离与端点检测收进同一条自回归链路,并把价格压到公开可比的低位区间。

Meta近年在开放模型与多模态感知上持续加码,Muse系列面向开发者与创作工具。Voice Transcribe被定位为「实时音频感知」而非事后批处理转写:一边听一边出字、标人、判断话轮结束,减少后处理管道。它已直接驱动Meta AI for Mac与Muse Code中的听写体验,说明内部产品与对外API同步上线。对企业来说,这意味着「先在自家App里跑通,再把同一模型卖给开发者」的路径已经成型。

产品与定价要点:

  1. 能力:流式ASR + 20+说话人分离(diarization)+ 端点检测,强调无需额外后处理模型
  2. 价格:约每小时音频0.18美元(约每千音频分钟3美元),流式与非流式同价口径
  3. 入口:Meta Model API(模型ID公开材料写作muse-voice-transcribe-1.0);文档称可与常见转写SDK路径对齐
  4. 评测:截至9月1日在Artificial Analysis流式语音识别榜位居前列,词错误率约3.1%量级
  5. 语言与形态:训练叙述覆盖70余种语言,强调原生语码转换;目前为托管API,不开放权重

所谓说话人分离,白话是会议里自动标出「谁在说话」;所谓端点检测,白话是判断这句话说完了没有,方便实时对话系统接话。对会议纪要、客服质检与开发听写场景,一体化与价格会直接冲击独立ASR与分离厂商的报价单——尤其当竞品把分离能力另计费时,打包定价更显眼。

产业影响上,语音中间件市场可能加速「单模型替代拼装栈」;采购方会把延迟SLA、零数据保留与多语种实装写进合同。对独立ASR与分离厂商,打包低价会挤压「功能拆卖」空间。需要把边界读清楚:不同基准上名次可能不一致;隐私选项以官方文档为准。下一观察点是企业合同落地与嘈杂环境下的稳定性。