腾讯|混元Hy ASR 3.0 preview发布,元宝首发接入

PromptTree|阅读 0
2026/08/05 08:19
腾讯混元Hy ASR语音识别元宝Hy3
8月4日腾讯混元发布新一代语音识别模型Hy ASR 3.0 preview,基于Hy3语言理解融合高精度转写与语义纠错;开源评测集普通话/英语/粤语WER约3.34%/2.62%/3.12%;元宝首发上线并免费开放,腾讯云API已对外提供,WorkBuddy等产品陆续接入。

语音输入若只会「逐字听写」,在方言、噪声与专词里仍会翻车——腾讯把ASR推进到「先懂语境,再出文字」。

腾讯混元是腾讯的大模型产品线,覆盖文本、多模态与语音等能力,并通过元宝、腾讯云与办公产品向外分发。Hy ASR 3.0 preview是其新一代语音识别模型。所谓ASR(自动语音识别),白话就是把说话变成可编辑文本;一旦叠上上下文纠错与专词理解,它就不再只是输入法麦克风,而更像客服、会议与语音搜索流水线里的第一道语义闸门。

8月4日,腾讯混元正式发布Hy ASR 3.0 preview。官方叙事强调,模型基于最新一代大语言模型Hy3的语言理解能力,把高精度转写与深度语义理解绑在一起,目标从「逐字转写、单点优化」转向「理解语境、兼容场景、一键直出」。产品落地同步推进:元宝深度参与共研并完成首发上线,用户按住说话即可体验方言识别、上下文智能纠错与复杂环境稳定转写,公开口径为免费开放;WorkBuddy等产品亦在陆续接入。开发者侧,模型已上线腾讯云官网提供API,可对接智能客服、内容理解、语音搜索等场景。

公开评测与场景要点:

  1. 开源评测集词错误率(WER):中文普通话约3.34%、英语约2.62%、粤语约3.12%,多语种整体约控制在3%左右。
  2. 自建评测:覆盖通用识别、方言、上下文Context理解、专词理解,以及高噪、耳语等复杂声学场景。
  3. 能力主张:通用识别、上下文感知、多场景鲁棒性与方言覆盖同步抬升。
  4. 分发:腾讯云API对外开放;消费级入口以元宝首发为主。
  5. 底座绑定:与混元Hy3语言理解能力对齐,体现「识别模型吃大模型语义」的路线。

所谓WER,白话就是「一百个词里听错了几个」——数字越低越好,但企业验收往往卡在专词表、口音与现场噪声,而不是平均分再低零点几个点。Hy3加持的意义,是让模型在听不清或说法含糊时,仍能按上下文猜对用户真正想写的词,减少二次手工改稿。

行业对照很清楚。过去一年,办公与客服Agent卷的是「听得清、写得对、还懂你想说什么」;纯声学优化走到平台期后,下一刀往往落在语言模型侧的纠错与意图对齐。海外与国内云厂商都在把语音入口嵌进助手与客服中台;谁掌握日活入口,谁就有持续回归测试场。腾讯选择把ASR升级绑进元宝与WorkBuddy,等于用真实对话流量验货,再用云API把能力卖给外部开发者。

对企业买家,实用问题是专词表、方言覆盖与噪声场景能否写进合同验收,以及API配额、延迟与审计日志是否跟得上峰值。对普通用户,元宝免费语音入口降低了试用门槛,但体验仍取决于说话环境与领域词汇。下一观察点是WorkBuddy等办公入口何时全量,以及云API在生产流量下能否稳住——语音入口一旦变准,后面的Agent编排才有干净的输入;入口若抖,再强的下游模型也只能在脏文本上返工。