科大讯飞|上线全国产语音基座Spark-Audio-1.0-Preview

PromptTree|阅读 0
2026/09/17 07:24
科大讯飞Spark-Audio语音大模型国产算力
9月16日科大讯飞上线Spark-Audio-1.0-Preview:约0.65B音频编码器+30B-A3B MoE语言模型,约1300万小时音频、纯国产算力训练;支持转写/翻译/方言/情感与音频问答,体验已开、API后续上线。

语音系统若只能「听清字」,在方言、噪声、情感与复杂音频问答面前仍会集体失语;若训练算力绑死在特定海外芯片栈,供应链与合规叙事也会反复被追问。9月16日,科大讯飞宣布讯飞星火全国产语音基座大模型Spark-Audio-1.0-Preview上线,把「听清」推进到「听懂」的产品叙事,同时把「国产算力可训出可比肩效果」写成主卖点。

科大讯飞是国内语音与人工智能代表性公司,讯飞星火是其大模型品牌;语音识别、合成与同传长期是其基本盘。所谓语音基座,目标是先训一个通用「听得懂世界」的底座,再往上长识别、同传、交互等专用能力,而不是每个场景各训一堆碎片模型。此轮Preview明确打出「基于纯国产算力集群训练完成」的表述,回应的是训推链路自主可控压力。

模型与能力要点(公司公开口径):

  1. 结构:约0.65B Dense结构音频编码器 + 约30B-A3B MoE结构大语言模型
  2. 数据:约1300万小时音频及大量文本
  3. 训练:纯国产算力集群
  4. 模态:同一模型可输入文本与语音,输出以文本为主
  5. 任务:语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析、复杂音频问答
  6. 覆盖:公开称约99种语言、约202种方言;高噪声、小音量等偏真实场景给出领先叙事
  7. 开放:体验入口已开;API计划后续上线讯飞开放平台;并称将基于该基座陆续发布/升级系列语音相关模型

所谓Dense音频编码器,白话是用一块相对专注的网络把声音压成可理解的表示;所谓MoE(Mixture of Experts,混合专家),白话是大模型里有多组「专家」子网络,按需激活一部分,以控制算力与效果的平衡。所谓全国产算力训练,白话是把训推尽量落在国产芯片与集群上,而不是只在推理侧做国产化贴牌。

放在近窗语音大模型竞赛上下文里,各家都在卷Realtime对话、多任务矩阵与开放平台调用。讯飞选择用「基座 + 国产算力」双叙事应战:一边对标复杂场景听懂能力,一边回应供应链问题。竞品若只有云端旗舰音色、给不出方言与噪声场景的可复核对照,政企采购文本会更虚;若只有开源权重、缺少全国产训推闭环,合规叙事也会分层。

产业影响上,若开放平台API迅速落地且第三方在方言/噪声集上复测站得住,会抬高「国产语音基座」作为可复用中间件的权重;若长期停在Preview体验页,市场热度会随新闻周期退去。需要把边界读清楚:Preview不等于全量商用SLA;与更大闭源语音基座「接近」属公司评测口径;语言/方言覆盖数字以实际产品文档为准。下一观察点是API上线节奏、专用模型矩阵发布,以及复杂声学环境下的第三方复测报告。