语音系统若只能「听清字」,在方言、噪声、情感与复杂音频问答面前仍会集体失语;若训练算力绑死在特定海外芯片栈,供应链与合规叙事也会反复被追问。9月16日,科大讯飞宣布讯飞星火全国产语音基座大模型Spark-Audio-1.0-Preview上线,把「听清」推进到「听懂」的产品叙事,同时把「国产算力可训出可比肩效果」写成主卖点。
科大讯飞是国内语音与人工智能代表性公司,讯飞星火是其大模型品牌;语音识别、合成与同传长期是其基本盘。所谓语音基座,目标是先训一个通用「听得懂世界」的底座,再往上长识别、同传、交互等专用能力,而不是每个场景各训一堆碎片模型。此轮Preview明确打出「基于纯国产算力集群训练完成」的表述,回应的是训推链路自主可控压力。
模型与能力要点(公司公开口径):
所谓Dense音频编码器,白话是用一块相对专注的网络把声音压成可理解的表示;所谓MoE(Mixture of Experts,混合专家),白话是大模型里有多组「专家」子网络,按需激活一部分,以控制算力与效果的平衡。所谓全国产算力训练,白话是把训推尽量落在国产芯片与集群上,而不是只在推理侧做国产化贴牌。
放在近窗语音大模型竞赛上下文里,各家都在卷Realtime对话、多任务矩阵与开放平台调用。讯飞选择用「基座 + 国产算力」双叙事应战:一边对标复杂场景听懂能力,一边回应供应链问题。竞品若只有云端旗舰音色、给不出方言与噪声场景的可复核对照,政企采购文本会更虚;若只有开源权重、缺少全国产训推闭环,合规叙事也会分层。
产业影响上,若开放平台API迅速落地且第三方在方言/噪声集上复测站得住,会抬高「国产语音基座」作为可复用中间件的权重;若长期停在Preview体验页,市场热度会随新闻周期退去。需要把边界读清楚:Preview不等于全量商用SLA;与更大闭源语音基座「接近」属公司评测口径;语言/方言覆盖数字以实际产品文档为准。下一观察点是API上线节奏、专用模型矩阵发布,以及复杂声学环境下的第三方复测报告。