描述:千问发布Qwen3.8-LiveTranslate,公开说明字均延迟降至约2.3秒。模型可处理音视频,支持约60种语言理解与29种语言语音输出,并默认开启说话人分离。
标签:千问, LiveTranslate, 同声传译, 阿里
同声传译最难的不是「会不会翻」,而是边听边说还不能把句子攒太长。千问把这件事收成一款可调用的实时模型,而不是再发一条演示视频。
千问是阿里的大模型产品线。产品文档将Qwen3.8-LiveTranslate-Flash-Realtime标为稳定版实时音视频翻译模型:输入音频和图像,输出文本与语音。文档写明可理解约60种语言,其中约29种支持语音合成。调用走WebSocket实时接口,模型名为qwen3.8-livetranslate-flash-realtime,地址挂在通义兼容的实时端点上,用会话参数决定输出是纯文本还是文本加语音。
千问方面说明,这代用Interleave(交织)方式重构实时同传。白话就是:视频、音频、原文和译文被编进同一条按时间推进的序列,理解、译文文本和语音生成不再各跑一条事后拼接的流水线。公开架构描述为基于混合专家的Thinker–Talker双模块:Thinker负责把多模态材料排进因果序列并产出译文,Talker再结合译文和源音频,合成尽量保留原说话人音色的语音。
公开说明里新增的三项场景能力:
文档还写明,相对上一代实时同传接口,端到端延迟降到约2.3秒;千问对比口径是字均延迟从约2.8秒降到约2.3秒。说话人分离和语音识别转写默认打开。上下文窗口为53248,最大输入49152,最大输出4096。默认断句方式是说话人检测,而不是只能靠静音切句。体验入口在千问全模态站点的实时翻译页,API走同一模型名。
字均延迟(LAAL)可以理解成「每个词平均要等多久才被译出来」。2.3秒仍不是耳语级同步,但比把整句听完再翻更接近会议和直播。FLEURS公开音频集上,千问称在约70个语言方向比较了翻译质量、延迟、识别准确率和合成质量,并称领先上一代及一批现有实时同传系统。这是厂商自测口径,不是第三方复现。
实时同传过去常拆成「识别、翻译、合成」三段,任何一段排队都会把延迟堆上去。交织序列的赌注是:少交接一次,就少一次等待,也少一次音色和说话人对不齐。代价是上下文并不长,五万级token更适合一场会,不适合把一整天的多语档案一次性塞进去。输出上限4千多token,也说明它被设计成流式会话,不是长文生成器。
对已经接千问实时接口的团队,这是换模型名就能试的增量;对要私有化的团队,当前公开路径仍是云端API。下一步值得看的,是弱网下说话人分离是否还稳,以及29种语音输出之外的语言,是否长期只能出文字。