千问把全模态从「能看能听」往前推了一步:新模型要在真实工作流里理解音视频,再规划任务、调用工具并交出文本结果。
阿里的千问是其大模型产品线。千问AI平台产品页显示,Qwen3.8-Omni-Flash已上线,定位为新一代原生全模态模型,架构基础写的是Qwen3.8-Flash-Next。页面点名的场景包括编程、文本知识工作、图形界面操作,以及视频剪辑、音乐视频、影视制作与解说、音视频转图文摘要和音视频对话。
产品页写明的能力边界:
价格同一页列出:输入每百万token 0.8元,输出2.7元,缓存命中0.1元。速率上限为每分钟200万token、每分钟3万次请求。函数调用、上下文缓存、结构化输出、批量任务和微调都在能力列表里。页面建议安装配套的Qwen-MM-Plugins,方便智能体框架接入原生多模态。
全模态,白话就是一个模型同时吃文字、画面、声音和视频,而不是四种能力各开一个接口。空间音频则是用多个声道判断声音从哪来。剪辑、会议纪要或现场解说,往往需要先分清「谁在说、画面里发生了什么」,再决定调用哪个工具。这代模型把工具调用写进同一张产品说明,等于把音视频从附件变成工作材料。
此前千问已有多代全模态接口,海外Gemini等模型也在把音视频理解做成可调用能力。这次公开页没有放出权重,当前路径是云端API。对要私有化部署的团队,这仍是限制;对已经在百炼或兼容接口上接千问的团队,则是换模型名就能试的增量。
缓存命中价降到0.1元,说明长上下文会被反复复用,而不是每条请求都从头计费。百万token窗口对长视频有意义,但窗口大不等于剪辑质量高,仍要看它能否稳定定位片段并完成工具链。下一步可观察插件是否真被主流智能体框架接住,以及实时对话版本是否单独开接口。