阿里|上线Qwen3.8-Omni-Flash,全模态模型进入音视频Agent工作流

PromptTree|阅读 0
2026/09/19 09:07
阿里千问Omni-Flash全模态
千问AI平台上线Qwen3.8-Omni-Flash,可输入文本、图像、音频与视频,上下文100万token,输出为文本。产品页标输入每百万token 0.8元,并建议配合Qwen-MM-Plugins接入智能体。

千问把全模态从「能看能听」往前推了一步:新模型要在真实工作流里理解音视频,再规划任务、调用工具并交出文本结果。

阿里的千问是其大模型产品线。千问AI平台产品页显示,Qwen3.8-Omni-Flash已上线,定位为新一代原生全模态模型,架构基础写的是Qwen3.8-Flash-Next。页面点名的场景包括编程、文本知识工作、图形界面操作,以及视频剪辑、音乐视频、影视制作与解说、音视频转图文摘要和音视频对话。

产品页写明的能力边界:

  1. 输入:文本、图像、音频、视频
  2. 输出:仅文本,调用示例写明不设置音频输出
  3. 上下文窗口:100万token
  4. 非思考模式最大输入约99.1万token,思考模式约98.4万token
  5. 最大输出13.1万token,思维链上限26.2万token
  6. 空间音频:支持2通道与4通道解析
  7. 协议:兼容DashScope与OpenAI接口

价格同一页列出:输入每百万token 0.8元,输出2.7元,缓存命中0.1元。速率上限为每分钟200万token、每分钟3万次请求。函数调用、上下文缓存、结构化输出、批量任务和微调都在能力列表里。页面建议安装配套的Qwen-MM-Plugins,方便智能体框架接入原生多模态。

全模态,白话就是一个模型同时吃文字、画面、声音和视频,而不是四种能力各开一个接口。空间音频则是用多个声道判断声音从哪来。剪辑、会议纪要或现场解说,往往需要先分清「谁在说、画面里发生了什么」,再决定调用哪个工具。这代模型把工具调用写进同一张产品说明,等于把音视频从附件变成工作材料。

此前千问已有多代全模态接口,海外Gemini等模型也在把音视频理解做成可调用能力。这次公开页没有放出权重,当前路径是云端API。对要私有化部署的团队,这仍是限制;对已经在百炼或兼容接口上接千问的团队,则是换模型名就能试的增量。

缓存命中价降到0.1元,说明长上下文会被反复复用,而不是每条请求都从头计费。百万token窗口对长视频有意义,但窗口大不等于剪辑质量高,仍要看它能否稳定定位片段并完成工具链。下一步可观察插件是否真被主流智能体框架接住,以及实时对话版本是否单独开接口。