阿里 18 号上线了 Qwen3.8-Omni-Flash,原生全模态,文本、图片、音频、视频都能直接吃,上下文 1M,现在在千问 AI 平台就能试。
这次的重点不在“能看能听”,而在音视频 Agent。官方列的场景有视频剪辑、MV 创作、影视解说、音视频转图文摘要,都是要同时处理画面、声音和长时间线的活儿。
几个能说明问题的数字:
30 项评测平均比上一代 Qwen3.5-Omni-Plus 高 26% 以上。WildClawBench-MM 涨了 36.5 分,AgenticVBench 涨了 22.3 分。
会议转写那项变化最夸张,AliMeeting 的 DER/cpWER 从 88.11/89.61 降到 3.35/17.18,基本等于从“不能用”到“能用”。
价格才是真正的杀手锏:API 每小时音频输入价格降幅超 98%,音视频输入降幅超 93%。官方说音视频能力接近 Gemini 3.8 Flash,纯音频整体还超过它。
还有一个小实验挺有意思。团队让模型自己跑研发流程:12 小时内自主选评测集、造数据、迭代 4 轮,攒了 3413 条训练数据,把 Qwen2.5-Omni-3B 的四川话识别字错率从 25.79% 压到 15.30%。
顺带发的 Realtime 版本支持“听声辨位”,能判断声音从哪个方向来。
想做长视频理解、会议纪要这类应用的,可以去 通义千问 那边先拿自己的素材测一轮,价格降到这个份上,试错成本已经很低了。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






千问 Qwen3.8-Omni-Flash:1M 上下文的全模态,音频 API 价格砍了 98%