阿里的全模态线,一年半里换了四代,每一代丢掉的东西和加上的东西一样多。
2025 年 3 月的 Qwen2.5-Omni 是个 7B 开源小模型,能听能看还能开口说话,大家拿它当玩具。同年 9 月的 Qwen3-Omni 换成 30B-A3B 的 MoE,照样开源,但放到百炼 API 上,单段音频只收 20 分钟。今年 3 月 30 日出了 Qwen3.5-Omni-Plus,开始支持 3 小时音频、55 种音色的语音输出,价格也跟着上去了:新加坡区音频输入每百万 token 11 美元,带语音的输出 44 美元。
然后就是 9 月 18 日的 Qwen3.8-Omni-Flash。音频输入价从 11 美元掉到 0.016 美元。
语音输出没了。
百炼文档里这一代的输出栏只写着“文本”。上一代卖得最贵的那项能力,这一代直接不提供。所以拿它和 Gemini 3.8 Flash 比,前提得摆正:两个都是“吃进音视频、吐出文字”的模型,比的是听懂和看懂,不是对话。
Gemini 那边的时间线短得多。3.7 Flash 和 9 月 2 日正式发布的 3.8 Flash 价格一模一样,都是输入 0.75 美元、输出 3.75 美元每百万 token,上下文都是 1,048,576,输出上限都是 65,536。规格表没动,动的是分数:Artificial Analysis 智能指数从 56 到 59,Agentic 指数从 45.1 到 50.0。
一小时录音,两边各收多少
Gemini 的音频按每秒 32 个 token 计。一小时是 115,200 个 token,乘 0.75 美元,大约 8.6 美分。这个数谷歌自己也在宣传里用过:一小时会议录音,转写加总结,输入不到 9 美分。
Qwen3.8-Omni-Flash 的音频 token 速率阿里没在公告里写。就算按和 Gemini 一样的每秒 32 个算,一小时也只要 0.18 美分左右。差了四十多倍。
这还是新加坡区的价。
北京区更便宜,音频 0.014 美元,文本和图像视频输入 0.113 美元,输出 0.382 美元。香港、法兰克福、弗吉尼亚、东京这几个区也按北京价走,新加坡区反而最贵。海外团队接入时这一点很容易看漏。
88.11 这个数字是上一代的成绩
阿里的发布材料里有一行容易被跳过的对比:AliMeeting 会议数据集上,说话人分离的 DER 从 88.11 降到 3.35,cpWER 从 89.61 降到 17.18。
DER 88% 是什么概念?一段多人开会的录音,将近九成的时间都没能把话对上正确的人。换句话说,Qwen3.5-Omni-Plus 拿来做“谁说了什么”的会议纪要,基本是废的。这一点当初宣传时没人提,要翻到新一代的对比表才看得到。
新一代降到 3.35,终于能用了。
但 cpWER 还有 17.18,大约每六个词错一个,中文多人抢话的场景,纪要仍然得人工过一遍。
方言上它有一张实打实的牌:团队让模型自己跑了 12 小时研发流程,造了 3,413 条数据,把一个 3B 小模型的四川话字错率从 25.79% 压到 15.30%。这是个演示,不是 3.8-Omni-Flash 本身的指标,但能看出阿里在方言识别上的投入方向。音频输入官方写的是支持 113 种语言和方言。
Qwen 这边的短板
单次输入上限比 Gemini 小。Qwen3.8-Omni-Flash 音频最长 3 小时、视频最长 2 小时。Gemini 3.8 Flash 音频一次能塞 9.5 小时;视频低清模式能到 3 小时,高清 1 小时。整天的庭审录音、培训录音,在 Gemini 那边一次就能喂完,在 Qwen 这边要切段,切段就意味着跨段指代会断。
“接近 Gemini 3.8 Flash”这个说法也要打折听。阿里给的是“音视频能力接近、音频整体超过”,引用的主要是自家或自选的榜单,比如 WildClawBench-MM 涨 36.5 分、AgenticVBench 涨 22.3 分,这些都是和自家上一代比。第三方的同题对测,截至发稿我没找到。
还有一点:这次开源的是 Qwen-Live Harness 这套工具,模型权重本身有没有开放,公告里没说。前两代都开源,这一代如果只走 API,对想私有化部署的团队是个实质变化。
Gemini 这边的短板
最大的一个写在价目表的小字里:0.75 美元是推广价,只到 2026 年 12 月 31 日。1 月 1 日起翻倍,输入 1.5 美元,输出 7.5 美元。现在按推广价做的预算,三个半月后全部作废。
第二个是速度。3.8 Flash 的首 token 延迟实测 13.21 秒,比 3.7 Flash 的 12.01 秒还慢了大约 10%。分数涨了,响应反而拖了。另有测评发现它在部分任务上的输出 token 比 3.7 多用约 1.34 倍,加上默认开着中等档位的思考,实际账单常常是按可见输出估算的两倍。
第三个很多人会搞混:3.8 Flash 不支持 Live API,做不了实时双向语音。谷歌这周另发了 Gemini 3.8 Live,每小时约 0.84 美元,那是另一个产品。
| 项目 | Qwen3.8-Omni-Flash | Gemini 3.8 Flash |
|---|---|---|
| 发布 | 2026-09-18 | 2026-09-02 |
| 音频输入(每百万 token) | 0.016 美元(新加坡)/ 0.014 美元(北京等) | 0.75 美元,2027 年起 1.5 美元 |
| 文本/图像/视频输入 | 0.15 美元 / 0.113 美元 | 0.75 美元 |
| 输出 | 0.47 美元 / 0.382 美元 | 3.75 美元,2027 年起 7.5 美元 |
| 单次音频上限 | 3 小时 | 9.5 小时 |
| 单次视频上限 | 2 小时 | 高清 1 小时 / 低清 3 小时 |
| 上下文 | 1M | 1,048,576 |
| 输出形态 | 仅文本 | 仅文本 |
一个不太主流的判断
“音频便宜 98%”是这次发布最响的一句,但对大多数团队,它改变不了太多。
算一笔会议纪要的账。一小时录音,Gemini 输入 8.6 美分;假设纪要加思考一共 6,000 个输出 token,按 3.75 美元算是 2.25 美分。输入确实是大头,一共 11 美分左右。换到 Qwen,输入 0.18 美分,输出 3,000 个可见 token 约 0.14 美分,一共 0.3 美分上下。
看起来差三十多倍,很吓人。
可一家每月处理 500 小时会议的公司,Gemini 一个月也就 55 美元。这个量级上,决定选谁的不是价格,是纪要准不准、说话人对不对。
真正会被这个价格改变决策的,是体量大到按“万小时”计的业务:客服质检、播客平台、在线教育的课堂录音。10 万小时录音,Gemini 输入约 8,600 美元,明年翻倍后 17,200 美元;Qwen 按同样速率估算约 180 美元。这时候差价就是一个工程师的年薪了。
反过来,视频才是更容易被忽略的开销。Gemini 低清视频每秒约 100 个 token,一小时约 27 美分,是音频的三倍多,Qwen 的视频按 0.15 美元的普通输入价算,阿里没公布视频抽帧的 token 速率,没法直接换算。视频量大的项目,别拿音频的降价幅度去推视频成本,自己跑一段样片看账单最准。
落到具体项目上
万小时级的音频转写、质检、摘要:Qwen3.8-Omni-Flash,价格优势压倒一切,把 17% 的 cpWER 用抽检兜住。
单段录音超过 3 小时、要求一次性理解全程的,比如整场庭审、整天培训:Gemini 3.8 Flash,省掉切段带来的上下文断裂,但预算按 2027 年的翻倍价做。
中文方言、多人会议:两边都先拿自己的真实录音测。Qwen 的会议分数是和上一代比出来的,Gemini 在中文方言上也没有公开的针对性数据。
需要模型开口说话的:两个都不行。要么用 Gemini 3.8 Live,要么留在 Qwen3.5-Omni 上,按 44 美元每百万的语音输出价付钱。想先上手的,通义千问平台已经能直接体验新模型。
相关对比
《GPT-5.6 Luna、GLM-5.3-Flash、Gemini 3.8 Flash:便宜档的三张价目表,坑各不相同》
《Gemini 3.8 Flash 和 Muse Spark 1.3 同周上线,从 Opus 5 迁过去要分四次算账》
《GPT-Live-1、GPT-Realtime-2.1、Gemini 3.1 Flash Live:每分钟 5 美分只是前台价,三份规格表各藏一个坑》
© 版权声明
文章版权归作者所有,未经允许请勿转载。






Qwen3.8-Omni-Flash 和 Gemini 3.8 Flash:音频便宜了四十多倍,可你的账单大头不一定在音频