阿里千问今天放了个大东西:全模态模型 Qwen3.8-Omni-Flash,文本、图片、音频、视频四种输入一起吃,上下文拉到 1M token,官方口径是「每小时音频输入的 API 价格降了 98%」。音频输入从每百万 token 18 元降到 0.8 元——8 毛钱,一杯水的价格,能把一小时会议录音整段喂进去。
我先把话说在前面:这篇文章里我亲自验证的只有三件事——官方博客和阿里云百炼的模型文档今天都已上线(HTTP 200),配套插件仓库 Qwen-MM-Plugins 在 GitHub 可访问,以及百炼的 OpenAI 兼容端点在线(不带 Key 调用返回 401,说明服务活着、在等鉴权)。文中的性能与定价数据均来自官方博客、百炼文档及第三方公开资料交叉核对,尚未经独立第三方复测;API 的实际调用效果和计费细节,以你拿到 Key 亲手复现的结果为准。但公开信息已经足够把「这东西能干什么、钱花在哪、哪里有坑」讲清楚了。
一、全模态到底指什么?和语音助手不是一回事
看到「Omni」先别急着想到语音助手。这条产品线和我上周写的 Gemini 3.8 Live、八月写的豆包 SeedRealtime 走的是两个赛道:那两个是「实时对话」,拼的是延迟和打断体验;Qwen3.8-Omni-Flash 主打的是「文件级理解」——把一段最长 1 小时的连续音视频当成一个文档处理,出文字结果。
按百炼文档,它的能力清单是:文本/图片/音频/视频四种输入,输出只有文本;支持自定义 Function Calling;音频听懂 113 种语言和方言;通过 use_multichannel 参数还能喂多通道空间音频。模型有两个版本:qwen3.8-omni-flash(批量处理用)和 qwen3.8-omni-flash-realtime(实时流式,官方数据 20 秒音视频输入首 token 981ms)。
最能说明「文件级理解」含金量的数字是 AliMeeting 多说话人重叠语音测试:错误率从上一代的 88.11% 压到 3.35%。开过会的人都知道「两个人同时说话」对转写工具是多大的灾难——上一代基本不可用,这一代按官方数据进入可用水准。当然这是测试集数字,真实会议录音里的表现如何,建议拿自己的一段会议音频先验一次再进生产流程。
二、钱降在哪:98% 不是单价跳水,是「采样策略+单价」一起降
官方博客的表述很诚实:降的是「每小时音频输入」的价格——因为计费单位是 token,一小时音频换算成 token 的总量没变,所以 98% 基本就是音频输入单价的降幅(18 元 → 0.8 元/百万 token)。音视频每小时降 93%,视频按 720p @ 1fps 采样计价。
这里有个容易被营销标题带偏的点,我算了一笔账:单看百万 token 单价,0.8 元的音频输入在千问家族里确实便宜,但「一小时视频很便宜」的另一半功劳来自 1fps 的帧率——模型不是逐帧看你的视频,是每秒抽一帧。这对「理解视频讲了什么」够用,对「看清视频里每一步操作」不够用。拿它做会议纪要、课程笔记是降维打击,拿它做视频质量审查就是用错工具。
国际通道的价格第三方网关(Vercel AI Gateway)挂的是输入 $0.15、输出 $0.47 每百万 token,和国内百炼不在一个计价体系,走国际通道的读者以自己账单为准。国内读者建议直接在千问平台的 Token Plan 订阅和按量计费之间算一下哪种划算,确切价目表和免费额度以百炼控制台实际显示为准。
三、开通与第一次调用
百炼开通流程:控制台开通模型服务 → 创建 API Key(注意北京地域和新加坡地域的 Key 不通用,模型文档列了北京、新加坡、香港、东京、法兰克福、弗吉尼亚六个部署地域)→ 走 OpenAI 兼容模式调用,openai 这个 Python 库直接能用。
下面的代码我按官方文档的非实时调用指南整理,可以直接复制,把 AUDIO_URL 换成你自己的公网音频地址就能跑(本地文件走 base64,编码后需小于 10MB):
# 运行环境:Python 3.10+,macOS/Windows 均可
# 安装依赖:pip install openai
# 前置:百炼控制台创建 API Key,export DASHSCOPE_API_KEY="sk-xxx"
import os
from openai import OpenAI
client = OpenAI(
api_key=os.getenv("DASHSCOPE_API_KEY"),
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1", # 经典端点;新版文档示例改用 https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1,以控制台实际给出的为准
)
completion = client.chat.completions.create(
model="qwen3.8-omni-flash",
messages=[{
"role": "user",
"content": [
{"type": "input_audio",
"input_audio": {"data": "https://example.com/meeting.mp3", "format": "mp3"}},
{"type": "text", "text": "把这段录音整理成结构化纪要:先列结论,再列待办事项和负责人。"},
],
}],
modalities=["text"],
reasoning_effort="low", # 深度思考默认 xhigh,转写整理类任务调低省 token
stream=False,
)
print(completion.choices[0].message.content)视频输入把 input_audio 换成 {"type": "video_url", "video_url": {"url": "https://example.com/demo.mp4"}} 即可。有一个参数值得单独拎出来说:reasoning_effort。这个模型深度思考默认开在 xhigh,支持从 none 到 max 六档。让模型「想一想」对复杂推理是好事,但你的任务是转写和整理时,每一段音频都触发高强度思考,token 消耗和响应时间都会明显上涨——这是我整理官方文档时发现的第一个「不写出来你一定会踩」的点,做转写流水线的话,建议先拿同一段音频在几档之间对比一次 token 账单再定默认值。
四、三种值得做的用法
1. 一小时会议录音出结构化纪要。 这是定价调整最直接的受益场景。以前长录音要么切片处理(上下文断裂、说话人混淆),要么先跑 ASR 再喂文本模型(两步、两份钱、丢语气信息)。现在整段扔进去,1M 上下文装得下一小时的音视频,多说话人分离能力又是官方重点加强的部分。传统 ASR 方案的对比可以参考我之前写的腾讯混元 Hy ASR 3.0——那是「只出文字」的专用模型,Omni-Flash 是「听完直接出结论」,各有各的位置。
2. 长视频出笔记。 网课、技术分享会、产品发布的录屏,720p@1fps 采样意味着模型抓的是画面内容和幻灯片信息,配合音频讲解出结构化笔记。1M 上下文对应约一小时素材,超过就要切片。注意前面说的:逐帧动作细节不是它的强项。
3. 给 Coding Agent 装上眼睛和耳朵。 这是今天发布里对我这种每天泡在 Agent 里的人最有意思的部分:配套开源的 Qwen-MM-Plugins 可以给 Claude Code、Gemini CLI、Codex、OpenClaw 装多模态能力,补上本地 Agent 的视觉和长视频记忆;里面还有个 omni-skill-creator,录一段带解说的操作视频丢进去,自动生成操作该软件的 Skill——原理类似机械臂示教。Agent 侧的承接正好可以接在我之前写的 Codex Harness 和 OpenAI Agents API 那两篇上。插件仓库今天刚开放,安装流程我还没亲手跑过,具体命令以仓库 README 为准。
五、踩坑提醒
- 输出只有文本,没有语音。 别被「全模态」骗了——按官方文档,这个模型只有文本输出。想要它「开口说话」,要么用 Realtime 版,要么本地部署开源的 Qwen2.5-Omni 7B。
reasoning_effort默认 xhigh。 转写、整理类任务记得手动调低或设none,否则 token 烧在你看不见的思考链上。- Qwen-Live-Harness 现在还装不上。 官方博客一并发布的这个桌面悬浮球工具,我查了 GitHub 仓库——404,代码还没推上去(npm 上有包),第三方消息说目前仅支持 macOS。想尝鲜的等仓库开放再动手,现在搜教程搜到的多半是猜的。
- base_url 和 API Key 必须地域匹配。 新版文档示例的端点带
{WorkspaceId}子域名,和经典的dashscope.aliyuncs.com并存;北京 Key 只能调北京地域,混用会报鉴权错误。
六、不建议使用的场景
- 实时低延迟语音对话:直接用
qwen3.8-omni-flash-realtime或者 Gemini 3.8 Live,批量版跑对话延迟不占优。 - 本地离线部署:模型权重未开源,纯 API 产品,对数据出境敏感的业务想清楚再上。
- 纯文本任务:同样的钱和延迟,qwen3.8-max 和 qwen3.8-flash 处理文本更顺手,Omni 的价值全在「耳朵和眼睛」上。
- 逐帧精确视频分析:1fps 采样决定了它看不清快速变化的画面,动作识别类需求另找工具。
七、说两句判断
把音视频理解的价格打到 8 毛一百万 token,真正的变化不是省几块钱,而是「整段音频进模型」从精打细算的实验变成了可以随手扔的日常操作。以前我们设计处理流程时默认「音频先过 ASR、视频先抽帧」,这套预处理流水线的存在理由正在消失——模型直接吃原始素材的这一天,对千问来说今天是第一次把价格降到了「不用犹豫」的位置。至于质量是否配得上价格,我的建议是:拿到 Key 之后,先把自己的一段真实录音扔进去跑一遍,再决定要不要把它接进生产流程。