Qwen3.8-Omni-Flash 上手指南:音频输入降到 8 毛一百万 token,1 小时录音视频直接扔给 API

阿里千问今天放了个大东西:全模态模型 Qwen3.8-Omni-Flash,文本、图片、音频、视频四种输入一起吃,上下文拉到 1M token,官方口径是「每小时音频输入的 API 价格降了 98%」。音频输入从每百万 token 18 元降到 0.8 元——8 毛钱,一杯水的价格,能把一小时会议录音整段喂进去。

我先把话说在前面:这篇文章里我亲自验证的只有三件事——官方博客和阿里云百炼的模型文档今天都已上线(HTTP 200),配套插件仓库 Qwen-MM-Plugins 在 GitHub 可访问,以及百炼的 OpenAI 兼容端点在线(不带 Key 调用返回 401,说明服务活着、在等鉴权)。文中的性能与定价数据均来自官方博客、百炼文档及第三方公开资料交叉核对,尚未经独立第三方复测;API 的实际调用效果和计费细节,以你拿到 Key 亲手复现的结果为准。但公开信息已经足够把「这东西能干什么、钱花在哪、哪里有坑」讲清楚了。

一、全模态到底指什么?和语音助手不是一回事

看到「Omni」先别急着想到语音助手。这条产品线和我上周写的 Gemini 3.8 Live、八月写的豆包 SeedRealtime 走的是两个赛道:那两个是「实时对话」,拼的是延迟和打断体验;Qwen3.8-Omni-Flash 主打的是「文件级理解」——把一段最长 1 小时的连续音视频当成一个文档处理,出文字结果。

按百炼文档,它的能力清单是:文本/图片/音频/视频四种输入,输出只有文本;支持自定义 Function Calling;音频听懂 113 种语言和方言;通过 use_multichannel 参数还能喂多通道空间音频。模型有两个版本:qwen3.8-omni-flash(批量处理用)和 qwen3.8-omni-flash-realtime(实时流式,官方数据 20 秒音视频输入首 token 981ms)。

最能说明「文件级理解」含金量的数字是 AliMeeting 多说话人重叠语音测试:错误率从上一代的 88.11% 压到 3.35%。开过会的人都知道「两个人同时说话」对转写工具是多大的灾难——上一代基本不可用,这一代按官方数据进入可用水准。当然这是测试集数字,真实会议录音里的表现如何,建议拿自己的一段会议音频先验一次再进生产流程。

二、钱降在哪:98% 不是单价跳水,是「采样策略+单价」一起降

官方博客的表述很诚实:降的是「每小时音频输入」的价格——因为计费单位是 token,一小时音频换算成 token 的总量没变,所以 98% 基本就是音频输入单价的降幅(18 元 → 0.8 元/百万 token)。音视频每小时降 93%,视频按 720p @ 1fps 采样计价。

这里有个容易被营销标题带偏的点,我算了一笔账:单看百万 token 单价,0.8 元的音频输入在千问家族里确实便宜,但「一小时视频很便宜」的另一半功劳来自 1fps 的帧率——模型不是逐帧看你的视频,是每秒抽一帧。这对「理解视频讲了什么」够用,对「看清视频里每一步操作」不够用。拿它做会议纪要、课程笔记是降维打击,拿它做视频质量审查就是用错工具。

国际通道的价格第三方网关(Vercel AI Gateway)挂的是输入 $0.15、输出 $0.47 每百万 token,和国内百炼不在一个计价体系,走国际通道的读者以自己账单为准。国内读者建议直接在千问平台的 Token Plan 订阅和按量计费之间算一下哪种划算,确切价目表和免费额度以百炼控制台实际显示为准。

三、开通与第一次调用

百炼开通流程:控制台开通模型服务 → 创建 API Key(注意北京地域和新加坡地域的 Key 不通用,模型文档列了北京、新加坡、香港、东京、法兰克福、弗吉尼亚六个部署地域)→ 走 OpenAI 兼容模式调用,openai 这个 Python 库直接能用。

下面的代码我按官方文档的非实时调用指南整理,可以直接复制,把 AUDIO_URL 换成你自己的公网音频地址就能跑(本地文件走 base64,编码后需小于 10MB):

Python
# 运行环境:Python 3.10+,macOS/Windows 均可
# 安装依赖:pip install openai
# 前置:百炼控制台创建 API Key,export DASHSCOPE_API_KEY="sk-xxx"
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.getenv("DASHSCOPE_API_KEY"),
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",  # 经典端点;新版文档示例改用 https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1,以控制台实际给出的为准
)

completion = client.chat.completions.create(
    model="qwen3.8-omni-flash",
    messages=[{
        "role": "user",
        "content": [
            {"type": "input_audio",
             "input_audio": {"data": "https://example.com/meeting.mp3", "format": "mp3"}},
            {"type": "text", "text": "把这段录音整理成结构化纪要:先列结论,再列待办事项和负责人。"},
        ],
    }],
    modalities=["text"],
    reasoning_effort="low",  # 深度思考默认 xhigh,转写整理类任务调低省 token
    stream=False,
)
print(completion.choices[0].message.content)

视频输入把 input_audio 换成 {"type": "video_url", "video_url": {"url": "https://example.com/demo.mp4"}} 即可。有一个参数值得单独拎出来说:reasoning_effort。这个模型深度思考默认开在 xhigh,支持从 nonemax 六档。让模型「想一想」对复杂推理是好事,但你的任务是转写和整理时,每一段音频都触发高强度思考,token 消耗和响应时间都会明显上涨——这是我整理官方文档时发现的第一个「不写出来你一定会踩」的点,做转写流水线的话,建议先拿同一段音频在几档之间对比一次 token 账单再定默认值。

四、三种值得做的用法

1. 一小时会议录音出结构化纪要。 这是定价调整最直接的受益场景。以前长录音要么切片处理(上下文断裂、说话人混淆),要么先跑 ASR 再喂文本模型(两步、两份钱、丢语气信息)。现在整段扔进去,1M 上下文装得下一小时的音视频,多说话人分离能力又是官方重点加强的部分。传统 ASR 方案的对比可以参考我之前写的腾讯混元 Hy ASR 3.0——那是「只出文字」的专用模型,Omni-Flash 是「听完直接出结论」,各有各的位置。

2. 长视频出笔记。 网课、技术分享会、产品发布的录屏,720p@1fps 采样意味着模型抓的是画面内容和幻灯片信息,配合音频讲解出结构化笔记。1M 上下文对应约一小时素材,超过就要切片。注意前面说的:逐帧动作细节不是它的强项。

3. 给 Coding Agent 装上眼睛和耳朵。 这是今天发布里对我这种每天泡在 Agent 里的人最有意思的部分:配套开源的 Qwen-MM-Plugins 可以给 Claude Code、Gemini CLI、Codex、OpenClaw 装多模态能力,补上本地 Agent 的视觉和长视频记忆;里面还有个 omni-skill-creator,录一段带解说的操作视频丢进去,自动生成操作该软件的 Skill——原理类似机械臂示教。Agent 侧的承接正好可以接在我之前写的 Codex HarnessOpenAI Agents API 那两篇上。插件仓库今天刚开放,安装流程我还没亲手跑过,具体命令以仓库 README 为准。

五、踩坑提醒

  1. 输出只有文本,没有语音。 别被「全模态」骗了——按官方文档,这个模型只有文本输出。想要它「开口说话」,要么用 Realtime 版,要么本地部署开源的 Qwen2.5-Omni 7B。
  2. reasoning_effort 默认 xhigh。 转写、整理类任务记得手动调低或设 none,否则 token 烧在你看不见的思考链上。
  3. Qwen-Live-Harness 现在还装不上。 官方博客一并发布的这个桌面悬浮球工具,我查了 GitHub 仓库——404,代码还没推上去(npm 上有包),第三方消息说目前仅支持 macOS。想尝鲜的等仓库开放再动手,现在搜教程搜到的多半是猜的。
  4. base_url 和 API Key 必须地域匹配。 新版文档示例的端点带 {WorkspaceId} 子域名,和经典的 dashscope.aliyuncs.com 并存;北京 Key 只能调北京地域,混用会报鉴权错误。

六、不建议使用的场景

  • 实时低延迟语音对话:直接用 qwen3.8-omni-flash-realtime 或者 Gemini 3.8 Live,批量版跑对话延迟不占优。
  • 本地离线部署:模型权重未开源,纯 API 产品,对数据出境敏感的业务想清楚再上。
  • 纯文本任务:同样的钱和延迟,qwen3.8-max 和 qwen3.8-flash 处理文本更顺手,Omni 的价值全在「耳朵和眼睛」上。
  • 逐帧精确视频分析:1fps 采样决定了它看不清快速变化的画面,动作识别类需求另找工具。

七、说两句判断

把音视频理解的价格打到 8 毛一百万 token,真正的变化不是省几块钱,而是「整段音频进模型」从精打细算的实验变成了可以随手扔的日常操作。以前我们设计处理流程时默认「音频先过 ASR、视频先抽帧」,这套预处理流水线的存在理由正在消失——模型直接吃原始素材的这一天,对千问来说今天是第一次把价格降到了「不用犹豫」的位置。至于质量是否配得上价格,我的建议是:拿到 Key 之后,先把自己的一段真实录音扔进去跑一遍,再决定要不要把它接进生产流程。

推荐阅读

  • Gemini 3.8 Live 上手:语音 Agent 能边聊边干活,还比 GPT-Live-1 便宜 40%

    Gemini 3.8 Live 与 Extended Thinking 已上线 Gemini API 和 AI Studio,语音模型能边说话边后台执行工具,基准超 GPT-Live-1 且每小时 3…

  • OpenAI Agents API 公测上手:把 Codex 底层框架变成 10 行代码就能跑的云 Agent

    OpenAI 9 月 10 日开放 Agents API 公测,把 Codex 底层 agent 框架(会话持久化、上下文压缩、子代理并行、MCP 工具)做成托管 API,无平台费。本文带你 5 分钟…

  • GPT-Image-2.5 API 上手指南:Flare 与 Sunburst 双模型怎么选,图像生成定价翻倍的性价比真相

    OpenAI GPT-Image-2.5 图像生成 API 上手指南:Flare 速度型与 Sunburst 精度型双模型怎么选、六档质量参数如何影响成本、定价较上代翻倍后还值不值得用。整理 Pyth…

  • DeepSeek V4.1-Flash 上手:CED 架构 + 1M 上下文 + V4 Pro 自动退市,9 月 14 日前该做什么

    DeepSeek 9 月 10 日推送 V4.1-Flash 正式版:全新 Causal Encoder-Decoder 架构把 552B 主干压到 prefill 仅激活 8B,配 1M 上下文、M…