8 月 3 日,阿里云正式发布了新一代基座大模型 Qwen 3.8。这不是一次常规的版本迭代,而是直接把千问家族的参数规模推到了 2.4 万亿(激活参数 95B),上下文拉到 100 万 Tokens,并且首次把 Max 级别的旗舰模型拿出来开源。
更值得关注的是它的定位:不再只是”帮你写段代码”或者”回答个问题”,而是奔着 长周期、端到端交付真实项目 去的。官方 demo 里,Qwen 3.8-Max 从一个空文件夹出发,独立运行约 16 天,完成了一个叫 oh-my-cli 的自进化智能体框架,产出 265 次代码提交,整个过程已经开源在 GitHub 上。
对普通开发者来说,这种能力可能有点遥远。但模型的 API 已经上线 千问 AI 平台,下周还要开源 Qwen 3.8-Max 和 Qwen 3.8-27B 的权重。也就是说,不管你是想接 API 快速试试,还是想私有化部署,都有路可走。
这篇文章就从”怎么用”的角度,把 Qwen 3.8 的接入方式、价格、适用场景和选型逻辑讲清楚。
一、Qwen 3.8 到底是什么?先抓三个关键数字
- 2.4 万亿总参数 / 95B 激活参数:基于稀疏 MoE 架构,每次前向传播只激活一部分参数,所以推理成本比看起来的”2.4 万亿”要低得多。
- 100 万 Tokens 上下文:可以一次性塞进整本书、整段代码库历史,或者几百页法律合同。
- 视觉理解 + GUI 交互:不是只会看图的”多模态”,而是能结合视觉反馈去操作界面、完成复杂任务。
在 8 月 3 日放榜的 Arena 第三方评测 中,Qwen 3.8-Max 整体仅次于 Anthropic 的 Claude 系列,CodeArena 排全球第四,VisionArena 排全球第二。阿里这次没有只刷通用榜单,而是把宣传重点放在了三个垂直方向:Coding(编程)、Cowork(办公协作)、科研与长周期任务。
这和之前 Qwen3.6-Plus 的路线不太一样。3.6 时代更多是在讲”我比 GPT-4 强多少”,3.8 则是在讲”我能独立把活儿干完”。
二、三种方式用上 Qwen 3.8
1. 千问 AI 平台:最快拿到 API
如果你只是想调用模型,最省事的办法是去 千问 AI 平台 创建一个 API Key。这个平台我在之前的文章里详细介绍过,核心卖点就是一把 Key 能调 Qwen、Kimi、DeepSeek 等上百个模型,现在 Qwen 3.8 也接进来了。
价格如下(国内):
| 计费项 | 价格 |
|---|---|
| 输入 | 12 元 / 百万 Tokens |
| 输出 | 36 元 / 百万 Tokens |
| 隐式缓存命中 | 1.5 元 / 百万 Tokens |
海外定价是输入 2 美元、输出 6 美元、缓存命中 0.25 美元。阿里官方的说法是,和相近智能水平的前沿模型相比,Qwen 3.8 的国际价大概是 Opus 5 的 40%(输入)和 24%(输出)。
对于想跑长上下文的场景,缓存命中率会很关键。100 万 Tokens 的上下文如果每次都全量计费,账单会很难看;但如果你的任务里大量内容相对稳定(比如代码库、知识库、长文档),隐式缓存能帮你把成本压到接近原来的 1/8。
2. Qwen Studio:零代码先试试效果
如果你不想写代码,可以直接去 Qwen Studio 网页版体验。适合先扔几个真实任务进去,看看回答质量、响应速度和中文理解是否满足需求,再决定要不要接 API。
3. 千问办公:企业场景直接落地
同日发布的 千问办公(QwenWork) 已经把 Qwen 3.8 作为底层模型之一。它是 QoderWork、MuleRun、悟空三条产品线整合后的企业级 Agent,打通了钉钉 IM,未来还会接企业数据库和工作流。
如果你的需求不是”调模型”,而是”让 AI 帮我做尽调报告、审合同、整理周报”,那千问办公可能比一个裸 API 更实用。它把模型能力包装成了可以复用的”组织级 Skill”,比如一家律所的首份并购尽调报告做完后,可以直接沉淀成 Skill,新同事接到同类案子调用即可。
三、它到底能干什么?四个真实场景
官方放出来的案例很多,我挑四个对普通人最有参考价值的:
1. 长周期编程项目
Qwen 3.8-Max 可以从零搭建一个项目框架,自动写代码、跑测试、修 BUG,持续多天。oh-my-cli 案例里,它独立运行 16 天,做了 265 次提交。这对创业团队或者独立开发者很有吸引力:你可以把架构设想说清楚,让模型先跑一个可用原型,自己再聚焦产品逻辑。
2. 法律、科研文档审查
官方说法是,数百份法律文档、1284 条条款的标注,人工团队需要一周,Qwen 3.8 一小时完成。这种场景下,100 万上下文和稳定的指令遵循能力比”聪明”更重要——它得先把文档读完,再按你给的规则一条条标出来,不能漏、不能胡编。
3. 视频/体育数据分析
160 小时以上的比赛录像,逐帧拆解成 8400 多个攻防回合,并输出球员战术画像和教练报告。这个用到了多模态视觉理解和长程推理的结合,适合体育、电商、安防等需要”看懂视频并出结论”的行业。
4. 复杂系统仿真
芯片设计沙箱里,Qwen 3.8 经过约 500 轮交互,把硬件门数从 8298 门精简到 678 门;在 365 天电商经营模拟里拿到了 4.16 倍回报。这类任务考验的不是单次回答质量,而是”执行-反馈-迭代”的闭环能力。
四、Qwen 3.8 和 Claude / GPT / DeepSeek 怎么选?
| 维度 | Qwen 3.8-Max | Claude Opus 5 | GPT-5.6 / Grok 4.5 | DeepSeek V4-Flash |
|---|---|---|---|---|
| 上下文 | 100 万 Tokens | 100 万 Tokens | 通常 20 万-100 万 | 128K |
| 强项 | 长周期任务、中文、办公 | 代码质量、复杂推理 | 通用对话、生态整合 | 性价比、Agent 能力 |
| 价格 | 国内输入 12 元 / 百万 | 较高 | 因档位而异 | 极低 |
| 开源 | 下周开源 Max + 27B | 否 | 否 | 是 |
| 国内访问 | 顺畅 | 需代理/中转 | 需代理/中转 | 顺畅 |
如果你的任务满足以下任意一点,Qwen 3.8 值得优先试:
- 需要处理超长中文文档或代码库;
- 希望私有化部署,且对开源权重有要求;
- 主要在杭州、钉钉、阿里云生态里做企业应用;
- 预算有限,但想用接近 Claude 水平的能力。
反过来,如果你已经在用 Claude Opus 5 跑高端代码项目,或者深度依赖 OpenAI 的 ChatGPT Work 生态,没必要立刻迁移。更现实的策略是:把 Qwen 3.8 作为中文长文本和本地化场景的补充。
五、开源之后怎么部署?
阿里已经确认,下周会开源 Qwen 3.8-Max 和 Qwen 3.8-27B 两个版本。Max 是完整旗舰,27B 是更轻量的版本,适合本地或中小企业私有化部署。
根据阿里一贯的发布节奏,开源后大概率会提供:
- Hugging Face 和魔搭社区的模型权重;
- vLLM / SGLang / Transformers 的推理示例;
- 对昇腾、海光等国产芯片的适配。
如果你之前看过 本地部署大模型完全指南,应该对 Ollama 和 LM Studio 不陌生。Qwen 3.8-27B 开源后,预计会快速接入这两个平台,个人开发者用 24GB 显存的消费级显卡就能跑起来。Max 版本则需要多卡或云服务,更适合企业场景。
另外,阿里还推出了 Qwen-MM-Plugins,一个针对多模态 Agent 的扩展库。如果你做的是”看图操作界面”类的应用,可以关注这个组件。
六、三个上手建议
1. 先用 Qwen Studio 跑真实任务
不要只看 benchmark。把你手头上最难的那个任务——一份 500 页的合同、一段祖传代码、一个复杂的数据分析需求——扔进去,看它能不能连续多轮保持上下文不跑偏。这是 Qwen 3.8 真正的卖点。
2. 接 API 时优先利用缓存
长上下文模型的账单杀手不是单次输出,而是重复输入。如果你的任务里有稳定的背景信息,尽量用千问 AI 平台的缓存机制,或者自己把 prompt 结构化,减少冗余 Token。
3. 等开源后再决定私有化路线
下周权重开源后,先跑 27B 版本试试成本和效果。如果 27B 已经能覆盖 80% 的场景,就没必要硬上 Max。私有化部署真正的成本不在模型本身,而在后续的运维、安全和迭代。
结语
Qwen 3.8 的发布,标志着国产大模型开始从”跑分追平”转向”独立交付真实项目”。对开发者来说,这意味着两个机会:一是可以用更低的成本获得接近顶尖模型的能力;二是可以把更多重复性、长周期的工作交给模型闭环执行。
当然,模型再强也只是工具。真正决定价值的,是你能不能把它放进合适的工作流里。下周开源后,我会再补一篇部署实测。今天先把 API 接起来,用真实任务验一验它的成色。




发表回复