小米 MiMo-V2.6 开源上手:AA 46.3 分登顶的万亿级全模态模型,API 调用、本地部署与四款模型怎么选

9 月 22 日凌晨,开源权重榜换人了

小米在 9 月 22 日凌晨(美东时间 9 月 21 日)发布并开源了 MiMo-V2.6 系列,两个主角:Pro 和 Flash。官方放出的核心数字是 Artificial Analysis 智能指数 46.3 分——开源权重模型第一,把 GLM-5.3(45 分)、Kimi K3(44 分)压在身后,和闭源的 Grok 4.7 持平,距离 Claude Fable 5.1 和 GPT-6 Astra 的 53 分还差 7 分。

我把三处信源交叉核对了一遍:OpenRouter 的模型页(已上架,定价 $0.435/$0.87 per 1M tokens,1M 上下文)、HuggingFace 的 XiaomiMiMo 组织(Pro-RL、Flash-RL、Distill-Qwen-9B 三个仓库真实存在,MIT 协议)、以及小米官方发布公告。定价在 OpenRouter、官方文档和四家媒体(北京日报、每经、21 财经、海外独立博客)之间完全一致,这个基础是牢的。

如果你还记得我早前写过的 MiMo-V2 评测,那一代还只是「性价比不错的国产模型」。V2.6 这次跨的步子大得多:全模态输入、1M 上下文、万亿参数 MoE,外加一份把失败过程都公开的训练日志。下面按「怎么选、怎么调、怎么部署、坑在哪」的顺序讲。

四款模型,先分清再选

这次发布实际有四个入口,不分明就上手容易选错:

模型参数规模定价(输入/输出 per 1M)适合谁
MiMo-V2.6-Pro1.02T 总参 / 42B 激活(MoE)$0.435 / $0.87复杂长程任务、Agent、代码
MiMo-V2.6-Flash约 310B 总参 / 15B 激活(社区数据,以官方技术报告为准)$0.14 / $0.28高频调用、批量处理
Pro-UltraSpeed与 Pro 同权重,加速服务模式$4.35 / $8.70(Pro 的 10 倍)强实时交互
MiMo-V2.6-Distill-Qwen-9B9B(Qwen3.5-9B 蒸馏)免费下载,本机跑个人设备、RL 研究起点

三款都能读文本、图片、视频、音频四种输入,上下文窗口都是 1M token,最大输出 128K。Pro 和 Flash 的权重以 MIT 协议放在 HuggingFace 上,商用没有额外门槛;UltraSpeed 是纯 API 服务模式,权重不可下载。

第一个要提醒的选型误区:Flash 不是「Pro 的阉割版」,而是独立定位。Flash 的 API 价格只有 Pro 的三分之一,如果你的场景是「每分钟都在调、单次任务不大」的批处理,Flash 反而是更合理的默认项。把 Pro 当默认模型跑轻量任务是这次最容易多花钱的地方。

46.3 分的含金量:强在哪,弱在哪

总分之外,细分项更能说明这个模型的真实形状:

  • 长上下文推理(AA-LCR)86.3%——1M 窗口不是摆设,这是全榜前列的水平
  • HLE(Humanity’s Last Exam)49.4%SciCode 60.9%——知识和科研编程都在线
  • CritPt(科研级物理)26.6%AA-Omniscience 准确率 34.8%——这两项明显偏弱

翻译一下:它擅长「给你一大堆材料做推理」的任务,弱在「前沿科研级硬推理」和「高难知识问答」。如果你要跑的是代码仓库级任务、长文档分析、多轮 Agent 工作流,这个分数结构是好消息;如果你要做的是数学前沿证明或知识密集型问答,开源阵营里它还不是最优解,别被「开源第一」四个字带偏。

API 上手:两条路,十分钟内能跑通

官方渠道是小米 MiMo 开放平台,模型名必须全小写(mimo-v2.6-pro / mimo-v2.6-flash / mimo-v2.6-pro-ultraspeed);海外用户走 OpenRouter 更省事,模型 slug 是 xiaomi/mimo-v2.6-pro。两条路的接口都是 OpenAI 兼容格式,注册流程可以参考我之前整理的 OpenRouter 国产模型调用指南

拿到 Key 之后,最快的验证方式是一条 curl(运行环境:任意装了 curl 的 macOS / Linux 终端,把 $OPENROUTER_API_KEY 换成你自己的):

Bash
curl -N https://openrouter.ai/api/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -d '{
    "model": "xiaomi/mimo-v2.6-pro",
    "messages": [
      {
        "role": "user",
        "content": [
          {"type": "text", "text": "用一句话总结这张图的内容"},
          {"type": "image_url", "image_url": {"url": "https://example.com/your-image.jpg"}}
        ]
      }
    ]
  }'

Python 侧用 OpenAI SDK 换个 base_url 就行(运行环境:Python 3.10+,pip install openai):

Python
from openai import OpenAI

client = OpenAI(
    base_url="https://openrouter.ai/api/v1",
    api_key="sk-or-v1-你的Key",
)

resp = client.chat.completions.create(
    model="xiaomi/mimo-v2.6-pro",
    messages=[{"role": "user", "content": "解释一下 MoE 架构里 expert load imbalance 是什么问题"}],
)
print(resp.choices[0].message.content)

真正省钱的地方在缓存。Pro 的缓存命中输入价是 $0.0036/M,只有未命中价 $0.435 的 0.8%——不到百分之一。OpenRouter 后台显示这个模型过去三天的实际平均输入价被拉到了 $0.0379/M(缓存命中率 91.65%),也就是说真实用户的账单价格远低于标价。你的工作流越是重复携带同一段长 system prompt 或大上下文,省得越多。这个机制我在 DeepSeek 和 Claude 的文章里都强调过,MiMo 的缓存折扣力度是目前主流模型里最激进的一档。

我实际算了一笔账:单任务成本差出 40 倍

官方宣传「同等智能水平价格是海外模型的二十分之一到六十分之一」,这个说法太抽象,我写了个脚本按真实负载算(脚本在本机 macOS、Python 3.13 实际运行,数字可以直接复现):

Python
# cost_compare.py — 长程 Agent 任务成本对比
# 负载假设:一任务 50 轮工具调用,每轮 input 50K tokens(90% 缓存命中)+ output 2K tokens
PRICE = {
    "MiMo-V2.6-Pro":  dict(miss=0.435, hit=0.0036, out=0.87),
    "MiMo-V2.6-Flash": dict(miss=0.14, hit=0.0028, out=0.28),
    "Pro-UltraSpeed": dict(miss=4.35, hit=0.036, out=8.70),
    "Claude Fable 5.1": dict(miss=10.0, hit=0.25, out=50.0),
}
ROUNDS, INPUT_K, OUT_K, HIT = 50, 50, 2, 0.9
t_miss = ROUNDS * INPUT_K * (1 - HIT) / 1000
t_hit = ROUNDS * INPUT_K * HIT / 1000
t_out = ROUNDS * OUT_K / 1000
for name, p in PRICE.items():
    cost = t_miss * p["miss"] + t_hit * p["hit"] + t_out * p["out"]
    print(f"{name:20s} ${cost:.4f} / 任务")

我实际跑出来的结果(运行环境:macOS + Python 3.13.12,2026-09-23):

模型单任务成本相对 Pro
MiMo-V2.6-Pro$0.20381.0x
MiMo-V2.6-Flash$0.06930.34x
Pro-UltraSpeed$2.038510.0x
Claude Fable 5.1$8.062539.6x

同样的长程 Agent 负载,Pro 跑一个任务两毛钱美元,Fable 5.1 要八块——40 倍的差距。这个估算和 Artificial Analysis 官方口径的「单任务成本 $0.13」在同一量级(他们用标准 benchmark 负载,我用的是更重的 Agent 假设),互相印证。结论很直接:如果你的任务对缓存友好,Pro 的性价比目前开源阵营没有对手

官方数据里的两个坑,动手前先看

坑一:标准 Pro 的吞吐不快。 OpenRouter 直连小米的 P50 吞吐是 27 tok/s,P50 端到端延迟 3.23 秒起步。这个速度做后台批处理无所谓,做交互式聊天或实时 Agent 就会有明显的等待感。UltraSpeed 模式宣称最高 20 倍输出速度,代价是 10 倍定价——按我上面的账,UltraSpeed 单任务 $2.04,仍然比 Fable 5.1 便宜 4 倍,所以「既要智能又要速度」时它是个合理选项;但如果你只是嫌标准 Pro 慢就无脑切 UltraSpeed,先算算账单能不能接受。

坑二:工具调用错误率偏高。 OpenRouter 统计这个模型的 Tool Call Error Rate 是 10.17%、Structured Output Error Rate 是 9.37%。对比一下:混元 Hy4 的 function calling 错误率只有 0.49%(我 8 月底写它的时候专门提过)。也就是说十次工具调用里会有一次格式错误或调用失败,重工具调用的生产级 Agent 现在还不适合把它放在主力位,除非你的 harness 有完整的重试和校验逻辑。

个人用户能跑的 MiMo:9B 蒸馏版

Pro 是 1.02T 参数的 MoE,本地部署要的是多卡服务器,多卡推理方案可以参考我写过的 vLLM 部署指南,普通人不用惦记。但这次发布里藏着一个对个人用户友好得多的东西:MiMo-V2.6-Distill-Qwen-9B——小米把 MiMo 生成的数据拿去微调 Qwen3.5-9B 得到的蒸馏模型,MIT 协议,图 + 文输入,Model Tree 里挂了 29 个社区量化版,Ollama、LM Studio、llama.cpp 都能直接用。

它的能力账很能打:SWE-bench Verified 61.1(基座 Qwen3.5-9B 是 60.0),SWE-bench Pro 44.6(基座只有 32.0,提升 40%),最夸张的是网络安全方向——MiMo Cyber 31.3 对基座的 5.7,5.5 倍。9B 的体量、旗舰蒸馏的数据,这个组合在「本地能跑的小模型」里是值得认真考虑的。

官方推荐的文本生成部署方式是 SGLang(运行环境:Linux + NVIDIA GPU 或强 Apple Silicon 机器,pip install "sglang[all]"):

Bash
sglang serve \
  --model-path XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B \
  --reasoning-parser mimo \
  --host 0.0.0.0 \
  --port 30000

# 客户端用 OpenAI SDK 指向 http://localhost:30000/v1
# 开启思考模式需要传 extra_body={"chat_template_kwargs": {"enable_thinking": True}}

不想折腾框架的话,LM Studio / Ollama 里直接搜量化版更省事(具体流程见我之前的 Ollama 与 LM Studio 本地部署指南)。内存账先帮你算好:原版 BF16 权重约 18GB,16GB 内存的 Mac 装不下;4-bit 量化后约 5GB 出头,加上系统开销,16GB 机器跑得动,8GB 机器建议直接上云端 API。

这次发布里最值钱的可能不是权重,是那份训练日志

MiMo-V2.6 发布前,小米做了一件此前国内大模型厂商没做过的事:把强化学习后训练过程做成实时公开页面,直播了六天。仪表盘上能看到成本计数器(Pro $2,620,670、Flash $854,044,合计约 347 万美元)、30 个训练步、约 75 万条轨迹,也看到了失败记录——Pro 在第 17 步因为 expert 负载不均导致 GPU OOM 重启、grader 集群网络断连后重启、发现 cyber 数据集有坏模式后直接把它从训练里摘掉。

这套透明度的价值有两层。对普通用户,它把「训练一个开源旗舰要花多少钱」从传闻变成了可查的数字(不到六天、350 万美元上下,比大多数人想象的便宜)。对研究者,小米同时开源了 7,000 多个 RL 任务环境(覆盖软件工程、漏洞复现、知识密集型工作、网页开发四类)和基于 verl、uni-agent、mini-swe-agent 的端到端训练框架,并且给了明确的复现路径:从免费的 Distill-Qwen-9B 起步做 RL,官方数据显示 11 个基准全线提升(SWE-bench Verified 61.1 → 66.2,Terminal Bench 2.1 37.1 → 52.8)。换句话说,你不是只能下载一个训练完的模型,而是拿到了一份「怎么把它继续练强」的完整教程。对想自己动手做 agentic RL 的团队,这可能是整次发布里含金量最高的部分。

什么场景我不建议用

说点建议之外的判断。三类场景我暂时不会把 MiMo-V2.6 放进去:

  1. 重工具调用的生产 Agent——10% 量级的 tool call 错误率意味着你需要一层完整的重试与校验兜底,这层兜底的开发成本往往比省下的 API 钱更贵。纯文本推理、代码生成类任务没有这个问题。
  2. 对延迟敏感的实时交互——标准 Pro 的 27 tok/s 不够看,UltraSpeed 又要 10 倍价钱。对话类产品可以先用 Flash 或其他高吞吐模型顶着。
  3. 音频为主的中文多模态场景——它支持音频输入,但公开评测集中在代码和通用 Agent 上,中文语音理解的公开样本还太少,选型前等一等。

总体来说,MiMo-V2.6 是今年开源阵营分量最重的一次发布:榜单登顶是真的、价格优势是真的、全模态和 1M 上下文也是真的,短板同样清楚地写在数据里。想上手的话,路径很清楚:先在 OpenRouter 或小米开放平台拿个 Key,用上面那段 curl 跑通一次调用确认通路,再把你的真实工作流接进去观察缓存命中率——这个数字直接决定你的账单。本地部署则从 9B 蒸馏版的 4-bit 量化包开始,跑得动再谈别的。跑完之后欢迎回来聊聊你的实测结果。

推荐阅读

  • Qwen-Image-2.1 上手:7B 开源模型原生透明图 + 10 张参考图,文生图与编辑终于合一

    Qwen-Image-2.1 开源上手:7B 视觉主干把文生图、图像编辑、原生 RGBA 透明图塞进同一个 checkpoint,最多支持 10 张参考图与圈选/涂抹/mask 局部编辑。这篇给出 D…

  • Jev 决策模型上手:不生成文字的 AI、输出还免费,上线 48 小时被开源圈复刻了 6 次

    TypeSafe AI 的 Jev 不生成任何文字,只返回带概率的结构化判断:输入 $0.042/百万 token、输出免费、P50 延迟 0.23 秒。本文讲清它与 LLM 的区别、OpenRout…

  • Qwen3.8-Omni-Flash 上手指南:音频输入降到 8 毛一百万 token,1 小时录音视频直接扔给 API

    阿里千问发布全模态模型 Qwen3.8-Omni-Flash:文本、图片、音频、视频四输入,1M 上下文,一小时连续音视频直接进 API,音频输入从每百万 token 18 元降到 0.8 元。本教程…

  • Gemini 3.8 Live 上手:语音 Agent 能边聊边干活,还比 GPT-Live-1 便宜 40%

    Gemini 3.8 Live 与 Extended Thinking 已上线 Gemini API 和 AI Studio,语音模型能边说话边后台执行工具,基准超 GPT-Live-1 且每小时 3…