7 月 27 日深夜,月之暗面把 Kimi K3 的模型权重、技术报告,以及支撑它训练的三项 Infra——MoonEP、FlashKDA、AgentEnv——一次性全扔了出来。
这不是那种「只发论文、权重藏着」的开源,而是真的把 2.8 万亿参数的 MoE 模型、训练通信库、注意力算子、Agent 沙箱全摊开了。消息放出后半小时,Hugging Face 上的点赞数就破了 4000,登顶趋势榜。海外有开发者直接说:”这就是本地版 Fable 5。”
半个月前我写过一篇 Kimi K3 上手指南,当时主要是讲网页、Kimi Code、API 和移动端怎么用。今天这篇 focus 在另一件事上:权重到手之后,你怎么把它跑起来。
这次开源到底给了什么
先列清楚礼包内容,免得后面部署的时候不知道自己在下什么。
- 模型权重:2.8T 总参数,单次激活 1040 亿,支持 100 万 token 上下文,原生多模态(图/视频理解)。下载地址在 Hugging Face 和 ModelScope 都有。
- 技术报告:KDA + Attention Residuals、Stable LatentMoE、MoonViT-V2 这些架构细节全在里面。
- MoonEP:超大规模细粒度 MoE 的通信库,专家并行负载不均时也能保持效率。
- FlashKDA:Kimi Delta Attention 的高性能算子,在 H20 上 prefill 速度比 flash-linear-attention 基线快 1.72–2.22 倍。
- AgentEnv:和 KVCache.ai 一起做的 Agent 训练沙箱,支持快照、恢复、分叉,专门给大规模 Agent 后训练用。
简单说,月之暗面这次把”做菜谱、锅、灶台和后厨管理制度”一起端出来了。
三种使用路径,按门槛从低到高
路径一:直接调用 API(最省事)
如果你不想折腾硬件,最快的方式是等云平台的 API。阿里云已经宣布:
- 千问 AI 平台和阿里云百炼会同步提供 Kimi K3 的模型 API。
- 阿里云真武 M890 超节点完成了 Day0 适配,这也是国内首个跑通近 3 万亿参数模型的超节点。
这意味着普通开发者不需要自己买卡,注册个阿里云账号、拿到 API Key,就能像调用其他模型一样调用 K3。海外也有 Nebius、Baseten、Fireworks 等平台宣布 Day0 适配。
具体入口可以持续关注 Hugging Face 官方仓库 和 GitHub 页面 的推理合作伙伴列表。
路径二:本地或私有云部署(vLLM / SGLang)
如果你有自己的 GPU 集群,或者想用私有云跑,vLLM 和 SGLang 是目前最主流的推理框架。
K3 是 MoE 架构,896 个路由专家、单次激活 16 个。这种稀疏结构对推理框架的调度要求很高,但也是 vLLM/SGLang 的强项。官方和这些推理社区都做了适配,放出来的权重可以直接加载。
需要注意的是,2.8T 模型不是单张卡能吞下的。即便是用 INT8/FP8/MXFP4 量化,也需要多卡并行。个人玩家如果只有 4090 或单张 A100,这条路不太现实。但中小企业如果已经有 8 卡 A100/H100 集群,或者能租到云 GPU,这个方案是可行的。
对本地部署大模型还没概念的朋友可以回看 本地部署大模型完全指南,先把 Ollama、LM Studio 这些工具链熟悉一下。虽然 K3 目前大概率还进不了 Ollama 的默认模型库,但部署思路和量化、显存估算这些基本功是相通的。
路径三:国产算力部署(华为昇腾 / 阿里云真武 M890)
这可能是这次开源最有意思的部分。
华为昇腾 CANN 宣布对 K3 做了 0day 适配:
- 训练侧:基于 MindSpeed MM,在 Atlas 800 A3、Atlas 900 A3 SuperPoD 上完成训练复现。
- 推理侧:通过 vLLM Ascend 和 SGLang 开源推理引擎部署。
- 昇腾 950 超节点原生支持 K3 的 mxFP4 量化权重。
阿里云的真武 M890 超节点更狠:64 张 M890 芯片以 800GB/s 全互联,显存规模 9TB,单实例就能支撑万亿级 MoE 的专家并行。联合优化后首 token 时延降低约 35%,单卡解码吞吐提升 1.8 倍,能稳定支持 1M 长上下文。
也就是说,K3 不只是”能在国产芯片上跑”,而是已经有人帮你把性能调过了。这对做国产化替代、或者有信创需求的企业来说,是一个很重要的信号。
个人开发者怎么低成本尝鲜
说实话,2.8T 模型对普通人不友好。但如果你想先感受一下 K3 的能力,有几条低成本路线:
- 等 API 开放:千问 AI 平台和阿里云百炼上线后,按 token 付费调用,和平时用 GPT/Claude 没区别。
- 用 Hugging Face 的 demo / 推理 API:大模型开源后,社区通常很快会有人放出在线 demo 或托管推理端点。
- 先用 K3 的小场景:K3 在 Python-PPTX Slides 竞技场以 Elo 1379 分登顶,领先 Claude Fable 5 76 分。如果你需要做 PPT、长文档分析、代码生成这类任务,API 开放后可以直接拿它替换现有工作流。
- 关注 AgentEnv 和 MoonEP:即便不跑完整模型,这三项 Infra 对研究 MoE 通信、Agent 训练沙箱也很有价值。GitHub 地址分别是 MoonEP、FlashKDA、AgentEnv。
和半个月前那篇 Kimi K3 指南的区别
可能有人会问:7 月 17 号不是才写过 K3 吗?
那篇讲的是”怎么用”——网页、Kimi Code、API、移动端,面对的是已经封装好的产品形态。这篇讲的是”怎么拿到权重、怎么自己跑”——面向愿意自己部署、二次开发、或者做企业集成的开发者。
两者是互补的。如果你只是想用 K3 聊天、写代码、做分析,去看 上一篇;如果你在想”这模型能不能进我的业务系统、能不能私有化部署”,这篇更合适。
类似地,如果你之前读过 DeepSeek V4 开源那篇,会发现国产开源模型现在走的路线越来越清晰:不是单纯拼参数,而是把模型、infra、国产算力适配打包开放,让企业能真正落地。
写在最后
K3 开源之后,市场反应其实比技术圈更诚实。OpenRouter 上的数据显示,中国模型近 28 天市场份额已经到 63.5%,美国模型 35.5%。这不是某个榜单的夸张,是真实调用量。
对普通开发者来说,2.8T 模型本身未必马上用得上,但它释放了一个明确信号:开源模型的天花板又被抬高了一截,而且这次是在国产算力上被抬高的。
接下来几个月,围绕 K3 的微调工具、量化方案、应用案例会大量出现。现在先把权重地址、技术报告、Infra 仓库收藏好,等云平台 API 一开放,就能直接上手。
如果你想把大模型真正揉进自己的工作流,而不只是聊聊天,可以再看下 AI 编程工程化那篇,里面讲的 Skill、MCP、Agent 编排这些思路,和 K3 这种长上下文、强工具调用能力的模型特别搭。




发表回复