蚂蚁百灵 Ling-3.0-flash 开源了:124B/5.1B MoE,单台 DGX Spark 能跑,开发者怎么接?

如果你最近已经被国产大模型的“八周五连发”轰炸得有点麻木,那蚂蚁集团 8 月 7 日这条消息还是值得单独拎出来说:旗下百灵大模型团队把新一代原生混合推理模型 Ling-3.0-flash 的权重正式放到了 Hugging FaceModelScope 上,许可证是无改动的 MIT。

这意味着你可以下载、修改、商用,甚至二次分发,不用再看那些藏着营收上限或使用限制的“伪开源”协议。更重要的是,这不是一个只能跑在超算里的玩具:官方同步提供了 FP8、FP4、INT4 多个量化版本,单台 NVIDIA DGX Spark 就能跑通端到端推理。

本文就从“怎么用上”这个角度,把 Ling-3.0-flash 的三种落地方式拆开讲:云端 API、OpenRouter 免费接口、本地/私有部署。文末还有一份选型对照表,帮你判断它该不该进你的工作流。

一、这模型到底是什么来头

Ling-3.0-flash 是蚂蚁百灵(InclusionAI)的第三代原生混合推理模型。几个核心参数先摆出来:

  • 总参数:124B
  • 每 token 激活参数:5.1B
  • 架构:MoE,512 个 routed expert + 1 个 shared expert,每 token 激活 8 个 expert
  • 注意力:35 层 Kimi Delta Attention(KDA)+ 7 层 gated MLA,按 5:1 交替
  • 上下文:原生 256K,可扩展至 1M
  • 训练后模型:带 tool-calling 模板、thinking 模式开关、chat template
  • 协议:纯 MIT,无 acceptable-use、无营收触发条款

KDA 是线性注意力的一种变体,计算量随上下文长度线性增长;MLA 则负责在关键层做精确的全局关联。两者 5:1 交替,目标很明确:在长上下文场景下把首 token 延迟和整体推理成本压下来。官方说在 SGLang HiCache + Mooncake 三级缓存加持下,长输入场景的 TTFT 能降低 60%–80%。

另外,Ling-3.0-flash 不是裸基座,而是已经过 agent 训练的后训练模型。官方提到用了 10,000 多个交互式训练环境做端到端闭环,覆盖代码、通用任务和深度研究三类 agent 场景。所以它的默认打开方式不是“你问我答”,而是“丢给它一个复杂任务,让它自己拆步骤、调工具、修正结果”。

二、性能与成本:别只看参数,看“每块钱能干多少活”

在 Artificial Analysis 的 Intelligence Index 榜单里,Ling-3.0-flash 几项任务的加权平均调用成本约 0.04 美元,折合人民币约 0.27 元;加权平均解码时间约 1.4 分钟。同时落进了“智能水平—任务成本”和“智能水平—任务耗时”两个优势区间。

换算成大白话:它的单次推理不是最便宜的,但在“花同样的钱,谁能更快把活干完”这个维度上,确实有竞争力。

速度方面,官方给出的数据是:

  • 常规榜单输出速度:约 353 tokens/s
  • 指定高性能 GPU 配置下:平均输出速率突破 1100 tokens/s
  • 长输入 TTFT:在 HiCache + Mooncake 加持下降低 60%–80%

不过这些数据都是官方或第三方榜单数据,落到你的实际业务里,上下文长度、并发量和输出 token 数都会让结果浮动。建议先用 API 跑一遍真实任务,再决定是否大规模部署。

三、三条接入路径,按门槛从低到高排列

路径 1:百灵 API / OpenRouter,五分钟跑起来

如果你只是想快速验证,不想折腾显卡和 Docker,首选云端 API。目前有两个主要入口:

1. 百灵官方 API

蚂蚁百灵提供标准 OpenAI 兼容接口,base URL 为 https://api.ant-ling.com/v1。你需要完成支付宝账号绑定、进入 API 控制台创建 Token,然后按量计费。官方在 8 月 7 日 0 点到 8 月 31 日 24 点之间,对 Ling Studio 平台实行 2.5 折限时优惠。

2. OpenRouter 免费接口

OpenRouter 上已经上线了 inclusionai/ling-3.0-flash:free,免费 tier 有每日 200 次请求限制。对本地测试和个人 side project 来说,这比先充钱再试要友好得多。关于 OpenRouter 的用法和模型选择,可以回看我们之前的 国产模型调用量 TOP5 指南

下面是一段用 OpenRouter 调用 Ling-3.0-flash 的 Python 示例:

Python
from openai import OpenAI
import os

client = OpenAI(
    base_url="https://openrouter.ai/api/v1",
    api_key=os.getenv("OPENROUTER_API_KEY")
)

response = client.chat.completions.create(
    model="inclusionai/ling-3.0-flash:free",
    messages=[{"role": "user", "content": "用 Python 写一个带缓存的网页爬虫框架"}],
    extra_body={"reasoning": {"enabled": True}},
    stream=True,
    temperature=0.6,
    top_p=0.95
)

for chunk in response:
    print(chunk.choices[0].delta.content or "", end="")

注意 Ling-3.0-flash 默认开启 thinking 模式。如果你只想让它快速回答,不需要推理链,可以在 extra_bodychat_template_kwargs 里关闭。

路径 2:单机私有化,DGX Spark 就能跑

如果你的数据不能出域,或者想让模型在内网跑,官方提供了 MXFP4 和 INT4 量化版本,号称可以在单台 NVIDIA DGX Spark 上完成端到端推理。

DGX Spark 是一台紧凑的 AI 工作站,适合放在办公室或机房里做私有模型推理。相比动辄 8 卡 H100 的集群,这种“单机版”对中小团队更现实。关于本地部署的通用思路——Ollama、LM Studio、vLLM 该怎么选——可以参考我们的 本地部署大模型完全指南

不过要提醒一点:INT4/FP4 量化会损失部分精度,如果你的任务对输出质量非常敏感(比如长文档法律审核、金融报告生成),建议先用 FP8 或 BF16 做对比测试,再决定生产用哪个版本。

路径 3:高性能服务,SGLang / vLLM 集群部署

如果你要的是高并发、低延迟的生产服务,官方推荐用 SGLang 或 vLLM。

SGLang 快速启动(4 卡 H20-3e 或 Blackwell 节点)

Bash
docker pull lmsysorg/sglang:dev-Ling-3.0-flash

docker run --rm --gpus all --ipc=host --shm-size 32g \
  -p 30000:30000 \
  -e HF_TOKEN=<your-hf-token> \
  lmsysorg/sglang:dev-Ling-3.0-flash \
  env SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1 \
  python3 -m sglang.launch_server \
    --model-path inclusionAI/Ling-3.0-flash \
    --tp 4 \
    --context-length 262144 \
    --speculative-algorithm NEXTN \
    --mem-fraction-static 0.8 \
    --host 0.0.0.0 \
    --port 30000

80GB 显存卡(H100/H800)则需要把 --tp 改成 8。详细的硬件-配置矩阵可以去 SGLang Cookbook 查。

vLLM 部署

官方维护了一个 vllm-ling-v3 分支,支持 tool-call parser 和 reasoning parser:

Bash
git clone -b ling_3_0 https://github.com/inclusionAI/vllm-ling-v3.git
cd vllm-ling-v3
uv venv ~/my_ling_env
source ~/my_ling_env/bin/activate
VLLM_USE_PRECOMPILED=1 uv pip install --editable . --torch-backend=auto

vllm serve inclusionAI/Ling-3.0-flash \
  --trust-remote-code \
  --tensor-parallel-size 4 \
  --gpu-memory-utilization 0.85 \
  --enable-prefix-caching \
  --enable-auto-tool-choice \
  --tool-call-parser ling3 \
  --reasoning-parser ling3 \
  --speculative-config '{"method":"mtp","num_speculative_tokens":3}'

客户端调用时,建议带上 chat_template_kwargs: {"enable_thinking": true},让模型在复杂任务上发挥推理能力。

四、怎么把它塞进你的开发工具链

模型跑起来只是第一步,真正省时间的是让它接入你已经在用的工具。

VS Code + Kilo Code

蚂蚁官方已经给出 Kilo Code 集成教程。在 VS Code 设置里选 OpenAI Compatible,base URL 填 https://api.ant-ling.com/v1,model ID 填 Ling-3.0-flash,就能在编辑器里直接调用它做代码解释、重构和 Agent 任务。

Claude Code / OpenClaw / 其他 Agent 工具

因为 Ling-3.0-flash 兼容 OpenAI API,只要你的 Agent 工具支持自定义 OpenAI-compatible endpoint,就可以把它填进去。 tool-call parser 用 ling3 时,函数调用的稳定性会明显好一些。关于 Agent 工作流的搭建思路,可以复习 Claude Code fork 工作流AI 编程工程化 这两篇。

一个适合立刻试用的场景:把 OpenClaw Skills 里定义的搜索、数据库查询能力配给 Ling-3.0-flash,让它基于你自有的行业数据做深度研究。有测试者反馈,让它基于机器之心的行业数据库梳理蚂蚁百灵的技术演进路线,输出结果条理清晰,可直接当参考材料用。

五、它最适合干什么

基于它的训练重点和架构设计,Ling-3.0-flash 在以下几类任务上比较对味:

  • 代码 Agent:多文件修改、bug 修复、单元测试补全。官方评测在 SWE-Bench Pro、MCP-Atlas、SkillsBench 上都有不错表现。
  • 长上下文深度研究:256K 上下文 + 线性注意力,适合一次性塞进几十篇论文、几百页合同或大型代码库做分析。
  • 工具调用工作流:内置 tool-calling 模板和 10,000+ 交互训练环境,适合需要多步骤、多工具协作的 agent 场景。
  • 企业内部知识问答:私有化部署后接 RAG,数据不出域,成本又比闭源旗舰低一截。

如果你只是偶尔写个文案、查个资料,那免费的 ChatGPT、豆包、元宝已经够用了,没必要为了 Ling-3.0-flash 专门配机器。但如果你是开发者、技术团队负责人,或者正在做需要长上下文和工具调用的 agent 产品,它值得放进候选清单。

六、和同类模型怎么选

模型总参数 / 激活参数上下文开源协议最佳场景
Ling-3.0-flash124B / 5.1B256K–1MMITAgent、长上下文、私有化部署
DeepSeek V4-Flash284B / ?1M开源高性价比 API、Agent 能力
Qwen 3.8-Max2.4T / 95B1M部分开源编程、办公、科研、长周期任务
Kimi K32.8T / ?1M开源知识工作、多模态、长周期软件工程
gpt-oss-20B21B / ?256KApache 2.0低成本本地部署、OpenAI 兼容生态

这张表只能给你一个大致方向。最终选哪个,还是要用你的真实数据跑一遍。成本、延迟、输出质量这三个指标,对不同任务权重完全不同。

七、几个需要注意的坑

  • Thinking 模式默认开启:简单任务会“想太多”,响应变慢。不需要推理时记得关。
  • 纯文本模型:目前没有视觉或音频能力,别指望它看图说话。
  • BF16 权重约 230GB:本地部署前先确认存储和显存够不够用。
  • 榜单数据不等于你的数据:官方评测很好看,但落到具体业务场景务必自己测。
  • 工具调用要配 parser:用 vLLM/SGLang 时,建议显式指定 ling3 parser,否则工具调用格式可能不稳定。

八、写在最后

Ling-3.0-flash 的开源,最值得关注的不只是 124B 参数或 1100 tokens/s 的速度,而是它的“工程化诚意”:MIT 协议、多量化版本、官方 vLLM/SGLang 分支、OpenAI 兼容 API、DGX Spark 单机可跑。这些加在一起,意味着一个中小团队真的能在几天内把它从 Hugging Face 拖到生产环境。

如果你还没试过,最简单的起手动作是:去 OpenRouter 领一个免费 API key,花 10 分钟跑一遍你手头的真实任务。比看十篇评测都管用。

你已经在用 Ling-3.0-flash 了吗?欢迎在评论区分享实际体验和踩过的坑。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

推荐阅读

  • 蚂蚁百灵 Ling-3.0-flash 开源了:124B/5.1B MoE,单台 DGX Spark 能跑,开发者怎么接?

    如果你最近已经被国产大模型的“八周五连发”轰炸得有点麻木,那蚂蚁集团 8 月 7 日这条消息还是值得单独拎出来说:旗下百灵大模型团队把新一代原生混合推理模型 Ling-3.0-flash 的权重正式放…

  • 扎克伯格终于对 AI 编程下手了:Muse Code 测试版上手,一条命令让 Agent 替你改代码

    8 月 5 日,Meta 正式发布了自己的第一款终端 AI 编程智能体——Muse Code。不是模型 API,不是网页聊天,而是直接钻进你终端、能读你代码库、能自己规划任务并执行的那类工具。 在这之…

  • ChatGPT 免费版终于「解禁」了:无限对话 + GPT-5.6 Luna + 思考按钮,一文看懂怎么用

    如果你用 ChatGPT 的免费版,大概率遇到过这种情况:聊到一半,屏幕突然弹出一行灰字——”您已达到使用上限”。那种被硬生生打断思路的感觉,跟看电影看到高潮突然插播广告差不多…

  • 豆包现在能看着你的屏幕跟你聊天了:SeedRealtime 全双工视频通话上手指南

    你用过对讲机吗?按住说话,松手收听,中间永远有一道「你的回合/我的回合」的裂缝。过去我们和 AI 视频聊天,本质上就是这个模式——你说完,它才听;它听完,才想;想完,才说。哪怕延迟只有一秒,那股「跟机…

暗夜独行