8 月 20 日,OpenRouter 上多了一个模型,没有发布会,没有官方博客,连开发者名字都没署。它叫 stealth/ox-alpha,上线三天就被开发者塞了 3.71 万亿 token 的提示词进去。
社区里有人让它跑了 10 道 DeepSWE 编程题,通过率 80%,排在 Claude(65%)和 GPT-5.6 Sol(52%)前面。一个不花钱、不署名、百万上下文、还能看图看视频的模型——这谁忍得住不试。
我花了半天时间研究它的来龙去脉、跑了基础 API 验证,这篇文章记录完整过程。核心结论先放这里:可以试,但别急着把公司代码往里塞。
Ox Alpha 到底是什么
OpenRouter 模型页显示的公开信息:
| 项目 | 数值 |
|---|---|
| 模型 ID | stealth/ox-alpha |
| 上下文窗口 | 1,048,576 tokens(1M) |
| 最大输出 | 131,072 tokens |
| 输入模态 | 文本 + 图片 + 视频 |
| 预览定价 | $0(输入/输出/缓存读取全免费) |
| 吞吐量 | 25 tokens/秒 |
| P50 延迟 | 4.53 秒 |
| 3 天可用性 | 99.99% |
| 缓存命中率 | 82.92% |
“stealth”的意思是隐身发布——OpenRouter 只负责路由请求,不开发、不拥有这个模型。真正的提供方是匿名的。
那么谁做的?独立研究者 Ben Davis 做了一组技术分析,根据 tokenizer 对齐方式和视频编码器 token 消耗模式,他 99% 确信这是智谱(Zhipu)GLM-5.x 系列的未发布旗舰。智谱此前确实有过通过隐身渠道做公开测试的先例。但智谱没有官方确认,所以这条线目前只能算”高度怀疑”,不能当结论用。
不管谁做的,它现在免费、现在能用、跑分在线——这对开发者来说就够了。
三步跑通 API 调用
第一步:拿到 OpenRouter API Key
去 OpenRouter 设置页 创建一个 API Key。如果你之前读过我的OpenRouter 全球调用榜那篇文章,可能已经有账号了。
Key 只放在本机环境变量里,别写进代码,别提交到 Git:
# macOS / Linux
export OPENROUTER_API_KEY=sk-or-v1-你的key
# Windows PowerShell(当前窗口有效)
$env:OPENROUTER_API_KEY = "sk-or-v1-你的key"第二步:发一条最小请求确认模型可用
别一上来就接 Claude Code 或复杂 Agent。先发一条短请求,确认账户、Key、模型名和网络都没问题。OpenRouter 的接口跟 OpenAI Chat Completions 完全兼容:
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stealth/ox-alpha",
"messages": [
{"role": "user", "content": "用两句话解释什么是单元测试。"}
]
}'运行环境:macOS / Linux 终端,或 Windows 的 curl.exe。不需要安装任何 SDK。
第三步:用 Python SDK 接入项目
如果你已经有用 OpenAI SDK 的项目,改动量极小——把 base_url 指向 OpenRouter,模型名换成 stealth/ox-alpha:
# 运行环境:Python 3.10+,pip install openai
import os
from openai import OpenAI
client = OpenAI(
base_url="https://openrouter.ai/api/v1",
api_key=os.environ.get("OPENROUTER_API_KEY"),
)
response = client.chat.completions.create(
model="stealth/ox-alpha",
messages=[
{"role": "user", "content": "阅读这段 TypeScript,找出一个可能的空值错误,给出最小修复方案。"}
],
)
print(response.choices[0].message.content)想要流式输出?加 "stream": True 就行。OpenRouter 还支持 Anthropic Messages API 格式和 Responses API 格式,三种接口都能调 Ox Alpha。
1M 上下文怎么测才有参考价值
1M token 听起来像”整个仓库都能塞进去”,但容量和效果是两码事。模型能接收很多材料,不代表它一定找得到关键的那几行。
我建议分三轮测,而不是一上来就甩整个代码库:
第一轮:跨文件定位。 准备 3-5 个有关联的文件——一个接口定义、一个实现文件、一个报错日志。让模型回答:错误最可能在哪个文件,依据是什么。重点不是猜没猜中,而是能不能给出文件名、代码位置和可验证的方法。
第二轮:小范围修改。 在同一批文件上,让它只提交最小修复方案,列出会改动的文件,等确认后再输出补丁。别让它一次重构全部代码。
第三轮:长材料检索。 逐步加入 README、设计文档、旧日志。问题要能被材料直接验证,比如”文档规定的重试次数是多少,代码是否遵守了”。如果模型开始引用不存在的文件或混淆版本,说明不是继续加材料的时机,而是该先整理输入。
多模态:先从截图开始
模型页说 Ox Alpha 支持文本、图片、视频输入。对编程任务来说,最实用的起点不是把长视频扔进去,而是给一张脱敏截图配明确任务。
比如:上传一个布局有问题的页面截图,附上对应的 HTML/CSS 片段,要求它指出截图中可见的问题,只建议必要的样式改动。结果可以肉眼核对,输入也比整段录屏更容易控制。
社区里已经有人把它接进 Hermes Agent,让模型根据画面操作《青蛙过河》小游戏。还有人用它做了个”我的世界风格的双转子涡轮喷气发动机”。这些折腾说明多模态确实跑得起来,但生产场景里还是建议从简单截图测试开始。
隐私红线:免费不等于零成本
这是我认为最需要讲清楚的一点。
OpenRouter 的 Ox Alpha 模型页明确写着:“Prompts and completions are retained by the provider and are not used for training.”
注意措辞——”retained”(保留)和”not used for training”(不用于训练)是两件事。提示词和输出会被匿名提供方存下来,只是承诺不拿来训练。但对公司代码、客户资料、密钥来说,”被保留”本身就已经越线了。
相比之下,OpenCode Zen 的文档写的是”零数据留存”。两个入口的数据政策不一样,使用前看清楚。
我的建议:
– 公开仓库的小模块、自己写的示例代码、已脱敏的报错日志 → 放心试
– API Key、生产数据库连接串、客户名单、未公开的业务逻辑、整份私有仓库 → 一个都别往里塞
– 涉及用户数据的后台截图 → 先打码
这不是因为 Ox Alpha 有什么特殊风险。任何来源不透明、仍在预览期的模型,都应该这样接入。
跑分要冷静看
社区传播最广的”80% DeepSWE 通过率”来自一个 10 题的用户测试,不是审计过的排行榜成绩。完整的 DeepSWE v1.1 有 113 道题。10 题的方差极大。
Ben Davis 本人也在帖子里提醒了这是高方差小样本。截至 8 月 21 日,DeepSWE 公共排行榜上还没有 Ox Alpha 的条目。
合理的理解方式:Ox Alpha 在编程任务上达到了前沿区间(frontier band),但不代表它确定性地超过 GPT-5.6。这跟 GPT-5.6 三档模型选型和 Claude Sonnet 5 是同一档位的竞争关系,谁赢谁输取决于具体任务。
横向对比:值不值得切换
| 维度 | Ox Alpha | GPT-5.6 Sol | Claude Sonnet 5 | DeepSeek V4-Flash |
|---|---|---|---|---|
| 上下文 | 1M | ~1M | 1M | 1M |
| 多模态 | 文+图+视频 | 文+图+视频 | 文+图 | 文 |
| 价格(预览期) | 免费 | $4/$20(降价后) | $3/$15 | ¥1.5/¥4.5 |
| 提供方身份 | 匿名 | OpenAI | Anthropic | DeepSeek |
| 数据留存 | 提供方保留 | OpenAI 政策 | Anthropic 政策 | DeepSeek 政策 |
| 编程跑分 | 前沿区间(小样本) | 前沿 | 前沿 | 前沿(Agent 能力强) |
| 适合场景 | 试验/评估 | 生产/长链 Agent | 日常编程 | 低成本批量 |
参考来源:OpenRouter Ox Alpha 模型页、Build Fast with AI 8/22-23 周报、The Geek Insights 技术解析。
什么时候不该用 Ox Alpha
这几个场景我建议绕开:
- 生产环境的核心服务。 匿名提供方、预览状态、随时可能下线或收费。拿来跑测试可以,拿来跑线上 Agent 不行。
- 需要输入公司代码或客户数据。 数据留存政策不允许。
- 对延迟敏感的实时场景。 P50 延迟 4.53 秒,P99 高达 70.89 秒。25 tokens/秒的吞吐在推理模型里不算快。实时对话或高频调用场景会卡。
- 需要稳定 SLA 的企业部署。 99.99% 的可用性数字好看,但”匿名预览模型”这五个字本身就不构成 SLA。
适合的场景是:评估和实验。用你的真实小任务跑一轮,跟当前主力模型做 A/B 对比,得出自己的结论。这比任何排名截图都有用。
如果你已经在用 DeepSeek Harness 或 Claude Code,Ox Alpha 在 OpenRouter 上已经可以作为模型选项直接切换——DeepSeek Harness 是调用方前三名之一,说明集成已经跑通。
接入 Claude Code 的方法
Claude Code 支持 OpenRouter 作为模型提供方。设置环境变量后启动:
export ANTHROPIC_BASE_URL=https://openrouter.ai/api/v1
export ANTHROPIC_API_KEY=$OPENROUTER_API_KEY
export CLAUDE_MODEL=stealth/ox-alpha
claude这样 Claude Code 的所有编程能力(读代码库、改文件、跑测试)都会走 Ox Alpha。但注意——你的代码库内容会经过 OpenRouter 转发给匿名提供方。先用公开仓库或非敏感项目试。
Ox Alpha 值得试,原因很简单:免费、1M 上下文、面向 Agent,这三个条件凑在一起,用真实小任务验证一下它到底行不行,成本几乎为零。
但它不是可以替代生产模型的默认选项。匿名提供方、预览状态、数据保留条款,决定了测试时应当更克制。
从一条短 API 请求开始。模型能稳定完成跨文件定位、小范围修改和截图对照,再考虑接进日常工作流。这样得到的结论,比任何跑分截图都靠谱。
如果 Ben Davis 的判断是对的——这确实是智谱 GLM-5.x 的隐身公测——那它的意义不只是”又一个免费模型”,而是国产旗舰模型正在用一种新方式做公开验证:不开发布会,先让你跑。这跟 AI 工具实战指南里讲的”先用起来再说”是同一个思路。
本文基于 2026 年 8 月 23 日的公开信息撰写。Ox Alpha 仍处于免费预览期,但预览窗口可能随时关闭。建议读者在阅读后尽快测试。
发表回复