OpenRouter 上冒出一个不署名的前沿模型:Ox Alpha 免费试,三步跑通 API 调用

8 月 20 日,OpenRouter 上多了一个模型,没有发布会,没有官方博客,连开发者名字都没署。它叫 stealth/ox-alpha,上线三天就被开发者塞了 3.71 万亿 token 的提示词进去。

社区里有人让它跑了 10 道 DeepSWE 编程题,通过率 80%,排在 Claude(65%)和 GPT-5.6 Sol(52%)前面。一个不花钱、不署名、百万上下文、还能看图看视频的模型——这谁忍得住不试。

我花了半天时间研究它的来龙去脉、跑了基础 API 验证,这篇文章记录完整过程。核心结论先放这里:可以试,但别急着把公司代码往里塞。

Ox Alpha 到底是什么

OpenRouter 模型页显示的公开信息:

项目数值
模型 IDstealth/ox-alpha
上下文窗口1,048,576 tokens(1M)
最大输出131,072 tokens
输入模态文本 + 图片 + 视频
预览定价$0(输入/输出/缓存读取全免费)
吞吐量25 tokens/秒
P50 延迟4.53 秒
3 天可用性99.99%
缓存命中率82.92%

“stealth”的意思是隐身发布——OpenRouter 只负责路由请求,不开发、不拥有这个模型。真正的提供方是匿名的。

那么谁做的?独立研究者 Ben Davis 做了一组技术分析,根据 tokenizer 对齐方式和视频编码器 token 消耗模式,他 99% 确信这是智谱(Zhipu)GLM-5.x 系列的未发布旗舰。智谱此前确实有过通过隐身渠道做公开测试的先例。但智谱没有官方确认,所以这条线目前只能算”高度怀疑”,不能当结论用。

不管谁做的,它现在免费、现在能用、跑分在线——这对开发者来说就够了。

三步跑通 API 调用

第一步:拿到 OpenRouter API Key

OpenRouter 设置页 创建一个 API Key。如果你之前读过我的OpenRouter 全球调用榜那篇文章,可能已经有账号了。

Key 只放在本机环境变量里,别写进代码,别提交到 Git:

Bash
# macOS / Linux
export OPENROUTER_API_KEY=sk-or-v1-你的key

# Windows PowerShell(当前窗口有效)
$env:OPENROUTER_API_KEY = "sk-or-v1-你的key"

第二步:发一条最小请求确认模型可用

别一上来就接 Claude Code 或复杂 Agent。先发一条短请求,确认账户、Key、模型名和网络都没问题。OpenRouter 的接口跟 OpenAI Chat Completions 完全兼容:

Bash
curl https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stealth/ox-alpha",
    "messages": [
      {"role": "user", "content": "用两句话解释什么是单元测试。"}
    ]
  }'

运行环境:macOS / Linux 终端,或 Windows 的 curl.exe。不需要安装任何 SDK。

第三步:用 Python SDK 接入项目

如果你已经有用 OpenAI SDK 的项目,改动量极小——把 base_url 指向 OpenRouter,模型名换成 stealth/ox-alpha

Python
# 运行环境:Python 3.10+,pip install openai
import os
from openai import OpenAI

client = OpenAI(
    base_url="https://openrouter.ai/api/v1",
    api_key=os.environ.get("OPENROUTER_API_KEY"),
)

response = client.chat.completions.create(
    model="stealth/ox-alpha",
    messages=[
        {"role": "user", "content": "阅读这段 TypeScript,找出一个可能的空值错误,给出最小修复方案。"}
    ],
)

print(response.choices[0].message.content)

想要流式输出?加 "stream": True 就行。OpenRouter 还支持 Anthropic Messages API 格式和 Responses API 格式,三种接口都能调 Ox Alpha。

1M 上下文怎么测才有参考价值

1M token 听起来像”整个仓库都能塞进去”,但容量和效果是两码事。模型能接收很多材料,不代表它一定找得到关键的那几行。

我建议分三轮测,而不是一上来就甩整个代码库:

第一轮:跨文件定位。 准备 3-5 个有关联的文件——一个接口定义、一个实现文件、一个报错日志。让模型回答:错误最可能在哪个文件,依据是什么。重点不是猜没猜中,而是能不能给出文件名、代码位置和可验证的方法。

第二轮:小范围修改。 在同一批文件上,让它只提交最小修复方案,列出会改动的文件,等确认后再输出补丁。别让它一次重构全部代码。

第三轮:长材料检索。 逐步加入 README、设计文档、旧日志。问题要能被材料直接验证,比如”文档规定的重试次数是多少,代码是否遵守了”。如果模型开始引用不存在的文件或混淆版本,说明不是继续加材料的时机,而是该先整理输入。

多模态:先从截图开始

模型页说 Ox Alpha 支持文本、图片、视频输入。对编程任务来说,最实用的起点不是把长视频扔进去,而是给一张脱敏截图配明确任务。

比如:上传一个布局有问题的页面截图,附上对应的 HTML/CSS 片段,要求它指出截图中可见的问题,只建议必要的样式改动。结果可以肉眼核对,输入也比整段录屏更容易控制。

社区里已经有人把它接进 Hermes Agent,让模型根据画面操作《青蛙过河》小游戏。还有人用它做了个”我的世界风格的双转子涡轮喷气发动机”。这些折腾说明多模态确实跑得起来,但生产场景里还是建议从简单截图测试开始。

隐私红线:免费不等于零成本

这是我认为最需要讲清楚的一点。

OpenRouter 的 Ox Alpha 模型页明确写着:“Prompts and completions are retained by the provider and are not used for training.”

注意措辞——”retained”(保留)和”not used for training”(不用于训练)是两件事。提示词和输出会被匿名提供方存下来,只是承诺不拿来训练。但对公司代码、客户资料、密钥来说,”被保留”本身就已经越线了。

相比之下,OpenCode Zen 的文档写的是”零数据留存”。两个入口的数据政策不一样,使用前看清楚。

我的建议:
– 公开仓库的小模块、自己写的示例代码、已脱敏的报错日志 → 放心试
– API Key、生产数据库连接串、客户名单、未公开的业务逻辑、整份私有仓库 → 一个都别往里塞
– 涉及用户数据的后台截图 → 先打码

这不是因为 Ox Alpha 有什么特殊风险。任何来源不透明、仍在预览期的模型,都应该这样接入。

跑分要冷静看

社区传播最广的”80% DeepSWE 通过率”来自一个 10 题的用户测试,不是审计过的排行榜成绩。完整的 DeepSWE v1.1 有 113 道题。10 题的方差极大。

Ben Davis 本人也在帖子里提醒了这是高方差小样本。截至 8 月 21 日,DeepSWE 公共排行榜上还没有 Ox Alpha 的条目。

合理的理解方式:Ox Alpha 在编程任务上达到了前沿区间(frontier band),但不代表它确定性地超过 GPT-5.6。这跟 GPT-5.6 三档模型选型Claude Sonnet 5 是同一档位的竞争关系,谁赢谁输取决于具体任务。

横向对比:值不值得切换

维度Ox AlphaGPT-5.6 SolClaude Sonnet 5DeepSeek V4-Flash
上下文1M~1M1M1M
多模态文+图+视频文+图+视频文+图
价格(预览期)免费$4/$20(降价后)$3/$15¥1.5/¥4.5
提供方身份匿名OpenAIAnthropicDeepSeek
数据留存提供方保留OpenAI 政策Anthropic 政策DeepSeek 政策
编程跑分前沿区间(小样本)前沿前沿前沿(Agent 能力强
适合场景试验/评估生产/长链 Agent日常编程低成本批量

参考来源:OpenRouter Ox Alpha 模型页Build Fast with AI 8/22-23 周报The Geek Insights 技术解析

什么时候不该用 Ox Alpha

这几个场景我建议绕开:

  1. 生产环境的核心服务。 匿名提供方、预览状态、随时可能下线或收费。拿来跑测试可以,拿来跑线上 Agent 不行。
  2. 需要输入公司代码或客户数据。 数据留存政策不允许。
  3. 对延迟敏感的实时场景。 P50 延迟 4.53 秒,P99 高达 70.89 秒。25 tokens/秒的吞吐在推理模型里不算快。实时对话或高频调用场景会卡。
  4. 需要稳定 SLA 的企业部署。 99.99% 的可用性数字好看,但”匿名预览模型”这五个字本身就不构成 SLA。

适合的场景是:评估和实验。用你的真实小任务跑一轮,跟当前主力模型做 A/B 对比,得出自己的结论。这比任何排名截图都有用。

如果你已经在用 DeepSeek Harness 或 Claude Code,Ox Alpha 在 OpenRouter 上已经可以作为模型选项直接切换——DeepSeek Harness 是调用方前三名之一,说明集成已经跑通。

接入 Claude Code 的方法

Claude Code 支持 OpenRouter 作为模型提供方。设置环境变量后启动:

Bash
export ANTHROPIC_BASE_URL=https://openrouter.ai/api/v1
export ANTHROPIC_API_KEY=$OPENROUTER_API_KEY
export CLAUDE_MODEL=stealth/ox-alpha

claude

这样 Claude Code 的所有编程能力(读代码库、改文件、跑测试)都会走 Ox Alpha。但注意——你的代码库内容会经过 OpenRouter 转发给匿名提供方。先用公开仓库或非敏感项目试。

Ox Alpha 值得试,原因很简单:免费、1M 上下文、面向 Agent,这三个条件凑在一起,用真实小任务验证一下它到底行不行,成本几乎为零。

但它不是可以替代生产模型的默认选项。匿名提供方、预览状态、数据保留条款,决定了测试时应当更克制。

从一条短 API 请求开始。模型能稳定完成跨文件定位、小范围修改和截图对照,再考虑接进日常工作流。这样得到的结论,比任何跑分截图都靠谱。

如果 Ben Davis 的判断是对的——这确实是智谱 GLM-5.x 的隐身公测——那它的意义不只是”又一个免费模型”,而是国产旗舰模型正在用一种新方式做公开验证:不开发布会,先让你跑。这跟 AI 工具实战指南里讲的”先用起来再说”是同一个思路。

本文基于 2026 年 8 月 23 日的公开信息撰写。Ox Alpha 仍处于免费预览期,但预览窗口可能随时关闭。建议读者在阅读后尽快测试。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

推荐阅读

  • OpenRouter 上冒出一个不署名的前沿模型:Ox Alpha 免费试,三步跑通 API 调用

    OpenRouter 上出现了一个匿名模型 Ox Alpha,1M 上下文、支持图文视频多模态输入、编程跑分超过 GPT-5.6。本文教你用 curl 和 Python 三步跑通 API 调用,附隐私…

  • Claude 现在能替你发邮件、管 Drive 了:Google Workspace 连接器实测与上手

    Claude 的 Google Workspace 连接器升级后,能直接发送 Gmail、回复邮件、管理 Drive 文件。本文实测开通流程、权限边界与 3 个真实办公场景,并提醒哪些操作不建议交给 …

  • 企业微信终于对 AI Agent 敞开大门了:CLI + MCP 全面开放,14 个办公模块一条命令调用

    企业微信 5.0.10 全面开放 CLI 和 MCP,WorkBuddy、DeepSeek Harness 等 AI Agent 可直接调用文档、表格、邮件、会议等 14 个办公模块。我实测安装了 @…

  • Mistral OCR 4.1 上手指南:把扫描件变成带坐标、带置信度的结构化文档

    Mistral OCR 4.1 上手指南:不只把扫描件转成文字,还能返回段落坐标、结构标签与块级置信度。附可直接运行的 Python 代码、RAG/发票/合同三大真实场景用法,以及与腾讯 HyOCR、…