Jev 决策模型上手:不生成文字的 AI、输出还免费,上线 48 小时被开源圈复刻了 6 次

过去一周 AI 圈最有意思的事,不是哪个大模型又涨了 1 分,而是一家叫 TypeSafe 的公司发布了一个「一个字都不会写」的模型。9 月 15 日出 stealth、带着 DCVC 领投的 4000 万美元种子轮,9 月 18 日上架 OpenRouter,紧接着开源圈在两天内复刻出 6 个同类模型。它叫 Jev,定价 $0.042/百万输入 token,输出直接免费——因为压根没有输出可计费。

如果你写的程序里有一堆「这条工单转给谁」「这条评论是不是垃圾」「这个结果要不要人工复核」的判断,那你大概率一直在用大模型干一件很贵的事:生成一大段文字,再解析成 JSON。Jev 的思路是把这件事拆出来单独做一个模型品类。这篇文章把它拆开讲清楚:是什么、怎么调、哪些场景值得换、哪些千万别换,以及 6 个开源复刻里哪个值得你本地试试。

一、Jev 是什么:把 AI 调用从「写作文」变「做判断」

TypeSafe 在官方文档里给这类模型起了个名字:System One,取自卡尼曼《思考,快与慢》里的系统 1——快、直觉、不解释。和 LLM 的区别就一句话:Jev 理解自然语言,但只返回类型化的答案和概率,不生成文本、不写代码、不给理由。

你给它一段「状态」(一段文字、一个 JSON 对象或一个数组),再定义好问题,它并行评估后返回三种原语:

原语问的问题示例输出
Choice从你定义的选项里挑一个choice: "billing" + 各选项概率
Score在你定义的有序量表上打位置score: 1.4(0=平静,2=愤怒)
Noul是/否判断的概率noul: 0.95

两个容易被忽略的官方限定:一是校准是组级的——它的概率按预测组别对照真实结果优化过,但不保证任何单次回答正确,所以阈值和兜底得自己写;二是目前只吃文本,图像音频视频都不支持。上下文 32K,这是硬限制(注:个别第三方报道称 64K,以 OpenRouter 模型页的 32K 为准,我以两个页面交叉核对过)。

二、价格拆解:为什么输出敢免费

LLM 按生成 token 计费,Jev 不生成 token——它直接读候选答案位置的 logits 出结果,返回的就是几个字节的结构化数据。所以它的账单结构是「输入 $0.042/M、输出 $0」。按 The Register 的算法,输入单价比 Claude Fable 5.1 便宜 238 倍。

那 100 万次调用到底差多少钱?我实际运行了一个成本估算脚本(定价取自各模型 2026 年 9 月 19 日的公开报价,按每次 600 输入 token + 60 输出 token 的典型分类调用算):

Python
# 环境:Python 3.10+,无第三方依赖
# 按 betonai 口径估算 100 万次分类决策的成本(每次 600 输入 + 60 输出 token)
prices = {
    "Jev 1.13 ($0.042/$0)": (0.042, 0.0),
    "gpt-oss-20b ($0.03/$0.13)": (0.03, 0.13),
    "GPT-5 mini ($0.25/$2.00)": (0.25, 2.00),
    "Gemini 3.8 Flash ($0.75/$3.75)": (0.75, 3.75),
    "Claude Haiku 4.5 ($1/$5)": (1.0, 5.0),
}
CALLS, IN_TOK, OUT_TOK = 1_000_000, 600, 60
for name, (pin, pout) in prices.items():
    cost = CALLS * (IN_TOK * pin + OUT_TOK * pout) / 1_000_000
    print(f"{name:38s} -> ${cost:,.2f}")

我在本机(macOS,Python 3.13)跑出来的结果:

Plaintext
Jev 1.13 ($0.042/$0)                   -> $25.20
gpt-oss-20b ($0.03/$0.13)              -> $25.80
GPT-5 mini ($0.25/$2.00)               -> $270.00
Gemini 3.8 Flash ($0.75/$3.75)         -> $675.00
Claude Haiku 4.5 ($1/$5)               -> $900.00

Jev 和开源的 gpt-oss-20b 托管价几乎打平,比主流小模型便宜一到两个数量级。延迟方面,OpenRouter 实测 P50 0.23 秒、3 天 uptime 99.99%;TypeSafe 官网那组「193.6 倍快、444.6 倍省」是拿自家工作流测的,第三方 Every 的独立测试在一个提取任务上测出约 25 倍快、580 倍省——两边数字差异很大,说明这类倍数高度依赖 workload,别直接抄进方案文档。

三、怎么调:第一个坑就在端点上

这是本文最值的踩坑提醒:Jev 不走 chat completions 端点,你现在用的所有 OpenAI 兼容 SDK 拿来就调会直接失败。OpenRouter 给它开的是专用端点 POST /api/alpha/decisions,TypeSafe 直连则是 POST /v1/systemone(直连目前要排队 waitlist,所以 OpenRouter 是现在最快的入口,充值有 5.5% 手续费,实际单价约 $0.044/M)。

一次请求可以并行塞多个问题,官方 quickstart 的工单路由场景长这样:

Bash
# 环境:任意带 curl 的终端(macOS/Linux),需要 OpenRouter API Key
export OPENROUTER_API_KEY="sk-or-v1-xxxx"

curl https://openrouter.ai/api/alpha/decisions \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "typesafe/jev-latest",
    "state": "Help! My payouts have been failing for 3 days.",
    "questions": {
      "is_urgent": {
        "type": "noul",
        "instructions": "Does this message convey urgency?",
        "criteria": { "true": "Explicitly time-sensitive", "false": "No urgency expressed" }
      },
      "department": {
        "type": "choice",
        "instructions": "Which team should handle this?",
        "criteria": {
          "billing": "Payments, invoicing, refunds",
          "technical": "Bugs, outages, integrations",
          "sales": "Pricing, upgrades, new accounts"
        }
      },
      "frustration": {
        "type": "score",
        "instructions": "How frustrated is the customer?",
        "criteria": ["Calm", "Frustrated", "Very angry"]
      }
    }
  }'

Python 版(请求结构按官方示例编写,字段命名以你的实际返回为准):

Python
# 环境:Python 3.10+,pip install requests;需设置 OPENROUTER_API_KEY 环境变量
import os, requests

resp = requests.post(
    "https://openrouter.ai/api/alpha/decisions",
    headers={"Authorization": f"Bearer {os.environ['OPENROUTER_API_KEY']}"},
    json={
        "model": "typesafe/jev-1.13",
        "state": "用户反馈:提现失败三天了,客服电话也没人接。",
        "questions": {
            "route": {
                "type": "choice",
                "instructions": "这条消息应该转给哪个团队?",
                "criteria": {
                    "billing": "支付、提现、退款",
                    "technical": "故障、集成问题",
                    "sales": "价格、升级、新账户",
                },
            },
            "angry": {
                "type": "score",
                "instructions": "用户情绪处于哪一级?",
                "criteria": ["平静", "不满", "愤怒"],
            },
        },
    },
    timeout=10,
)
print(resp.json())

拿到结果后,阈值逻辑回到普通代码里写,比如命中 billing 且愤怒分高于 1.5 就升级人工。slug 用 typesafe/jev-1.13 锁定版本,或用别名 ~typesafe/jev-latest 永远跟最新。

四、哪些调用值得换,哪些千万别换

结合这一周社区里跑出来的真实案例(LangChain 作者评价 browser use 场景是目前最好的 Jev 应用、Cline 出了插件、Braintrust 接入后评分成本降了约 400 倍),我把「值不值得换」归成三档:

值得换:意图路由、工单分类、LLM-as-judge 的评分环节、内容风控的初筛、agent 循环里「要不要再调一次工具」「任务是否完成」这类判断。共同点是:问题边界清晰、答案空间你定义得出、不需要模型解释自己。如果你已经在用 agent 框架,Jev 补的正是 harness 内部的 if-else 层——之前写Codex HarnessOpenAI Agents API时提过,编排循环里最烧钱的往往不是产出,而是频繁的判断调用。

别换:需要向用户输出文字的一切场景;状态超过 32K 的场景;答案空间定义不出来的开放推理。还有一个我特别想劝退的:别用它替代你还没想清楚的业务规则。类型化输出会让一个模糊的标准看起来很精确——你写不出「什么样的订单该复核」的标准,Jev 不会替你想出来,它只会给你一个看起来很确定的概率。先写标准,再上模型。

先别急着换,用影子模式试:让 Jev 跟着现有规则跑一两周,只记录不动手,对比误报率、延迟和成本,再决定哪些分支切过去。这是上线这类判别式组件最稳的路径。

价格敏感的朋友可以对照着看:Fable 5.1 靠缓存降价省的是「重复前缀」的钱,DeepSeek V4.1 Flash 走的是便宜生成路线,混元 Hy4 走的是开源权重自部署。它们都在「生成」这个赛道里卷性价比,Jev 干脆换了个赛道——高频判断直接不生成了。四条路线不冲突,一个系统里往往同时用。

五、48 小时被复刻 6 次:这个品类没有护城河,但有个好用的开源版

Jev 发布后最戏剧性的一幕:两天之内,开源圈至少交出 6 个复刻(完整盘点)。其中最认真的是 Bespoke Labs 的 Nimble:拿 Qwen3.5-9B 做 LoRA 微调,只用了 2676 条合成样本、两天时间,在一个 324 样本的内部评测集上把准确率从基座的 66% 拉到 90.12%(Jev 同套题 93.21%),H100 上单次判断 100 毫秒(生态综述汇总了各方原始推文,可自行溯源)。

它的诀窍叫「对比式数据策展」:不标注概率,而是把事实轻微篡改生成负样本,逼模型学会区分关键证据——大部分提升来自这一步的数据清洗而不是训练技巧。Bespoke 强调没蒸馏 Jev,但前 Zapier 工程师 @suchenzang 当场评论「恭喜,不过你们已经违反 ToU 了」,这桩公案没有定论,二手报道都在引用双方原话,我也无法核实训练数据的具体来源,读的时候保留一分怀疑。

6 个复刻的定位差异很大,挑两个实用的:Nimble 胜在全套开放(数据+模型+配方)且数字具体;Kev-0.5B 胜在小,Qwen2.5-0.5B 底子,目标是 MacBook Pro 本地跑。这件事本身比任何单个模型都说明问题:「快速类型化判断」是软件的真实架构需求,做出来不难,难的是 TypeSafe 花了三年打磨校准质量——这也是我认为该品类里「数字好看」和「生产可用」之间最大的缝隙。

六、踩坑清单

  1. 端点不同/api/alpha/decisions(OpenRouter)或 /v1/systemone(直连),不是 chat completions,OpenAI 兼容 SDK 直接调会失败。
  2. 上下文 32K:塞不进长文档,大状态先做摘要或分片。
  3. 组级校准 ≠ 单次正确:阈值兜底和人工升级通道必须写。
  4. 没有标准 benchmark:这个品类连评测集都不统一,90% 和 93% 之差别太当真,用自己的数据跑影子模式才有意义。
  5. 官方倍数是营销口径:193.6 倍快出自 TypeSafe 自建工作流,独立测试是 25 倍量级,引用时注明出处。
  6. 直连要 waitlist:想现在就试,走 OpenRouter(记得 5.5% 充值手续费)或 Venice 免费 beta。

我的判断:Jev 不是来替代大模型的,它是给所有「用大模型当 if-else」的代码一个便宜一到两个数量级的选项。如果你的业务里有每天上万次的分类和路由调用,这一周的窗口期值得把影子模式跑起来;如果只是偶尔判断一次,成本差异无感,继续用现有模型就好。等中文状态下的实测样本多一点,我会把不同语言输入的表现差异补充到这篇里。

推荐阅读

  • Qwen3.8-Omni-Flash 上手指南:音频输入降到 8 毛一百万 token,1 小时录音视频直接扔给 API

    阿里千问发布全模态模型 Qwen3.8-Omni-Flash:文本、图片、音频、视频四输入,1M 上下文,一小时连续音视频直接进 API,音频输入从每百万 token 18 元降到 0.8 元。本教程…

  • Gemini 3.8 Live 上手:语音 Agent 能边聊边干活,还比 GPT-Live-1 便宜 40%

    Gemini 3.8 Live 与 Extended Thinking 已上线 Gemini API 和 AI Studio,语音模型能边说话边后台执行工具,基准超 GPT-Live-1 且每小时 3…

  • OpenAI Agents API 公测上手:把 Codex 底层框架变成 10 行代码就能跑的云 Agent

    OpenAI 9 月 10 日开放 Agents API 公测,把 Codex 底层 agent 框架(会话持久化、上下文压缩、子代理并行、MCP 工具)做成托管 API,无平台费。本文带你 5 分钟…

  • GPT-Image-2.5 API 上手指南:Flare 与 Sunburst 双模型怎么选,图像生成定价翻倍的性价比真相

    OpenAI GPT-Image-2.5 图像生成 API 上手指南:Flare 速度型与 Sunburst 精度型双模型怎么选、六档质量参数如何影响成本、定价较上代翻倍后还值不值得用。整理 Pyth…