过去一周 AI 圈最有意思的事,不是哪个大模型又涨了 1 分,而是一家叫 TypeSafe 的公司发布了一个「一个字都不会写」的模型。9 月 15 日出 stealth、带着 DCVC 领投的 4000 万美元种子轮,9 月 18 日上架 OpenRouter,紧接着开源圈在两天内复刻出 6 个同类模型。它叫 Jev,定价 $0.042/百万输入 token,输出直接免费——因为压根没有输出可计费。
如果你写的程序里有一堆「这条工单转给谁」「这条评论是不是垃圾」「这个结果要不要人工复核」的判断,那你大概率一直在用大模型干一件很贵的事:生成一大段文字,再解析成 JSON。Jev 的思路是把这件事拆出来单独做一个模型品类。这篇文章把它拆开讲清楚:是什么、怎么调、哪些场景值得换、哪些千万别换,以及 6 个开源复刻里哪个值得你本地试试。
一、Jev 是什么:把 AI 调用从「写作文」变「做判断」
TypeSafe 在官方文档里给这类模型起了个名字:System One,取自卡尼曼《思考,快与慢》里的系统 1——快、直觉、不解释。和 LLM 的区别就一句话:Jev 理解自然语言,但只返回类型化的答案和概率,不生成文本、不写代码、不给理由。
你给它一段「状态」(一段文字、一个 JSON 对象或一个数组),再定义好问题,它并行评估后返回三种原语:
| 原语 | 问的问题 | 示例输出 |
|---|---|---|
| Choice | 从你定义的选项里挑一个 | choice: "billing" + 各选项概率 |
| Score | 在你定义的有序量表上打位置 | score: 1.4(0=平静,2=愤怒) |
| Noul | 是/否判断的概率 | noul: 0.95 |
两个容易被忽略的官方限定:一是校准是组级的——它的概率按预测组别对照真实结果优化过,但不保证任何单次回答正确,所以阈值和兜底得自己写;二是目前只吃文本,图像音频视频都不支持。上下文 32K,这是硬限制(注:个别第三方报道称 64K,以 OpenRouter 模型页的 32K 为准,我以两个页面交叉核对过)。
二、价格拆解:为什么输出敢免费
LLM 按生成 token 计费,Jev 不生成 token——它直接读候选答案位置的 logits 出结果,返回的就是几个字节的结构化数据。所以它的账单结构是「输入 $0.042/M、输出 $0」。按 The Register 的算法,输入单价比 Claude Fable 5.1 便宜 238 倍。
那 100 万次调用到底差多少钱?我实际运行了一个成本估算脚本(定价取自各模型 2026 年 9 月 19 日的公开报价,按每次 600 输入 token + 60 输出 token 的典型分类调用算):
# 环境:Python 3.10+,无第三方依赖
# 按 betonai 口径估算 100 万次分类决策的成本(每次 600 输入 + 60 输出 token)
prices = {
"Jev 1.13 ($0.042/$0)": (0.042, 0.0),
"gpt-oss-20b ($0.03/$0.13)": (0.03, 0.13),
"GPT-5 mini ($0.25/$2.00)": (0.25, 2.00),
"Gemini 3.8 Flash ($0.75/$3.75)": (0.75, 3.75),
"Claude Haiku 4.5 ($1/$5)": (1.0, 5.0),
}
CALLS, IN_TOK, OUT_TOK = 1_000_000, 600, 60
for name, (pin, pout) in prices.items():
cost = CALLS * (IN_TOK * pin + OUT_TOK * pout) / 1_000_000
print(f"{name:38s} -> ${cost:,.2f}")我在本机(macOS,Python 3.13)跑出来的结果:
Jev 1.13 ($0.042/$0) -> $25.20
gpt-oss-20b ($0.03/$0.13) -> $25.80
GPT-5 mini ($0.25/$2.00) -> $270.00
Gemini 3.8 Flash ($0.75/$3.75) -> $675.00
Claude Haiku 4.5 ($1/$5) -> $900.00Jev 和开源的 gpt-oss-20b 托管价几乎打平,比主流小模型便宜一到两个数量级。延迟方面,OpenRouter 实测 P50 0.23 秒、3 天 uptime 99.99%;TypeSafe 官网那组「193.6 倍快、444.6 倍省」是拿自家工作流测的,第三方 Every 的独立测试在一个提取任务上测出约 25 倍快、580 倍省——两边数字差异很大,说明这类倍数高度依赖 workload,别直接抄进方案文档。
三、怎么调:第一个坑就在端点上
这是本文最值的踩坑提醒:Jev 不走 chat completions 端点,你现在用的所有 OpenAI 兼容 SDK 拿来就调会直接失败。OpenRouter 给它开的是专用端点 POST /api/alpha/decisions,TypeSafe 直连则是 POST /v1/systemone(直连目前要排队 waitlist,所以 OpenRouter 是现在最快的入口,充值有 5.5% 手续费,实际单价约 $0.044/M)。
一次请求可以并行塞多个问题,官方 quickstart 的工单路由场景长这样:
# 环境:任意带 curl 的终端(macOS/Linux),需要 OpenRouter API Key
export OPENROUTER_API_KEY="sk-or-v1-xxxx"
curl https://openrouter.ai/api/alpha/decisions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "typesafe/jev-latest",
"state": "Help! My payouts have been failing for 3 days.",
"questions": {
"is_urgent": {
"type": "noul",
"instructions": "Does this message convey urgency?",
"criteria": { "true": "Explicitly time-sensitive", "false": "No urgency expressed" }
},
"department": {
"type": "choice",
"instructions": "Which team should handle this?",
"criteria": {
"billing": "Payments, invoicing, refunds",
"technical": "Bugs, outages, integrations",
"sales": "Pricing, upgrades, new accounts"
}
},
"frustration": {
"type": "score",
"instructions": "How frustrated is the customer?",
"criteria": ["Calm", "Frustrated", "Very angry"]
}
}
}'Python 版(请求结构按官方示例编写,字段命名以你的实际返回为准):
# 环境:Python 3.10+,pip install requests;需设置 OPENROUTER_API_KEY 环境变量
import os, requests
resp = requests.post(
"https://openrouter.ai/api/alpha/decisions",
headers={"Authorization": f"Bearer {os.environ['OPENROUTER_API_KEY']}"},
json={
"model": "typesafe/jev-1.13",
"state": "用户反馈:提现失败三天了,客服电话也没人接。",
"questions": {
"route": {
"type": "choice",
"instructions": "这条消息应该转给哪个团队?",
"criteria": {
"billing": "支付、提现、退款",
"technical": "故障、集成问题",
"sales": "价格、升级、新账户",
},
},
"angry": {
"type": "score",
"instructions": "用户情绪处于哪一级?",
"criteria": ["平静", "不满", "愤怒"],
},
},
},
timeout=10,
)
print(resp.json())拿到结果后,阈值逻辑回到普通代码里写,比如命中 billing 且愤怒分高于 1.5 就升级人工。slug 用 typesafe/jev-1.13 锁定版本,或用别名 ~typesafe/jev-latest 永远跟最新。
四、哪些调用值得换,哪些千万别换
结合这一周社区里跑出来的真实案例(LangChain 作者评价 browser use 场景是目前最好的 Jev 应用、Cline 出了插件、Braintrust 接入后评分成本降了约 400 倍),我把「值不值得换」归成三档:
值得换:意图路由、工单分类、LLM-as-judge 的评分环节、内容风控的初筛、agent 循环里「要不要再调一次工具」「任务是否完成」这类判断。共同点是:问题边界清晰、答案空间你定义得出、不需要模型解释自己。如果你已经在用 agent 框架,Jev 补的正是 harness 内部的 if-else 层——之前写Codex Harness和OpenAI Agents API时提过,编排循环里最烧钱的往往不是产出,而是频繁的判断调用。
别换:需要向用户输出文字的一切场景;状态超过 32K 的场景;答案空间定义不出来的开放推理。还有一个我特别想劝退的:别用它替代你还没想清楚的业务规则。类型化输出会让一个模糊的标准看起来很精确——你写不出「什么样的订单该复核」的标准,Jev 不会替你想出来,它只会给你一个看起来很确定的概率。先写标准,再上模型。
先别急着换,用影子模式试:让 Jev 跟着现有规则跑一两周,只记录不动手,对比误报率、延迟和成本,再决定哪些分支切过去。这是上线这类判别式组件最稳的路径。
价格敏感的朋友可以对照着看:Fable 5.1 靠缓存降价省的是「重复前缀」的钱,DeepSeek V4.1 Flash 走的是便宜生成路线,混元 Hy4 走的是开源权重自部署。它们都在「生成」这个赛道里卷性价比,Jev 干脆换了个赛道——高频判断直接不生成了。四条路线不冲突,一个系统里往往同时用。
五、48 小时被复刻 6 次:这个品类没有护城河,但有个好用的开源版
Jev 发布后最戏剧性的一幕:两天之内,开源圈至少交出 6 个复刻(完整盘点)。其中最认真的是 Bespoke Labs 的 Nimble:拿 Qwen3.5-9B 做 LoRA 微调,只用了 2676 条合成样本、两天时间,在一个 324 样本的内部评测集上把准确率从基座的 66% 拉到 90.12%(Jev 同套题 93.21%),H100 上单次判断 100 毫秒(生态综述汇总了各方原始推文,可自行溯源)。
它的诀窍叫「对比式数据策展」:不标注概率,而是把事实轻微篡改生成负样本,逼模型学会区分关键证据——大部分提升来自这一步的数据清洗而不是训练技巧。Bespoke 强调没蒸馏 Jev,但前 Zapier 工程师 @suchenzang 当场评论「恭喜,不过你们已经违反 ToU 了」,这桩公案没有定论,二手报道都在引用双方原话,我也无法核实训练数据的具体来源,读的时候保留一分怀疑。
6 个复刻的定位差异很大,挑两个实用的:Nimble 胜在全套开放(数据+模型+配方)且数字具体;Kev-0.5B 胜在小,Qwen2.5-0.5B 底子,目标是 MacBook Pro 本地跑。这件事本身比任何单个模型都说明问题:「快速类型化判断」是软件的真实架构需求,做出来不难,难的是 TypeSafe 花了三年打磨校准质量——这也是我认为该品类里「数字好看」和「生产可用」之间最大的缝隙。
六、踩坑清单
- 端点不同:
/api/alpha/decisions(OpenRouter)或/v1/systemone(直连),不是 chat completions,OpenAI 兼容 SDK 直接调会失败。 - 上下文 32K:塞不进长文档,大状态先做摘要或分片。
- 组级校准 ≠ 单次正确:阈值兜底和人工升级通道必须写。
- 没有标准 benchmark:这个品类连评测集都不统一,90% 和 93% 之差别太当真,用自己的数据跑影子模式才有意义。
- 官方倍数是营销口径:193.6 倍快出自 TypeSafe 自建工作流,独立测试是 25 倍量级,引用时注明出处。
- 直连要 waitlist:想现在就试,走 OpenRouter(记得 5.5% 充值手续费)或 Venice 免费 beta。
我的判断:Jev 不是来替代大模型的,它是给所有「用大模型当 if-else」的代码一个便宜一到两个数量级的选项。如果你的业务里有每天上万次的分类和路由调用,这一周的窗口期值得把影子模式跑起来;如果只是偶尔判断一次,成本差异无感,继续用现有模型就好。等中文状态下的实测样本多一点,我会把不同语言输入的表现差异补充到这篇里。