Jev 被 25 行复刻、91 个系统追赶,护城河只剩校准数据
2026/09/26 20:15
Jev 上线 24 小时创下 AI Gateway 史上最快采用纪录,厂商报出 193.6 倍加速;第 10 天,25 行 Python 复刻其核心,JevBench 排进 91 个决策系统,Ollaya 把品类搬进本地。拆开厂商口径与复刻现实,决策依据落在校准曲线上:概率 0.9 是否真的对 90%。
Jev 上线当天,HN 帖拿到 1,981 分。Vercel 官宣 24 小时里 13% 的付费团队在用它,是 GPT-5.6 家族的两倍、Fable 5.1 的六倍,AI Gateway 历史上采用最快的模型(Vercel 官方博客)。TypeSafe 自己的口径更亮:比 frontier LLM 快 193.6 倍、便宜 444.6 倍,输出 token 免费。
第 10 天,社区递来另一组数字。一篇「Jev in 25 Lines of Python」用 Qwen3-0.6B 加一个 softmax 复刻了核心,HN 682 分(原文)。JevBench 第三方榜单把 91 个决策系统排进一张表,开源 decider-4b v2 用一半成本拿到 96% 的能力(榜单)。Ollaya 上线把同类模型搬进本地 GPU,HN 483 分(官网)。
两套说法各说对一半。Jev 卖的是「让模型做选择」这个动作。state 进、typed 答案出、带概率,不做字符串生成。25 行复刻证明这个动作的核心机制存在已久——LLM 本来就对每个下一个 token 给概率。产品化才是新的:类型化接口、校准训练、按决策计费。
判断 Jev 这类决策模型值不值得进你的代码,先把四组数字的口径钉死。速度倍数、每任务成本、校准分、采用率,各是一组。落到一句话:盯校准曲线,别盯速度倍数。
Jev 把「让模型做选择」拆成独立商品
TypeSafe 是家新公司,创始人 Diogo Almeida 在 OpenAI 做过 ChatGPT 指令跟随的方法研究。Jev 是它 stealth 两年后的第一款「System One Model」,名字取自卡尼曼的快慢思考(官方博客)。它放弃字符串生成,应用把一段 state 和一组问题发过去。问题只有三类:choice 从 N 个选项里选,score 打分,noul 是或否。模型并行给出全部答案,每个答案带概率。
官方口径:端到端 70–500ms,输入 $0.042/MTok,输出免费。对照 LLM 的定价习惯——输出 token 通常是输入的 5 倍价,「输出免费」是这轮最反直觉的数字。cardinality 上限 255。官方文档自认 jagged edges:Jev 擅长快的 System One 判断,数学和多跳推理交给别人。
产品化有三样新东西。接口是类型安全的:选项 schema 预先定义,类型错误数学上不可能。官方因此敢说「不能幻觉」。这句话只管格式,管不了语义。概率是校准过的:训练方法叫 RLCD(Reinforcement Learning for Calibrated Decisions),创始人自称数据研究实验室,100% 合成数据,这条推文经 arcturus-labs 转述(拆解文)。
官方列的使用场景覆盖三类:AI 工作流里的模糊 if——分类、路由、打分、抽取、分支;海量数据的 map-reduce;实时应用和护栏。workflow evals 的方法也要标口径:参考答案取 Astra 和 Fable 的平均,偏 OpenAI/Anthropic;LLM 一侧走自家 System One adapter wrapper,官方承认这是「最准但最慢」的约束方式。低估了谁,官方也写了:DeepSeek。side-by-side 演示里,Jev 与 GPT-5.6 Terra 的分歧只有「流失概率」一档。官方自己说,这题看着就含糊。
Jev 像只出化验单的检验科:样本进去,出来的是几个数。机制上它仍是 transformer——把「下一个 token 是什么」的 logits 直接当答案,省掉了写字符串这一步。省掉字符串,换来的是并行采样和延迟保证:所有问题的答案一次前向算出。
采用数据由 Vercel 背书。9/18 官方博客标题就是结论:Jev was adopted faster than any other model in AI Gateway history。细节:18 小时内到十分之一付费团队,同期其他模型一整天停在 7% 以下。Vercel 列的用途里 agent 占了大半:选下一个工具或子 agent、决定 workflow 继续或重试或问人、行动前打风险分、验证输出和上护栏。这个速度本身就是信号:Jev 补的是 LLM 集成里最痛的那一环。
25 行复刻成立,复刻的是 logits 把戏
nobodywho.ai 的 parody 帖把 Jev 压成 25 行 Python。加载 Qwen3-0.6B 的 GGUF,把选项排成 A/B/C 行,取选项字母 token 的 logits,softmax 归一化成概率。邮件分类示例:Legitimate 0.031、Spam 0.084、Phishing 0.885。作者收尾:There. That's Jev. 帖子自标 parody,文末列了正经开源实现:OpenJev、openjev-sglang、OpenJev on DiffusionGemma。
arcturus-labs 的拆解补上机制解释:Jev 就是常规 LLM 在一步生成里读选项 token 的 logprob。LLM 本来就是全能分类器,每个位置都输出一张全词表概率分布。OpenAI 的 tool calling 一直在用单 token 当微分类器。to=function. 决定要不要调工具,工具名决定调哪个。这套观察早到 2024 年的博客就有记录。
单 token 当分类器也不是新招。arcturus 在 2025 年 3 月就写过 Supercharging LLM Classifications with Logprobs,当时没微调已见效果。GPT-4 时代有个插曲:Copilot 早期接入 GPT-4 时模型不会收尾,一直写到 token 上限。原因是 API 没开 message delimiter token,模型永远预测不到「结束」这个 token。收尾、调工具、选工具名,全是一路单 token 分类。
复刻的数量比质量更快落地。Latent Space 报道已有 6 个复刻(经 arcturus 转述):Kev 是 Jared Palmer 在 Qwen3.5 上做的 LoRA 系,0.76b/4.2b/7.9b 三个尺寸,HN 460 分(仓库);jevlike 在发布次日(9/17)就逆向出一版;decider 由 Mapika 用 Qwen3.5 训练,直接从选项字母 logits 读答案;decision 出自 vLLM Semantic Router 贡献者;Jev-Leftpad 是个梗,234 分。openjev-sglang 走 vLLM 兼容路线,OpenJev on DiffusionGemma 换了底座。每个复刻都在验证同一个判断:读 logits 比写字符串便宜。
所以「能不能复刻」没有悬念。机制可复刻,产品难复刻。25 行复刻不了的东西有清单:RLCD 校准训练、跨域合成数据、typed API、多问题并行、延迟保证。分发也算一份——Vercel、AI Gateway、生态集成。fooker 替 Jev 说了句公道话:这跟 2019 年的 MNIST 分类器是两回事,现代 LLM 机制一次训练就能覆盖大量任务。
质量差距也存在:HN 用户 george_max 实测开源 laya「明显更差、更不自信、复杂查询常错」,n=1,仅供参考。架构上没有护城河,是 arcturus 的判断;TypeSafe 自己的说法也往数据上靠。创始人被问到数据与架构哪个重要时答:数据重要得多。护城河候选只剩两样:决策数据的质量和 RLCD 训练过程。这两样恰好是外部最难验证的部分。
JevBench 用一张表终结「能不能复刻」的争论
9/24,Benchmark Heaven 发布 JevBench v1.4.2,把「决策模型」变成可测量的类目。protocol 公开、MIT 许可,534 个公开决策加 308 个封存聚合决策,德国服务器逐条跑。封存集的意义是防过拟合。想刷榜,得先过 308 道没见过的题。Jev-class 的定义:单次决策成本不超过 Jev 的两倍(≤$0.080/1k)、延迟不超过 Jev 的两倍(≤1.30s 中位)。
91 个系统里 50 个够格,通用 LLM 大多在类外:单次决策的延迟和成本压不进限。榜首是 Jev 1.13.0:Capability 64.7,其中 Intelligence 53.1、Calibration 52.0,每 1k 决策 $0.040。
| 系统 | Capability | 每 1k 决策成本 | 类型 |
|---|---|---|---|
| Jev 1.13.0 | 64.7 | $0.040 | TypeSafe,闭源 |
| Hopper | 63.5 | $0.024* | 未知 |
| Cygnet | 62.2 | $0.037* | 未知 |
| decider-4b v2 | 62.2 | $0.020* | 开源,Qwen3.5 系 |
| classifier.dev | 62.0 | $0.0033* | 服务,荣誉提名 |
| JevK5 v0.2.0 | 61.7 | $0.022* | Jev 复刻 |
表后读法:Jev 领先,但没拉开。开源 decider-4b v2 用半价拿到 96% 的能力。classifier.dev 更狠,用十二分之一的价格拿到 96%。榜单里还有 JEV Qwen3.5-9B、Winnow-12B、Decision 2B、ZeroEntropy zerank-2 一批追赶者。「能不能复刻」到此终结,问题变成「校准能不能追平」。
榜单的标签栏暴露了类目内部的混装:Jev rebuild、指令模型套 JSON schema、零样本分类器、reranker、raw-logit 控制、native-logit 决策引擎、system-one-open。九种实现路径共用一张表,说明「决策模型」这个类目此刻还是约定俗成,没有公认架构。JevBench 的贡献是把它们拉到同一把尺子下量。
两个口径要标。其一,JevBench 是又一家机构的自家基准,部分成本带星号是估算,封存集是它自己的裁判,别当圣旨。其二,Jev 的 Calibration 只有 52.0/100——「不能幻觉」保住的是格式,语义失准在 arcturus 的实测里出现过,docs 也自认边界。这三条摆在一起,才是「Jev 领先」的完整画面。
这张表还顺带回答了「不能幻觉」的边界。类型安全是一根轴,语义准确是另一根轴。Jev 只保证了前一根:schema 匹配是数学保证,答案对不对是另一回事。声称的 0% 幻觉,换算成 JevBench 的话是 Calibration 52.0,换算成 arcturus 的实测是「存在失准域」。
Ollaya 把决策模型搬进本地,Ollama 随时能跟进
9/26 上线的 Ollaya 是这场争论的阶段性收口:本地决策模型运行时,Apache-2.0,桌面端加命令行加 Docker,CPU 能跑。接口与 TypeSafe 兼容:/v1/systemone。官方 Python SDK 0.7.1 改个 base URL 就能指到本地。下载页按平台给安装脚本,GPU 驱动只在检测到时才拉。数据不出机器,这正好接上企业最敏感的那根神经。
模型列表已经是生态:laya(Convai Innovations,322m/421m,中位 8.1–9.6ms)、decider(Mapika 的 Qwen3.5 系,读选项字母 logits)、kev(Jared Palmer 的 LoRA 系)、nli(Moritz Laurer 的零样本分类器)、gliclass(Knowledgator 的指令零样本分类器)、qwen3guard(Qwen 团队的官方护栏模型)、von(ModernBERT-large 底座的 8k 上下文模型)、decision。平台覆盖 macOS Apple GPU(MLX)、NVIDIA CUDA 13、WSL2、Docker、ARM。
延迟对比:RTX 4090 上 decider:2b 实测 155–190ms,TypeSafe 托管的 Jev 在第三方基准里 236–276ms(含网络),laya 8–10ms。本地和托管同数量级,这是「搬进本地」能成立的前提。接口长这样:一段 state 加一组 questions,每个字段声明 type、instructions 和 criteria。一个客服意图分类的请求返回 confidence 0.9547,三个选项的概率 0.9698/0.0172/0.013,usage 里 output_tokens 是 0——输出免费在协议层就看得见。
首页示例正好是 agent 场景:一条 git push --force origin main 请求,模型回答 block 0.53、destructive yes 0.90、risk 0.15,178ms 出结果。动作护栏第一次变成 10ms 级的本地调用,概率还能被审计。
HN 评论把话挑明。pradn 问:创新被 OSS 两周抄走,创业公司还怎么活。emmettbt 说:Ollama 随时能把决策模型加进去。mococa 更直接:LLM 和 System One 装进一个工具才最好。
carimura 一度以为是 Ollama 官方出品,说模仿得太像。solaire_oa 质疑示例的边界:分类场景里「99% 的提交都不问退款」,布尔开关容易空转。限定词也要补:Ollaya 是第三方项目,laya 与 Jev 的质量差距还没被系统测过,george_max 的体验样本只有一个人。它证的是「品类可以本地化」,还没证「本地模型追平 Jev」。
决策模型进 agent 栈:路由、护栏、打分各就各位
Vercel 给 Jev 列的用途里,agent 占了大半:选下一个工具或子 agent、决定继续还是重试还是问人、行动前打风险分。这些点正是 agent 栈里现在最贵的地方。每个决定都调一次 LLM,几百毫秒、几分钱,还可能选错。决策模型的卖点就是把这些点从秒级降到毫秒级,并附上概率。附上概率的意思是:拿不准时,系统可以转人工。
arcturus 的推演把这一步走得更远:OpenAI 能把分类能力折进 LLM 本体。模型在推理中途问自己一句「这个工具调用安全吗」,用 语法读自己的概率,不出 GPU 就完成安全检查。文章给了两个具体例子。
API key 明文躺在工具参数里时,模型读出 unsafe 0.97,拦下发往外部。长推理里模型定期问「该做下一个任务还是收尾」,用概率短路跑偏的 trace。语音 agent 也能用同一招:实时决定要不要打断、要不要升级,不用等文本生成。
分工正在成形。System One 决策模型走热路径——路由、护栏、打分、继续与否,毫秒级、带概率、可本地。System Two 的 CoT 模型管生成和推理。两者同台只是时间问题,Ollama 支持或某个开源 runtime 把它俩装进一个进程,是顺理成章的下一步。
Vercel 自己在博客末尾留了个问题:首次采用纪录成立,早期采用能不能持续,是下一个测试。决策模型的价值建立在「决策任务被识别、被测量、被验证」之上,这三点在 JevBench 出现之前都没有公共尺子。过去十天这个站点的头条全是 agent 越权事故:53 张用户图片、Medicare 门户、RubyGems 投毒。工程侧的回应也在长出来:把「这个动作安不安全」做成带概率的调用,10ms 出结果,概率可以被留出集验证。护栏从散文变成数字,这是决策模型对安全叙事最直接的回答。
OpenAI fast-follow 是悬在 TypeSafe 头上的问题。arcturus 的判断:若 OpenAI 复刻 RLCD 训练方法,可以把分类折进旗舰模型——更快更便宜的思考、System One 判断内建。TypeSafe 的结局要么被收购,要么窗口关闭。创始人对此的回应只有一句:模型质量重要的话,我们会待很久。
盯校准曲线,别盯速度倍数
速度倍数先钉口径。193.6x 和 444.6x 来自 TypeSafe 自家 workflow evals。参考答案是 Astra 和 Fable 的平均,天然偏向 OpenAI/Anthropic。LLM 一侧走的是自家 constrained wrapper。
70–500ms 对比的也不是 LLM 的推理模式,HN 用户 ramon156 当场指出两边任务口径不对等。方向成立:决策模型比 LLM 便宜两个数量级。精确倍数不可外推。
成本口径比速度口径硬。$0.042/MTok 加输出免费来自定价页。JevBench 实测每 1k 决策 $0.040。本地 decider:2b 在已有 GPU 上边际成本趋近零。
这轮最硬的数字是成本,但它建立在「决策任务被正确识别」之上:你得先知道代码里哪些调用是选择、打分、判断,才有资格谈便宜。输出免费的另一面是:决策任务的量要够大,省下的钱才看得见。
什么任务适合交给决策模型:高频重复、选项有限、错误可量化——路由、分类、打分、护栏。什么任务不适合:开放生成、多跳推理、需要解释的答案,docs 的 jagged edges 划的就是这条线。识别任务比选模型重要,选错任务等于把分数压给一个只会打分的模型。
校准是唯一能当场验证的东西。JevBench 的 Calibration 轴只有 52.0/100,arcturus 实测过 Jev 概率失准的域,docs 自认 jagged edges。判断一个决策模型能不能上生产,就看一件事:它说 0.9 的答案,是否真的 90% 对。这个可以拿你自己的数据复现,不需要等任何厂商的下一版榜单。
三条动作,今天就能做。第一,从代码里拎出「让 LLM 选一个、打个分、判断是或否」的调用,记下频率、延迟预算和选错的代价。第二,在 JevBench 或自己的留出集上测校准:0.9 概率是否真的 90% 对,测校准,不测速度。第三,敏感数据走 Ollaya 本地,数据不出机器;非敏感先试 Jev API,每 1k 决策 $0.040,两周后比路由准确率和账单。