scripts and commands

OpenAI 决策 API 进了考场:排在 Jev 后面,99% 的自信兑现 68%

2026/10/08 08:26

摘要:OpenAI 的 Decisions API 在 DevDay 上以「150 毫秒、快 10 倍」出场,一周内转入公测。第三方考场 JevBench 的第一份成绩:专用版 Composite 62.5,排第 5,价格与延迟都落后 Jev;通用底座 GPT-6 Luna 在 3,600 道题上 99% 的自信只兑现 68%。大厂把决策模型做成了品类,护城河那条线叫校准。

打开 JevBench 的 API 榜单页,第 5 行多了一个「new」标记:OpenAI Decisions(gpt-6-luna 决策版),Composite 62.5。往下看它的坐标:每千次决策 0.0517 美元,中位延迟 0.30 秒。再往上看第 3 行,Jev 1.13.0,Composite 71.5,每千次 0.032 美元,0.24 秒。这是一周前刚刚转公测的 OpenAI 官方产品,在第三方考场上交出的第一份成绩单。

榜单之外还有第二组数据。10 月 1 日,决策路由团队 anth.us 发了一篇长文,他们拿 3,600 道多步推理题去测 GPT-6 Luna——Decisions API 官宣时的底座模型。模型自报「99% 以上确定」的那些答案,实际正确率是 68%。同一场考试里,Jev 自报 99% 以上的答案,兑现率 98.9%。

两份数据撞在一起,事情就清楚了。OpenAI 在 9 月 29 日 DevDay 上发布这个 API 时,官方图表给的是另一个数:一次决策 150 毫秒,比走常规 API 快 10 倍。The Decoder 和 Axios 都转述了这组数字,Axios 还专门写了一句:这个产品「被拿来与 TypeSafe AI 的 Jev 比较」。大厂入的是别人的考场。考完,最难的科目没过。

这篇文章把三个数字——150 毫秒、第 5 名、68%——放回各自的口径里,看清楚每一次采购决策模型时该核什么。结论先放在这里。速度和价格摆在明面上。校准藏在阈值后面。这次的数据,站在 Jev 那边。

「快 10 倍」是官方图表的数字,榜单上它排第 5

先拆第一个数字。150 毫秒一次决策、比常规 API 快 10 倍,出自 OpenAI 自己的 DevDay 图表,The Decoder 在报道里转述:常规路线走 GPT-6 Luna 要 1.6 秒,Decisions API 压到 150 毫秒。这组数字没有第三方复测背书,发布会的图表属于厂商口径,听一听就好,别当成采购参数。

第三方测出来的数是另一个量级。JevBench 是 Benchmark Heaven 运营的决策模型榜单,9 月 22 日以 Show HN 发帖进入社区视野(154 分),v1.6.1 版本在 10 月 6 日更新:23 个 API 系统参加排名,每系统跑 1,500 道题,新系统先跑 600 题的子集再等价折算。OpenAI Decisions 那一行写着:Composite 62.5,其中 Capability 73.5,每千次决策 0.0517 美元,中位延迟 0.30 秒。

排名在它前面的有四个系统:Sage 1.3.0(Levanto Labs)74.0 分、d1(Liquid AI)73.0、Jev 1.13.0 的 71.5、wity-1 的 70.8。第六名 Instinct 拿 62.2,每千次决策只收 0.015 美元。大厂产品插进一个已经卷了半年的市场,首考落点:第 5 名,价格比第三名贵六成,速度比第三名慢四分之一。延迟一项,第三方实测的中位数已经和官方图表对不上量级——这正常,官方 150 毫秒是端到端最优路径,榜单测的是混着各类题型的中位表现。下文还会再碰一次这对口径。

这里有一个必须带上的限定:OpenAI 那一行是 600 题等价折算的口径,前四名是 1,500 题全量,两个数字不在同一个题池里,名次是方向性参考而非同池定论。JevBench 在表里明确标注了这一点。严谨的读法由此而来。首考 62.5 分,说明它没进第一梯队。至于和 Instinct 的 62.2 谁高谁低,要等全量重跑。

还有一个容易被略过的细节:这个成绩是「专用版」的。OpenAI 没有公开决策版的底座和训练细节,JevBench 标注 base model 为 undisclosed。The Decoder 与 Axios 转述的说法是「a version of GPT-6 Luna」——通用 GPT-6 Luna 的一个专门改过的版本。第 5 名已经是特调之后的成绩。通用模型裸考是什么水平,下一节有数。

把专用版和通用版放回同一张榜单,改造的方向看得更清楚。通用 GPT-6 Luna(low reasoning effort)在 API 板排第 8:Intelligence 97、Calibration 99,但 Speed 72、Cost 39,每千次决策 0.108 美元,被标注「cost 3.3× Jev、latency 3.0× Jev,超出 Jev-class 上限」。决策专用版四个轴变成 57、90、89、49——Intelligence 掉了 40 分,Speed 和 Cost 上来了。「专用版」三个字的实质就在这里:砍掉通用推理能力,换成速度和价格。OpenAI 没有把通用 Luna 调快一点,是训练了一个更窄的模型。

定价减半说明 OpenAI 把决策当量生意,可单位价格仍是 Jev 的 1.6 倍

打开 OpenAI 的计费页,能读到官方对这门生意的判断。通用 GPT-6 Luna 的价格是每百万输入 token 5 美元、输出 40 美元。决策版 gpt-6-luna 直接砍半:输入 2.5 美元、输出 20 美元。同一底座,换个接口形态,价格对折。OpenAI 在定价上把「决策」当成一种更便宜的服务来卖。

砍价的逻辑不难猜。决策 API 的调用形态是高频、小请求:每次只输出一个选项,几毫秒级的文本,但一天可能要打几百万次。路由、分类、护栏检查,全是 agent 循环里最频繁的动作。谁在这个位置上卡住生态,谁就有固定的日常流量。定价减半是抢量的姿势。

但 JevBench 实测的单位价格讲的是另一件事。榜单按各家 list price 折算,一次决策的综合成本是 0.0517 美元每千次——Jev 1.13.0 是 0.0323 美元,Instinct 是 0.0154 美元。官方定价把 token 单价砍半,可落到「一次决策」这个颗粒度上,它比 Jev 贵约 1.6 倍,比 Instinct 贵两倍多。token 变便宜是一回事,决策变便宜是另一回事。中间隔着一次调用要消耗多少 token。

对采购方来说,单位价格表比单价表更接近账单。你的 agent 每天要在路由和护栏上做一千万次决策,按 JevBench 的实测价,OpenAI Decisions 一天 517 美元,Jev 323 美元,Instinct 154 美元。年化差出十几万美元。这些数字都建立在「第三方按 list price 折算」的口径上,API 价格随时可能调。JevBench 在注释里自己提醒:API 价格是厂商的决定,可能被补贴、可能涨价,读者无法复现。

价格战还有一个隐藏变量:开源。同一份榜单的 open-weights 板块已经涨到 104 个排名系统——9 月 26 日这个数字还是 91,九天涌进 13 个开源决策模型。第一名 Quyet-1.0-Large 拿下 Capability 81.7,底座是 Gemma-4-31B,分数超过了 Jev 的参考行 77.1。榜单第二 deck-31B 也是 Gemma-4-31B 底座,作者明说权重一个参数没训,只做了 FP8 量化就上场测分。开源系统按自租硬件折算成本,前排已经有人把千次决策压到 2 美分以下——API 厂商降价的空间,正在被一群用开源底座微调的团队从下面顶住。

专用版救得了分数,救不了通用底座的校准塌方

anth.us 的测试报告把最要紧的问题摆上了桌。他们测的不是决策 API——发布时那还是 limited preview,没有文档可测——而是通用 GPT-6 Luna 本身:关掉推理模式,套上严格 JSON schema,从 logprob 里读出模型对每个选项的真实概率。3,600 道题来自 ProofWriter,AI2 出的模板化逻辑数据集,open-world 和 closed-world 各 1,800 道,每个推理深度约 300 道,所有金标答案用独立求解器重算过。方法、代码、全部请求响应原文都公开在 hard-decisions.anth.us。

结果分两层。能力层面:答案摆在明面上的题(深度 0),Luna 拿 93% 到 98%,和 Jev 的 98% 到 99% 在同一档。推理链拉到五步,Luna 掉到 45% 到 46%,等于抛硬币;Jev 同深度还有 81% 到 89%,差距 35 到 45 个百分点,95% 置信区间 27 到 43 和 38 到 51。anth.us 补了一句公道话:除了 Jev,他们测过的所有开源模型在深度 5 也都是抛硬币水平——多步链式推理是全行业的坑,不是 Luna 独有。

顺带记录这次探测的开销:3,600 道题全部带 logprob 重查一遍,花了大约 14 美分。校准审计这件事本身的成本,已经低到任何采购方都没有借口跳过。一份合同一年的量,抵不上一次跳过的风险。

校准层面才是塌方。模型自报 99% 以上确定的 2,672 个答案里,只有 68% 是对的;Jev 自报 99% 以上的 1,667 个答案,兑现 98.9%。期望校准误差(ECE):Luna 0.32,Jev 0.03 到 0.04。也就是说,Luna 的自信和它的对错之间松了半根皮筋。Jev 的自信基本钉在完美曲线上。

比过度自信更糟的是置信度失效。AUROC 衡量「分数能不能区分这个模型自己对和错的答案」:Luna 在深度 0 还有 0.88,到深度 5 只剩 0.51,而 0.5 就是抛硬币线。过了这条线,你设 99% 的阈值自动放行,和随机放行没有区别。过度自信可以事后校准修,anth.us 自己也修过 Jev;置信度里干脆没有信息,重映射数字救不回来。文中举的例子值得抄在这里:文本明写「The lion is not big」,Luna 以 100% 的确定度回答「unknown」。

这份报告有两个自带的限定,转述时要带全。第一,测的是通用 Luna,不是决策专用版,作者明说「专用版可能更好」,并承诺公测后用同一套题重测——而 JevBench 恰好已经替市场测了专用版:62.5 分,第 5 名,还是排在 Jev 后面。第二,ProofWriter 是合成模板题,结论只覆盖「模板化多步推理」这类难度,你的业务分布是否类似,要自己测。稳定性数据顺带一提:同一道题问两遍,Luna 有 10% 改口,Jev 改口 2% 到 3%,Kev 和 Laya 一次没改。137 条回复甚至不是模型自身概率最高的那个选项——OpenAI 默认温度在采样。

还有一层机制疑云被这份报告澄清了。anth.us 原本假设 OpenAI 把 logprob 藏起来了——推理模式一开,API 直接拒绝返回 logprob,报错「'logprobs' is not supported with this model」。实测发现推理关掉时,返回的备选 token 平均覆盖了 99.8% 的概率质量,被隐藏的部分几乎不携带信息,所以结论落在过度自信上,保密只占小头。为什么推理一开就要藏 logprob?团队猜了两个方向:防蒸馏(2024 年 Carlini 等人确实用 logprob 加 logit bias 从生产模型里恢复过部分权重,OpenAI 随后改了 API),或保护推理过程的竞争壁垒——文中特意写明这是推测,没有证据。

考场是别人家的:品类按 Jev 命名,九天又涌进 13 个开源系统

把视线拉远一格,这场考试的组织方式本身值得读。榜单叫 JevBench,品类叫 Jev-class,入场标准写着「成本与延迟不超过 Jev 的 2 倍」。一个上线一个月的产品,名字成了品类名和及格基准线。这在技术产品史上不多见。上一个类似的先例是云厂商做容器编排:K8s 生态出卷子,所有厂商来考。

OpenAI 的进场姿势也顺着这个品类逻辑。The Decoder 的 DevDay 报道直接写道:With the Decisions API, OpenAI is moving into the field of so-called System One models——然后第一个点名 Jev,交代了 Diogo Almeida 这位前 OpenAI 研究员创办 TypeSafe AI、9 月中旬发布 Jev、在开发者社区掀起一波热捧的前情。Axios 的表述更直白:这个系统「被拿来与 TypeSafe AI 的 Jev 比较」。大厂官方产品发布,媒体通稿要靠一个初创产品的名字来讲清楚它是什么,品类定义权在谁手里,一目了然(Axios 把公司名误写成「TypeFace AI」,以讹传讹的速度,从侧面说明这个名字出现得多快)。

开源侧的跟进速度是品类热度的另一面。JevBench 的 open-weights 板从 9 月 26 日的 91 个系统涨到 10 月 6 日的 104 个,9 天 13 个新系统;10 月 7 日,Strands Decider 2B 在 HN 拿了 274 分,Apache-2.0 协议,主打「小、开源、专门做决策」。这些团队的共同打法:拿公开底座(Gemma、Qwen)微调,自租硬件测分,按千次决策几分之一美分定价。他们没有品牌,但榜单上的分数和价格是可复现的。

对 Jev 来说,大厂入场算得上一份迟到的背书。9 月 26 日那篇分析里有一个判断:Jev 类产品的叙事(「新范式、不幻觉、快 193 倍」)与社区现实(「分类器产品化加 logits 把戏」)之间横着一条裂缝,护城河只剩校准训练和数据。一个月后,OpenAI 用官方产品确认了这个品类的存在,又用首考成绩确认了这条护城河的深度——62.5 对 71.5,专用版也没能一步跨过去。品类被大厂背书、护城河被大厂量化,两件事同时发生。对 TypeSafe,这是好消息的成分更大。

买决策模型实际买的是校准,这次是 OpenAI 替这条护城河做了背书

把三个数字的口径全部摆完,采购清单上该核什么就清楚了。150 毫秒是厂商图表,0.30 秒是第三方实测,都只是速度;0.0517 美元每千次是折算价,0.032 美元是对照组,都只是价格。第 5 名是 600 题口径的方向性参考,等全量重跑才知道和 Instinct 谁前谁后。这些数字都会随版本更新。校准的更新周期长得多——训练管线一动,整条曲线重画。

anth.us 在文末给了四条检查清单,值得原样收进采购流程:在你实际运行的难度上测,简单题人人在 90 分以上;用带标签的答案核对校准曲线,再设阈值,一个「99% 兑现 68%」的模型会把错误决策成批送过人工审核线;确认置信度在最难的样例上仍能区分对错,区分不了的话,任何事后校准都救不回来;同一道题问两遍,看改口率。四条清单,没有一条提到延迟和价格。

这次碰撞对 agent 产业的含义比「OpenAI 又出一个 API」具体得多。决策模型是 agent 循环里替代人工审核的那道闸门。闸门的可信度完全由校准决定——你敢让模型自动执行的范围,就是它自报置信度的可信范围。一个 99% 兑现 68% 的闸门,意味着你按 99% 阈值设的自动化率,实际风险敞口是设计值的近 1.5 倍。反过来,Jev 98.9% 的兑现率背后是 0.03 到 0.04 的 ECE 在支撑——9 月底「护城河只剩校准」的判断,这次拿到了正面对照数据。

大厂入场还带来一个次生效应:校准数据第一次有了跨厂商的可比坐标。JevBench 把 Calibration 作为四轴之一计入总分——OpenAI 决策版这一轴拿 90,不低,但 Composite 里被 Intelligence 57 拖住。anth.us 的 reliability 图把「自报 99% 时的兑现率」画成一条线。以后任何一家再喊「我们的决策模型可以放心自动化」,考场和体检表都是现成的。发布会图表说了不算。

首考第 5 不是终局。OpenAI 的迭代速度有目共睹,anth.us 也承诺公测后立即重测。但对当下要做选型的团队,顺序已经可以定了:先跑你自己业务里的带标签难例,把每家模型自报的 99% 换算成真实兑现率,再看价格表。下次有人向你推销一套「决策模型驱动的自动化」,你可以只问一句:你这个 99%,在带标签的难例上兑现过多少?