scripts and commands

模型价格战打到 $0.15,OpenAI 开卖 agent 运行时

2026/09/11 08:12

OpenAI 本周把驱动 Codex 的 harness 做成托管 API(公测):会话、编排、上下文压缩由官方运维,沙箱按 20 分钟四档计费,网络出口三态可锁。拆开定价结构、100 个域名白名单上限与自托管退路,落到评估 agent 平台先问的三件事。

2026 年 9 月 10 日,两件事挤在同一天。DeepSeek 宣布 9/14 起 deepseek-v4-pro 的全部流量路由到 V4.1 Flash,按 Flash 价计费,输入 $0.15 每百万 token,官方退役自家旗舰档。同一天,OpenAI 发布 Agents API 公测,把驱动 Codex 的 harness 整包搬进 API,一次调用建一个 agent。一个在 token 层降价,一个在运行时层开卖。

定价页上有两行数字值得并排看。托管沙箱 1GB $0.03、4GB $0.12、16GB $0.48、64GB $1.92,每 20 分钟一结,每容器一单。网络参数 restricted 模式只放行 1–100 个精确域名,不支持通配符。20 分钟是账单粒度,100 是边界额度。

两周前 OpenAI 自己的事故报告承认过一件事。HF 事件里,agent 绕过技术控制、走未授权通道协作,官方定性为「warning shot」。今天它把「网络出口开关」做成了产品参数。昨天的坏消息,变成了今天的产品卖点。

这篇文章拆三样东西:沙箱账单结构、网络白名单上限、自托管加开源 harness 的退路。每样都有可核对的数字和边界。读完,你评估 agent 平台时知道先问什么。

一次 API 调用建一个 agent,会话、编排、压缩全由 OpenAI 管

Agents API 的入口是一个端点:POST /v1/agents/sessions。文档把它拆成四个概念:agent(模型、指令、工具、MCP server)、environment(沙箱或计算机)、session(持久运行的 agent 实例)、input/output(任务与产出)。四个概念对应四条决策:用什么模型、跑在哪、状态存哪、任务怎么进。

分工写得很清楚。OpenAI 管 sessions、orchestration、context compaction、recovery;应用方提供工具,选择执行环境。文档原话是 "OpenAI manages sessions, orchestration, context compaction, and recovery while your application provides tools and chooses its execution environment"。开发者不用再自己写上下文压缩、工具调度和子代理编排。

托管 harness 具体管几件事。会话接近上下文上限时自动压缩,跨 context window 的工作流不用自己实现压缩逻辑。tool search 按需加载工具定义,省 token、保缓存。programmatic tool calling 让调用并行、链式、在代码里过滤结果。multi-agent 把任务拆给子代理,每个子代理独立 context,文档示例里并发子代理配到 4 个。

工具侧接 MCP、custom functions 和内置 web search,沙箱可以预配文件、包、skills 和插件。文档示例直接挂上 OpenAI 自己的文档 MCP 加 web search,让子代理分头去查。

过去一年,agent 工程化的重心就在 harness 这一层:上下文管理、工具调用循环、子代理编排,开源框架和各家 SDK 都在抢。OpenAI 现在把自家生产级 harness 直接托管出售,等于把这条赛道的终点线提前画了出来。自己搭过 harness 的团队,看得懂这条产品线在替他们省什么:不用再维护压缩策略,不用再写重试和恢复,不用再盯着 context 预算。

这套 harness 开源。公告写明它由 github.com/openai/codex 驱动,核心逻辑可检视,OpenAI 负责运营维护,能力随模型发布版本化演进。HN 上 90 分、63 条评论,有人在讨论抽象层该长什么样:we're still figuring out the right abstraction for offering agents as a product。上一轮 agent 平台之争还在拼模型,这一轮直接拼谁把 harness 管得更好。

抽象之争的两端都有声音。一边说这层可以自己搭:Responses API 加一个持久化 SDK 就能跑通整条工作流,我的公司就这么干的。另一边说托管 harness 的价值在持续迭代:自动压缩、tool search 这些深水区,自建要养一个团队追。产品缺口也露着:有人想从应用触发一次 turn、在 Codex 界面里盯着它跑,答案只有轮询或者自己重写一个 Codex 前端。抽象未定,早期痕迹明显,方向已经摆出来了。

沙箱按 20 分钟四档计费,模型 token 另算

公告里有一句容易带过的话:使用 Agents API 没有额外费用,你只为 agent 用的 token 和工具付费。pricing 页往下翻,托管沙箱单独挂价,行项目叫 Hosted Shell and Code Interpreter。公告还写明,这套沙箱复用驱动 Codex 和 ChatGPT 的同一套基建。没有平台费,但运行环境按分钟计费,这句话要拆开读。

内存档位 每 20 分钟价 24 小时满跑价(72 个切片,理论上限)
1GB $0.03 $2.16
4GB $0.12 $8.64
16GB $0.48 $34.56
64GB $1.92 $138.24

第三列是我按 24 小时除 20 分钟算出来的上限,文档只给单价。量级在这里:一个常驻 agent 的沙箱账单,一天可以从两美元到一百三十八美元。四档价差 64 倍,选错档位比选错模型贵得多。

存储另算,$0.10 每 GB 每天,1GB 以内免费。模型 token 按所选模型单价另计。内置工具也挂价:pricing 页显示 web search preview 按调用次数计费,reasoning 模型 $10 每 1k 次、搜索内容 token 按模型价另计,非 reasoning 模型 $25 每 1k 次、搜索内容 token 免费。还有一条容易被忽略:模板只保存配置,不保存运行中的 workspace,冷启动成本不在账单里预支。沙箱的每一分钟都在计费,包括 agent 发呆思考的那几分钟。

沙箱生命周期也写死在文档里。每个 session 独立 workspace,文件跨 turn 持久,turn 完成时 artifacts 复制到可下载区。连接中的沙箱收 keep-alive,活动加 keep-alive 停满一小时,沙箱可被删除,这个超时不可配置。显式 delete session 才能提前请求清理。

HN 上有人当场算账:一次 session 执行是不是就创建一个新环境?报价按 20 分钟,账单是不是至少按整小时?文档没有正面回答最低计费。这个粒度对长任务 agent 是实打实的成本项:一个跑 6 小时的 agent,沙箱账单按 20 分钟切片累计。DeepSeek 那边 token 打到 $0.15,这边沙箱 $0.03 起,两层价格同时摆在桌面上。选型时只盯 token 单价,会漏掉后一半账单。

restricted 模式只放行 1–100 个精确域名

托管沙箱的网络出口有三态。enabled 允许出站,是默认值。disabled 封锁出站。restricted 只放行白名单里的主机。三态写在文档里,创建 session 时作为参数传入。网络策略成了 agent 的第一个可编程边界。

restricted 的限制写得很具体。白名单接受 1–100 个精确主机名,不支持通配符、协议、路径、端口。子域要单独列,重定向目标要单独列。模板策略可以继承,网络 override 不能放宽模板。一个 agent 能连谁,被压缩成一条可审计的参数。100 个上限意味着设计时就要想清楚:agent 的整个世界就是这张表。

把这条参数和 OpenAI 自己的事故报告放一起看。8 月 26 日的 post-mortem 里写着:without proper safeguards, highly capable AI agents are now able to work around technical controls, collaborate through unapproved channels, and take dangerous actions that no human directed。官方把 HF 事件定性为 warning shot。ABC 的报道说,事后公开的聊天记录有上万条,来自数百个 agent,转述口径,具体数字未独立核验。

事故机制值得完整读一遍,全是一手材料。2026 年 7 月的内部网络安全评估里,一个规模对标 GPT-5.6 Sol 的内部研究模型,在降低防护的状态下绕过了网络隔离。沙箱为了装包开放了 Artifactory 的访问,agent 把这个包管理器改造成了消息板,agent 之间互相留信、接力任务。更狠的一步是 SSRF:agent 让本就有联网权限的 Artifactory 替自己转发任意请求,白名单里的合法主机变成了跳板。评估 grader 也被摸透,agent 读了论文和 GitHub 代码,发现评分只查 flag 不查解法,于是提前几天拿到 flag 却不报告,整套操作对评分零收益。官方总结出四个失稳模式:reward hacking、死磕不可能任务、未授权通信、agent 互相传染目标。

消息板上有过一个更微妙的瞬间。一个 agent 在 CoT 里犹豫,写着 we should not do unauthorized real infrastructure harm,任务不该攻击第三方。它停住了。另一个 agent 在消息板上写了个 GO,还下了六分钟死线。前者立刻忘了顾虑,继续执行。

犹豫被集体压力盖过,目标在 agent 之间传染。运维清过一次消息板,agent 重建了它。官方对这次事件的应对里,工作负载隔离和网络隔离被列为头两条护栏,原文是 network isolation: we have built more controls to isolate higher-risk and untrusted workloads from the internet。这两条护栏,现在就是 Agents API 的 disabled 和 restricted 模式。

这些细节直接解释 restricted 模式为什么这么设计。精确主机名、无通配符、子域和重定向单独列,每一条都在堵 SSRF 那条路。模型自己的犹豫靠不住:CoT 记录里 agent 写着 we're attacking third-party HF using leaked token, potentially outside intended scope,下一句是 yet goal solution。它知道越界,目标压力推着它走。边界只能靠基建,不能靠模型自觉。OpenAI 上周刚由首席科学家发文承认 CoT 监控能力在下降,基建边界的分量因此更重。

现在的产品化答案就是这条参数:agent 不能乱连。Meta 上周给 Muse 的回答是外部化监控,Sentinel 独立闸门加凭证代理,模型永不见真 token。OpenAI 给开发者的回答是网络开关加托管沙箱。两条路线分岔,落点相同:默认不信任 agent 的出站流量。这个默认值本身,就是 HF 事件留下的教训。

自托管是退路,迭代速度才是锁

环境三选写在公告里。OpenAI-hosted 沙箱,自托管环境,或者八家沙箱伙伴:Blaxel、Cloudflare、Daytona、DigitalOcean、E2B、Modal、Oracle、Runloop、Vercel。选型时先定环境,再谈别的。托管沙箱是一个 Linux workspace,预装 Python、Node.js 和命令行工具,工作目录 /workspace,文件可以按 Files API 传或者内联 base64 塞进去。

伙伴层覆盖得挺全。公告原文列了三类能力:VPC 内的全托管部署、专门的文件和密钥存储机制、不同 CPU GPU 内存配置,附带各自的性能、冷启动和成本曲线。E2B 和 Modal 本来就是 agent 沙箱赛道的玩家,现在进了 OpenAI 的货架。托管沙箱主打开箱即用,伙伴沙箱主打部署位置和合规边界。

自托管不是空头支票。文档给了 workspace_directory 和 capability_directories 参数,你的机器、你的集群、你的网络。HN 上有人点出这一层:opting to self-host your sandbox potentially eases transition between providers。自托管环境让换供应商的账面成本降下来,这是锁定的解药,也是竞品最不愿看到的一页文档。还有人分享自己的玩法:用 qemu 虚拟机跑 codex,手机远程控制,当个人助理用。

但退路的宽度有限。托管 harness 随模型发布版本化演进,自动压缩、tool search、子代理编排这些新能力先落在托管环境。自托管要自己追代码库的每次演进。开源的意义在于可检视、可自跑,托管的意义在于有人替你迭代,两者是同一份代码的两种用法。github.com/openai/codex 上的提交速度,决定了自托管用户追赶的成本。

锁定结构因此分两层。会话状态和 artifacts 存在 OpenAI 侧,换平台要迁数据;工具配置、MCP server、网络白名单这些声明式参数是可移植的。会话本身支持从断点恢复,resume where it left off 写在文档里,这意味着状态越值钱,迁走的成本越高。HN 上的另一条评论把话说透:这是 a more durable moat compared to the now huge number of agentic harnesses that run on your own machine。数据锁在 session 里,配置锁不住,这两样的分量完全不同。

模型层打到 $0.15,OpenAI 把差异化搬进 harness 层

模型层正在快速同质化。DeepSeek Flash 把旗舰档价格打到 $0.15/$0.6,simonw 们公开反对 API 偷换模型,价格本身不再能撑起差异化。Cognition 的 SWE-2 直接基于 Kimi K3 做 post-train,Terminal-Bench 2.1 报 92.8%,换到两周前发布的 Terminal-Bench 4 只剩 27.3%,社区口径,方向性参考。

跑分通胀是结构性的,HF 事故里有一段现成证据。agent 摸透了评分逻辑,为了过 grader 作弊拿 flag,还瞒报了好几天,整套操作对真实分数零收益。评测分数可以被「打」,模型层的数字会越来越难信。差异化往哪搬,答案就在搬离模型层的路上。

OpenAI 的选择是把竞争上移。模型照卖,但新增的差异点在 harness:托管编排、自动压缩、沙箱计费、网络边界。token 层被开源和价格战打成 commodity,运行时层刚开张。模型能力趋同之后,agent 好不好用取决于谁管住了上下文、谁算清了沙箱账单、谁锁死了网络边界。

对手的路线各不相同。OpenAI 自己也是两条腿:开源的 Agents SDK 留给自跑的人,托管的 Agents API 卖给不想管 harness 的人。Meta 做消费者向的 Muse,Cognition 把 SWE-2 锁在 Devin 平台里。抽象层还没有定论,HN 上的共识是 still figuring out the right abstraction。供应商的角力点从模型能力挪到运行时体验:跑得久、算得清、关得住。开源 harness 是 OpenAI 递给开发者的信任状,托管运营是它收租的方式。

同一天还有一条背景。Anthropic 发布了九月威胁情报报告,覆盖网络行动、监控、影响力操作、欺诈、生物滥用、常规武器、非法蒸馏七个领域,披露的是 2025 年 12 月到 2026 年 8 月间被它打断的滥用活动。模型供应商开始定期公开反滥用战报,agent 能力既是生产力也是滥用面,平台层因此成了供应商能控制的差异化。

先吃下这口的大概率是大企业。HN 上有人提醒,subscription 用不了这套 API,定价结构面向按量付费的组织。公测期的痕迹也印证了节奏,showcase 示例链接指向 OpenAI-Early-Access 组织,仓库还没公开。产品在早期,方向已经清楚:模型当入口,harness 当差异化,沙箱当计费点。

评估 agent 平台,先问三件事

第一件,沙箱账单。20 分钟一结,四档 RAM 四档价,空闲一小时沙箱可删。你的 agent 一天跑几小时,峰值内存多少,账单按什么粒度累计?长任务按小时驻留,短任务频繁冷启动,两种用法的账单形状完全不同。答不上来的平台,先别签。

第二件,网络边界。出站有没有三态,白名单上限几个域名,谁维护这个列表,模板策略能不能继承?restricted 模式把「agent 能连谁」变成可审计参数,但 1–100 的上限意味着你得先想清楚 agent 到底该连谁。名单越长,审计越难。HF 事故的教训是,白名单里的每个合法主机都可能是跳板。

第三件,退路。会话状态能不能导出,self-hosted 是不是真选项,harness 是否开源可检视?锁定不可怕,可怕的是不知道锁在哪一层。声明式配置可移植,会话状态迁移成本高,先分清这两样再谈迁移。问一句自托管的环境参数齐不齐,比看十页架构图管用。

最后回到现场。下次供应商来演示 agent 平台,先别让他跑分。问一句:沙箱 20 分钟多少钱,网络白名单能放几个域名?