scripts and commands

DeepSeek 退役 Pro 档:9/14 起 Pro 请求按 Flash 价计费

2026/09/10 20:12

DeepSeek 发布 V4.1 Flash 并宣布 9 月 14 日起把 deepseek-v4-pro 请求全部路由到 Flash、按 Flash 价计费:输入 miss 从 $0.66 降到 $0.15,输出从 $1.98 降到 $0.6。靠的是 890 bytes/token 的 KV 压缩与 prefill 只激活 8B 的 CED 架构。对 agent 开发者,这是按新价格重算账单的信号;对 API 用户,模型被换已成为官方策略。

Simon Willison 在 Hacker News 上读到一条公告,停住了。他是 Django 的联合创始人、Datasette 的作者,也是这几年给开发者做 AI 工具评测最勤快的人之一。公告来自 DeepSeek 的官方定价页:从 2026 年 9 月 14 日 12:00(北京时间)起,deepseek-v4-pro 的请求全部路由到 V4.1 Flash,按 Flash 的价格计费。他刚为 Pro 精心调过的 prompt,一周后要跑在一个不同模型上。

他在评论区写下原话:「If I'd carefully tested and optimized prompts against Pro I wouldn't be keen on this particular news. I feel like API model providers should lean towards not swapping out models on their paying customers, no matter how 'better' the new model is meant to be.」付费客户正在用的模型被换掉,哪怕新模型「更好」,这个动作本身有问题。

这条公告被大多数报道当作「DeepSeek 又发了个便宜又快的模型」一笔带过。定价页上的完整句子是:V4.1 Flash 在性能、成本、速度、总耗时四项上「comprehensively surpassed」V4 Pro,所以 DeepSeek 计划有序退役 V4 Pro,直到未来某天 V4.1 Pro 发布。一家前沿开放权重实验室,主动把自己的旗舰档从菜单上撤了,把旗舰流量按廉价档计费。

这条公告动的是计费,跑分只是封面。它同时动了两样东西:你的 API 账单结构,和「Pro 这个档位到底意味着什么」。下面把定价页、模型卡和社区反应拆开,落到三个你现在就能核对的数字上。

定价页上藏着一行多数人不会细看的公告

DeepSeek 官方定价页(api-docs.deepseek.com/quick_start/pricing,2026-09-10 抓取)同时列着两个模型:deepseek-flash(DeepSeek-V4.1-Flash)和 deepseek-v4-pro(DeepSeek-V4-Pro-0813)。价格表按每 1M tokens 计。off-peak 与 peak 两档。peak 是 off-peak 的两倍。峰值时段是周一至五 01:00–04:00 与 06:00–10:00 UTC。其余时间都是 off-peak。

Flash 的 off-peak 价:输入 cache hit 每 1M tokens $0.003。输入 cache miss $0.15。输出 $0.6。V4 Pro 的同口径价格:$0.022、$0.66、$1.98。输入 miss 便宜 4.4 倍。输出便宜 3.3 倍。cache hit 便宜 7.3 倍。

并发上限也翻了五倍:Flash 2500,V4 Pro 500。两个模型都支持 thinking mode(默认开)、Tool Calls、Responses API 和 Anthropic API 格式。上下文都是 1M。一个少有人注意的倒挂:Vision 只有 Flash 支持,V4 Pro 反而没有。

时间线很短。Flash 新价从 9 月 10 日 12:00 北京时间就生效了,HN 的公告帖同一天发出。geeky-gadgets 的评测说 preview 版测试窗口只到 9 月 10 日。定价页 9 月 10 日 07:24 GMT 更新,把 9 月 14 日的切换写进脚注。价格已经落地,路由四天后生效。HN 用户 oefrha 找了半天才定位到原始公告。它挂在 platform.deepseek.com/usage 页面的一条 banner 上。不在博客,不在新闻稿。

脚注 2 是整页最关键的一行:「After extensive testing, V4.1 Flash has comprehensively surpassed V4 Pro in performance, cost, speed, and total time, so we plan to retire V4 Pro in an orderly manner.」从 9 月 14 日 12:00 北京时间起,deepseek-v4-pro 请求全部由 V4.1 Flash 承接,按 Flash 价计费,直到 V4.1 Pro 发布。

脚注 1 补了另一刀:旧的 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 这两个模型名已经退役,请求由 V4.1 Flash 承接,同样按 Flash 价计费。你在代码里写 deepseek-v4-flash,实际跑的是 V4.1 Flash。模型名还在,模型已经换了。

切换发生后怎么验证?方法很便宜。9 月 14 日中午之后,用 deepseek-v4-pro 发一个带 max_tokens: 1 的请求,看返回里的 model 字段。返回 DeepSeek-V4.1-Flash,说明路由已生效。返回旧版本号,说明切换还没到你这条链路。这个检查五分钟能做完,值得每个 9 月 14 日还在跑 Pro 的团队做一遍。

890 bytes/token:KV 压缩拆掉了 agent 账单里最贵的那一项

V4.1 Flash 的模型卡(huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash,2026-09-10 发布)标题就是「Pushing the Limits of KV Cache Compression」。架构上它用了 Causal Encoder-Decoder(CED):40 层 Transformer,20 层 causal encoder 加 20 层 decoder。decoder 的全局 KV cache 由 encoder 的最终 hidden states 投影而来,每层 decoder 自己不再各存一份。配合 SWA Bounded Replay,缺失的 SWA KV 状态只用最近 n 个窗口 token 重放重建,省掉了把 KV 写到 SSD 的步骤。

激活参数是硬数字:prefill 阶段每 token 只激活 8B 参数,decode 阶段激活 16B。模型总参数 552B,MoE 每层 1 个共享 expert 加 384 个 routed expert,每 token 激活 6 个。模型卡原话点明这个设计的服务对象:「substantially improving cost efficiency for input-heavy agentic workloads」——输入很重的 agent 工作负载。辅助组件还包括 196B 参数的 Engram 条件记忆(按 token 查找稀疏访问)和 DSpark 投机解码(半自回归草稿生成加置信度调度验证)。

KV cache 的压缩幅度:全局 KV 足迹压到 890 bytes per token,约为 V4 Flash 的 1/4,是 V1 的 1/437。手段包括 CSA2(每层 attention 在 Full/Reindex/Reuse 三种静态模式里分配)、FP4 主 KV 缓存(E2M1 格式,每 16 通道一个 E4M3 scale)、SWA Bounded Replay(把持久 KV 足迹再压到 V4 Flash 的约 1/8)。上下文 1M tokens,最大输出 384K,支持 reasoning effort 1–100 连续调节,整数越大推理越深、成本越高。

对 agent 开发者,这套设计的账单含义很直接。agent 的典型调用模式是同一段长上下文反复进出:系统提示、工具定义、任务背景每次都在输入里。cache hit 输入价 $0.003/1M 意味着这些重复 token 的成本趋近于零。KV 足迹缩小四倍,同样一台机器就能塞下四倍长的上下文。后训练走的是 SFT → RL → on-policy distillation 标准路线。改动全在数据管线:大规模自动合成 agent 任务与环境,随训练逐步放大数据、任务和 rollout 规模。

预训练语料 45T tokens,多模态(自带 DeepSeek-ViT 视觉编码器),协议是 MIT License,权重直接挂在 HuggingFace 上。模型卡列出的 agentic 评估面很宽:Terminal-Bench 2.1/3.0/4.0、DeepSWE v1.1、NL2Repo-Bench、ProgramBench、SEC-Bench Pro、Agent's Last Exam、AutomationBench,视觉 agent 还跑了 Chartography、BabyVision、ZeroBench。具体分数在模型卡的图里,正文没有数字表,跑分细节这里不替它背书。

第三方评测 geeky-gadgets(2026-09-09)实测峰值 427 tokens per second,HN 用户 mmastrac 用 preview 版做批量重构任务时测到 300–400 tok/s,原话是「which was just insanity」——比工具调用本身还快。这两个速度数字都是第三方实测口径,方向一致。评测同时提到短板:特定场景会 overthinking,物理类模拟弱于竞品。

Flash 反向吃掉 Pro:第二次用新架构否定旧旗舰

社区的第一反应是困惑。HN 用户 edude03 的问题很有代表性:历史上 flash 类变体都是「更快但更弱」,怎么所有实验室现在都能做出又便宜、又快、又强的模型?swiftcoder 的总结更直接:「If they can keep up this cadence of Flash leap-frogging the previous Pro, we're in for a good time」——如果每次 Flash 都能跳过上一代 Pro,这个节奏本身就有意思。

revolvingthrow 指出了规模上的真相:V4 Flash 原版是 284B,V4.1 Flash 是 552B,几乎翻倍。「it's not really flash anymore」——名字还叫 Flash,体格已经是旗舰级。这解释了为什么它能「超过 Pro」:它本来就是更大的模型,只是用稀疏激活和 KV 压缩把运行成本压了下来。换个说法:DeepSeek 把「大模型」藏进了「Flash」这个名字里,然后按 Flash 的价卖。名字是廉价的,能力是旗舰的,价格是 flash 的。

NitpickLawyer 在 HN 上把这件事放进了更大的序列:这已经是第三家实验室公开承认旗舰档出问题。OpenAI 去年传闻大预训练失败(传闻,未证实),Google 的 pro 系列被自家新架构取代,现在 DeepSeek 直接退役 V4 Pro。中文论坛上有关于预训练阶段问题的讨论,同样只是传闻。可核实的事实只有 DeepSeek 自己的动作:V4 Pro 0813 这个版本,从 9 月 14 日起停止独立服务。

DeepSeek 的 KV 缓存压缩路线是连续的第二刀。模型卡里的对比数字:V4.1 Flash 相对 V4 Flash 是 1/4,相对 V1 是 437 倍缩减。上一代 V4 Flash 已经把 KV 足迹做小了一轮,这一代又压掉 75%。每次都是用新架构否定旧架构,这次直接否到了旗舰头上。HN 用户 rao-v 的观察:DeepSeek 每次发布都塞满新的、疯狂的想法,而且总能按近前沿规模把它们训出来。k__ 补充了另一个第三方数字:beta 测试者报告吞吐超过 400 TPS,他引用的是 geeky-gadgets 的评测。

开放权重阵营把旗舰档撤了

把 DeepSeek 这个动作放进开放权重阵营里看,信号更清楚。一周前 Mistral 刚完成三星领投的 €3B Series D,投后估值超 €21B,欧洲科技公司史上最大股权融资,押的就是「主权开放权重全栈」。DeepSeek 这边没有融资新闻,动作直接落在定价页上:旗舰档退役、能力下放到廉价档、权重挂 HuggingFace 上随便下(MIT License)。两条路线,同一个方向——开放权重不再只打「便宜」这张牌,开始打「旗舰能力 + 开放权重 + 白菜价」的组合。

对闭源 API 用户,这个组合意味着定价锚点在松动。GPT-6 Astra、Claude 的旗舰档还能按「前沿能力溢价」收钱,前提是能力差距撑得住。当 552B 参数的开放模型按 $0.6/1M 输出卖、还被官方拿去顶替自家 Pro 档时,闭源旗舰的溢价空间被压薄一层。这不是 DeepSeek 第一次这么干:上一代 V4 发布时就把价格打下来一轮,这次直接动档位结构。

geeky-gadgets 的评测提供了一个具体的应用画面:用 V4.1 Flash 生成体素风格的 3D 游戏世界、做空间复杂的模拟、处理代码任务,峰值 427 tok/s。评测还给了短板清单:特定场景 overthinking、物理类模拟弱于竞品。快是真的快,边界也是真的存在。评测的结论是它适合「时间敏感任务」——游戏开发、3D 建模、复杂编码,而不是拿去做需要稳定物理推演的生产系统。

对独立开发者和中小团队,这里有一个实在的套利窗口:在自己买不起旗舰算力的阶段,用开放权重 + 廉价 API 顶到旗舰级任务的门口。9 月 14 日切换生效后,deepseek-v4-pro 这个入口会直接给你 Flash 的能力和价格。赶在切换前把关键 benchmark 跑一遍,存下基线,你就同时拿到了便宜和确定性。

simonw 反对同一个动作:付费客户的模型被换

simonw 的反对不是孤例。aftbit 的回复更具体:「If a user has validated a workflow on V4 Pro, they might not want to suddenly start testing it in production on V4.1 Flash.」他建议保留 V4 Pro、给一个明确的 deprecated 周期再移除,而不是直接路由。两人的共识是同一件事:API 厂商该让付费客户决定什么时候换模型,该让换模型成为一个显式动作。simonw 的完整立场是:无论新模型「多好」,偷偷换掉客户正在用的模型都该避免——「no matter how 'better' the new model is meant to be」。

社区里也有正面声音。LaurensBER 的用法是把它当 backup:主订阅到期、需要撑几天时,这个又便宜又听话的模型很好用。他测试的标准很特别——让它下载一个自己拥有的旧游戏 ROM,美国模型大多拒绝,V4.1 Flash 愿意照做。EbNar 说得更简单:「They are a joy and they cost pennies per answer」——几个月来他几乎只用中文区的 flash 系模型,每次回答只要几分钱。postalcoder 提了一个反向的痛点:reasoning effort 目前只有 low/high/max 三档,没有 medium,「high/max 想太多、耗时、成本膨胀」。模型卡承诺的 1–100 连续调节,在 API 上还没有完全兑现。

值得单独说的是 mmastrac 的一手体验:用 4.1 flash preview 把一批 .metal 内核重构到 .cu,「needed less steering than Opus on refactoring」,注释写得更好。这是单个用户、单一任务的体验,n=1,方向性参考。他的结论是即使推理深度差一点,速度快到 300–400 tok/s 时「it can do a lot more than you might expect」。他还提到一个失败案例:把一个 root 漏洞利用从现代 Android 移植到 Pixel 3 没成功,但可能是 harness 配置问题——超时给得太短。

对正在用 DeepSeek Pro 做生产流水的团队,社区反弹指向一个实操问题:你的 prompt、few-shot、工具调用格式如果是在 V4 Pro 0813 上验证的,9 月 14 日之后行为基线会变。模型可能更好,也可能在你不注意的维度上变差。评估要重跑,测试要重挂。行为漂移的风险和降价的好处同时存在。只看价格表,会漏掉风险那一面。

API 用户现在要做的三件事

第一件,核对切换。翻一遍代码和配置里所有写 deepseek-v4-pro 的地方,确认 9 月 14 日之后它们会静默变成 V4.1 Flash。如果某个流水线依赖 Pro 的特定行为,赶在切换前把关键任务的输出快照存下来,作为切换后的对照基线。同理检查 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 这两个旧名——它们已经退役,现在就在跑 V4.1 Flash。模型名只是入口,版本号才是你调用的东西。

第二件,按 Flash 价重算成本。输入 miss $0.15、输出 $0.6,相对 Pro 的 $0.66、$1.98 便宜 4.4 倍和 3.3 倍;如果请求能打到 cache hit,输入成本直接掉到 $0.003。长上下文 agent 的成本模型要重画:重复输入部分从「贵」变成「几乎免费」。并发上限从 500 涨到 2500,批量任务的调度也不用再省着用。一个具体算法:把过去 30 天的 DeepSeek 账单拉出来,按 Flash 价重跑一遍,你就知道 9 月 14 日之后大概省多少。

cache hit 的便宜要主动去够。把系统提示、工具定义、固定前缀这些不变的部分放在请求开头,顺序别乱,DeepSeek 的前缀缓存才能命中。命中了,输入按 $0.003 算;没命中,按 $0.15 算。50 倍的差价,值得为 prompt 排版花十分钟。对反复跑同一批任务的 agent,这是账单上最大的单项变量。

第三件,认领模型漂移风险。把「模型名不变」和「模型不变」分开看。DeepSeek 这次的公告把两者拆开了:名字可以继续叫 Pro,跑的已经是 Flash。你在别的厂商那儿也可能遇到同类动作,只是这次白纸黑字写在了定价页上。给关键 agent 任务挂上输出校验,比相信任何「更好」的承诺都可靠。评估集要覆盖你真实的任务分布,跑分榜上的数字替代不了你自己的回归测试。

这个判断有一个作废条件:如果 V4.1 Pro 发布后,Pro 档回归、价格恢复到 $0.66/$1.98 的量级,说明「Flash 吃掉 Pro」只是一段过渡期,旗舰档的位置还留着;如果 DeepSeek 在 9 月 14 日前撤回路由公告,同样说明内部对这个动作还有顾虑。在那之前,按 Flash 价重新算你的 agent 账单,是唯一确定的动作。下一个值得盯的时间点是 9 月 14 日 12:00 北京时间:切换是否如期发生、Pro 档是否真的从页面上消失、旧名是否还能用——三个可核对的现场,等三天就有答案。