7 月 31 日下午,DeepSeek 的 API 更新日志里多了一行字:「DeepSeek-V4-Flash 正式版 API 上线公测」。没有发布会,没有直播,官网首页没有横幅。当天晚上,它出现在知乎热搜第一的位置。开发者社区当晚讨论里出现频率最高的词,是「斩杀线」。

这行字值得读三遍的地方在于,正式版和四月的预览版是同一个模型:总参数 284B、激活参数 13B,结构、尺寸都没变,只是重新做了后训练。一个 Flash 档位的轻量模型,靠重练「怎么干活」而不是「更大的底座」,在九项 Agent 基准上全线超过自家的 Pro 预览版。

更微妙的是时间线。7 月 24 日,deepseek-chatdeepseek-reasoner 两个老接口静默停用,所有流量在那之前就已经指向 deepseek-v4-flash。也就是说,在「正式」官宣之前,新模型已经在真实流量里跑了一周多,等 bug 被真实请求消化掉,再补一个正式标签。先灰度、后官宣,这件事本身就是这次发布最工程化的注脚。

斩杀线是怎么画出来的

「斩杀线」这个词来自 Artificial Analysis 那一类价格-性能坐标图:横轴是每百万 Token 的输出成本,纵轴是综合智能指数。V4-Flash-0731 拿到 50 分,比自家 V4-Pro 高 6 分,比 GPT-5.6 Luna 的 51 分低 1 分;输出价格是 $0.28/M,Luna 是 $1.2/M。社区流传的那句话是:「Codex、Claude 定上限,DeepSeek 定斩杀线。跟它持平没溢价,落后它就出局。」

斩杀线:以 V4-Flash 为界的性能与价格双重淘汰

图 1:斩杀线是价格-性能坐标系里的前沿。落在它右下角的模型,要么更弱,要么更贵。点位为公开报道口径的示意位置。

数据确实在支持这个说法。OpenRouter 周度调用量登顶;有编程工具厂商称发布当天平台使用量和新订阅都涨了约三成;几家海外初创把推理切过去之后,月推理成本降了六到八成。时间点也带着火药味——OpenAI 在发布前一天刚把 GPT-5.6 Luna 的 API 价格砍了 80%,第二天评论区就贴满了对比图。

但有一个前提值得单独说清楚:斩杀线是「价格-性能」坐标系里的线,坐标系本身是评测机构和媒体画的。它量的是单次任务的性价比,不是生产环境里的可靠性。它不包含你的仓库、你的工具链、你的验收口径。斩杀线是一条市场意义上的线,不是工程意义上的线。

这轮降价为什么不是价格战

如果只看「便宜」,很容易把这次发布理解成又一轮价格战。真正的信号藏在三个工程细节里。

第一个细节是 98% 的缓存命中折扣。缓存命中的输入只收 $0.0028/M,未命中是 $0.14/M,差 50 倍;行业通行的缓存折扣在 90% 左右。这不是慷慨,是对 Agent 工作负载结构的理解:系统提示词、工具定义、前几轮对话历史,每一轮都在重复发送,缓存命中对 Agent 场景来说不是优化选项,而是负载的内建属性。敢把折扣放到 98%,说明官方对命中率有很强的把握——否则这是自杀式定价。单任务成本比已经降价 80% 的 Luna 还低约 60%,关键就来自这里。

第二个细节是峰谷定价预告。定价页上写着:高峰时段(北京时间 9:00–12:00、14:00–18:00)所有计费项按两倍收取,生效时间以正式通知为准。推理负载有明显的潮汐,需要价格杠杆削峰填谷——这说明规模化运行的成本结构是真实的。「把批量任务排到夜间」很快会从省钱技巧变成基本常识。

第三个细节还是那条 changelog 本身:老接口按时停用,新模型先用 preview 标签消化真实流量,再正式宣布。回看 4 月 24 日预览版上线时预告的「三个月后停止维护」,一切都是按时发生的。灰度发布、按时切换、预算写进价格——这是运维纪律,不是营销。

可靠性提升是真的,但要看清它测的是什么

官方放出的九项基准全部上涨,每一项都超过 V4-Pro-Preview:

基准 0731 正式版 Preview 考的是什么
Terminal Bench 2.1 82.7 61.8 真实终端里把任务办成
Cybergym 76.7 38.7 攻防场景的推理与操作
Toolathlon-Verified 70.3 49.7 正确选工具并调用
DSBench-FullStack 68.7 37.0 全栈开发(内部测试集)
DSBench-Hard 59.6 高难度开发(内部测试集)
DeepSWE 54.4 7.3 真实仓库读 issue、写补丁、跑测试
NL2Repo 54.2 39.4 一句话生成完整仓库
Agent Last Exam 25.2 综合智能体大考
Automation Bench 25.1 自动化流水线执行

DeepSWE 从 7.3 涨到 54.4 是最值得看的一行。它考的是「把真实 GitHub issue 变成通过测试的补丁」:模型在仓库里自己读代码、写改动、跑测试、失败再试。这类分数描述的不是单次回答质量,而是多步任务的完成率。可靠的 Agent 和会聊天的模型之间的分界线就在这里——任务能不能执行到底,失败了会不会带着证据继续找,工具调用是不是稳定。

但三件事必须打折看。第一,这些是官方自测:DeepSeek Harness 的 minimal mode、max effort、特定采样参数,自家框架自家卷子;第二,DSBench 两个指标来自内部测试集,口径不能和公开基准混排;第三,Agent Last Exam 只有 25.2 分——这是业内著名的地狱级卷子,各家普遍在二三十分徘徊,绝对值没有横向意义。

值得交叉验证的是第三方。Artificial Analysis 的智能指数 50 分,比四月预览版高 10 分;Arena 的前端竞技场 1586 分、开放类第三名,比预览版高 154 分。两个独立口径指向同一结论:Agent 能力是真的上来了,不是 changelog 自嗨。但「评测里能交付」和「你的仓库里能交付」之间,还隔着权限模型、工具链版本、验收口径和发布流程——这段沟,工程团队得自己填。

Agent 可靠性的来源是回路,不是模型

图 2:可靠性来自验证回路:失败带证据重试、超限转人工、结果沉淀为评测集,回灌下一次任务。

AI 具备大规模工业级应用能力了吗

我的判断是:分场景。判断标准有三个——失败成本、可验证性、任务量。

低风险、结果可以自动验收、任务量大的场景,已经具备了。补单测、批量扫描、重复性重构、日志归因,这类工作的完成率已经够用,成本结构也支持铺量:有开发者在知乎说,一个下午跑掉五个多亿 token,账单没花到一杯奶茶钱。这类活以前因为「模型不行」和「太贵」两个原因没进生产,现在两个原因同时消失了。

高风险、语义含糊、失败代价大的场景,还不具备。跨模块排障、架构判断、涉及资金和权限的改动——模型跑分再高,也不是发布审批。这里真正缺的不是模型能力,是验证手段:你能不能为「删除这条用户数据」构造一个可信的验收?不能的话,换哪个模型都不行。

所以「大规模工业级应用」不是模型的属性,是系统属性。我把它拆成四层:

层次 这次的进展 还缺什么
模型层 后训练把 Agent 完成率拉高,13B 激活参数跑 Pro 级任务 更强模型的真实边界仍要自己试
协议层 原生 Responses API,Codex 一行配置接入 无状态实现,历史要自己带
成本层 98% 缓存折扣、2500 并发、峰谷定价 命中率取决于提示词结构,账单要会算
治理层 几乎没有官方进展 自动验收、CI、人工门、可观测,全靠组织自建

模型层和成本层的进展是 DeepSeek 给的;协议层给了一半;治理层完全是组织自己的事。四层齐了才叫「可采购的服务」,否则只是「很便宜的 API」。顺着这个框架再看网上的两种说法:说「AI 已经可以大规模工业级应用」的,多半只在模型层做判断;说「跑分都是虚的」的,多半没算成本层。两者都只看见了一部分。

接下来该做什么

给团队和给自己的建议都很朴素。

先让它干能验收的活。低风险、结果可自动验证的任务优先迁移,一次只换一个变量:同一仓库、同一任务集、同一套测试,比较完成率、耗时和 token 消耗。生产、权限、资金、安全的改动保留人工 review 和 CI——便宜不改变责任。

成本账盯缓存那行。系统提示词和工具定义保持稳定、可缓存,是省钱的正解;峰谷定价落地后,批量任务排到夜间。另外 Responses API 目前是无状态实现:不支持 previous_response_idstore 恒为 false,对话历史得自己带。协议通了,生态还在早期,接入前先读文档而不是看教程截图。

斩杀线是一条市场线,它的位置由价格和跑分决定,这次被大幅前移了。验收线是一条工程线,它的位置由验证回路和发布纪律决定,它不会因为别人发布了新模型而自动移动。

7 月 31 日那行 changelog 里还带着两句没被足够讨论的话:「V4-Pro 正式版将尽快发布」「峰谷定价具体生效时间以正式通知为准」,再加上大概率会来的开源权重,接下来的变量仍然很多。但无论下一版跑分如何,这次发布把一件此前模糊的事说清楚了:在可验收的低风险场景里,AI 已经从「值得试试」变成了「默认选项」。剩下的,是工程团队自己的事。

参考与数据来源

  • DeepSeek API 更新日志与定价页:https://api-docs.deepseek.com/zh-cn/updates
  • IT之家:DeepSeek-V4-Flash 正式版跑分报告(Artificial Analysis / Arena 第三方数据)
  • 卡码笔记:V4-Flash 正式版上线拆解(基准对比、接入与峰谷定价提示)
  • AI 内参:DeepSeek V4 Flash 正式上线与「AI 斩杀线」讨论综述
  • 掘金:一行 changelog 里的暗涌(九项基准逐项解读、缓存折扣与接口限制)
  • 知乎:DeepSeek V4 flash 正式版发布讨论(开发者实测口径)