博客

DeepSeek 定价史:从 V3 到 2026 年 9 月 V4 Flash 降价

2026 年 9 月 9 日Gavin ChenMindRose Team

9 月 10 日的再次调价

2026 年 9 月 10 日北京时间 12:00,DeepSeek 再次下调了 V4 Flash 价格。闲时现为输入 ¥1.00/百万(缓存未命中)、输出 ¥4.00/百万、缓存命中输入 ¥0.02/百万;高峰为其整整两倍(¥2.00 / ¥8.00 / ¥0.04)。这是不到一个月内的第二次调价——也是 DeepSeek 自开放 API 以来一路剧烈波动定价故事的最新一章。

这段历史值得读懂,因为今天「便宜」的数字,是被一次次下调、上调、再重构出来的——而每一次变化都重塑着「谁才是性价比之王」。下面从 2024 年的 V2 时代一路讲到今天的 Flash/Pro 产品线。

价格史一览

下面是最关键的定价变更时间线。除非另有说明,价格均为每百万 token;自 2026 年 8 月起,DeepSeek 自有模型采用高峰/闲时价格对。

2024:上下文缓存登场

2024 年 8 月,DeepSeek 上线磁盘上下文缓存,默认对所有人开启:缓存命中输入 $0.014/M未命中 $0.14/M。这一机制——缓存 prompt 前缀的计算并在匹配请求时复用——正是今天缓存命中定价的原型,也从一开始就把缓存确立为最核心的成本杠杆。

当年 12 月,V3 奠定了 2025 年的基线:自 2025 年 2 月 8 日起,输入未命中 $0.27/M、命中 $0.07/M、输出 $1.10/M

2025:R1 时代与分时折扣

2025 年 1 月,R1 作为独立推理模型上线,与通用模型分开计费,输入 $0.55/M、输出 $2.19/M。2025 年 2 月,DeepSeek 推出第一次可核验的闲时优惠:R1 在闲时窗口(16:30–00:30 UTC)成本最多低 75%,V3 低 50%

这轮闲时折扣于 2025 年 9 月 5 日随 V3.1 结束,V3.1 把通用与推理模型合并为一个模型、两种模式。2025 年 9 月 29 日,实验版 V3.2-Exp 用新的稀疏注意力架构把价格立即下调 50%+——缓存命中输入降至 $0.028/M、未命中 $0.28/M、输出 $0.42/M

2026:V4、Flash/Pro 分层与高峰/闲时

2026 年 4 月,DeepSeek 预览 V4,用 Flash/Pro 能力分层取代了旧的 chat/reasoner 双模型(两者均 1M 上下文、均支持思考与非思考模式)。Pro 上市期至 5 月初有 75% 折扣,全线缓存命中价也降至原来的十分之一。

2026 年 8 月 16 日 16:00 UTC,DeepSeek 正式推出高峰/闲时定价:闲时恰好是高峰的一半,高峰窗口为北京时间 09:00–12:00 与 14:00–18:00(周一至周五)。相对春夏的平价,这是一次上调——路透社报道不同模型与 token 类型的涨幅在 50% 到 1100% 以上——尽管闲时仍比高峰便宜。

如今,2026 年 9 月 10 日对 Flash 而言再次转向下行:新的闲时输入(¥1.00)、输出(¥4.00)与缓存命中输入(¥0.02)都比 8 月的闲时价更低,缓存命中折扣也从 1/30 扩大到 1/50。Pro 价格保持不变。

驱动价格的三大杠杆

  • 缓存——自 2024 年起,DeepSeek 就把缓存命中输入按未命中的零头计费。今天 Flash 上这一差距约为 50 倍,奖励稳定的 prompt 前缀与高频复用的上下文。
  • Flash/Pro + 思考 effort——「两个模型」变成同一家族的「能力层 + 思考力度」旋钮。Flash 是吞吐与性价比层,Pro 是处理最难请求的天花板。
  • 分时定价——DeepSeek 反复用高峰/闲时窗口(2025 折扣、2026 峰谷制)把可延后负载从繁忙时段挪开。闲时一直是便宜的通道。

两年间的总体信号:DeepSeek 在用缓存定价管理单位成本、用分时定价管理需求形状、用Flash/Pro 分层管理产品适配——而不是一个固定数字一以贯之。

如何读懂今天的价格

以今天的 V4 Flash 为例:闲时输入 ¥1.00 / 输出 ¥4.00 / 缓存命中输入 ¥0.02 每百万 token,高峰为两倍。对比 V4 Pro(闲时 ¥4.50 / ¥13.50,高峰 ¥9.00 / ¥27.00)与 7 月 30 日降价后的 GPT-5.6 Luna($0.20 / $1.20)。现在 Flash 的输出价在一天每个时段都低于 Luna,其缓存输入经济更是全市场最低。

实操打法没有变:保持稳定的 prompt 前缀以走缓存通道、把批处理与 cron 任务排到闲时、高并发常规工作默认 Flash 非思考模式——只在输出质量值得买单时才升级到 Pro 或更高思考力度。当前实时价格见 DeepSeek V4 Flash 定价

总结

DeepSeek 的定价已从平价的 V2/V3 模型,走过 R1 独立推理 SKU 与 2025 年闲时折扣,演进到今天 Flash/Pro 的高峰/闲时体系。2026 年 9 月的 Flash 下调是这口钟摆的最新一次摆动——也提醒我们任何单一价格都只是快照,而非承诺。能穿越这些变化的策略,是把缓存、调度与模型路由当作设计输入,而不是固定的假设。

事件输入(未命中)输出缓存命中Notes
2024-08 · 磁盘缓存$0.14$0.014上下文缓存引入
2025-02 · V3$0.27$1.10$0.07V3 基线
2025-01 · R1$0.55$2.19独立推理模型
2025-09 · V3.2-Exp$0.28$0.42$0.028稀疏注意力降价 50%+
2026-08 · V4 Flash 闲时¥1.50¥4.50¥0.05高峰/闲时制度上线
2026-09 · V4 Flash 闲时¥1.00¥4.00¥0.029 月 10 日调价(高峰=2 倍)

我们正在使用的好工具

我们正在使用这些工具自己进行开发和部署,好用,就推荐了。