DeepSeek 定价史:从 V3 到 2026 年 9 月 V4 Flash 降价
9 月 10 日的再次调价
2026 年 9 月 10 日北京时间 12:00,DeepSeek 再次下调了 V4 Flash 价格。闲时现为输入 ¥1.00/百万(缓存未命中)、输出 ¥4.00/百万、缓存命中输入 ¥0.02/百万;高峰为其整整两倍(¥2.00 / ¥8.00 / ¥0.04)。这是不到一个月内的第二次调价——也是 DeepSeek 自开放 API 以来一路剧烈波动定价故事的最新一章。
这段历史值得读懂,因为今天「便宜」的数字,是被一次次下调、上调、再重构出来的——而每一次变化都重塑着「谁才是性价比之王」。下面从 2024 年的 V2 时代一路讲到今天的 Flash/Pro 产品线。
价格史一览
下面是最关键的定价变更时间线。除非另有说明,价格均为每百万 token;自 2026 年 8 月起,DeepSeek 自有模型采用高峰/闲时价格对。
2024:上下文缓存登场
2024 年 8 月,DeepSeek 上线磁盘上下文缓存,默认对所有人开启:缓存命中输入 $0.014/M,未命中 $0.14/M。这一机制——缓存 prompt 前缀的计算并在匹配请求时复用——正是今天缓存命中定价的原型,也从一开始就把缓存确立为最核心的成本杠杆。
当年 12 月,V3 奠定了 2025 年的基线:自 2025 年 2 月 8 日起,输入未命中 $0.27/M、命中 $0.07/M、输出 $1.10/M。
2025:R1 时代与分时折扣
2025 年 1 月,R1 作为独立推理模型上线,与通用模型分开计费,输入 $0.55/M、输出 $2.19/M。2025 年 2 月,DeepSeek 推出第一次可核验的闲时优惠:R1 在闲时窗口(16:30–00:30 UTC)成本最多低 75%,V3 低 50%。
这轮闲时折扣于 2025 年 9 月 5 日随 V3.1 结束,V3.1 把通用与推理模型合并为一个模型、两种模式。2025 年 9 月 29 日,实验版 V3.2-Exp 用新的稀疏注意力架构把价格立即下调 50%+——缓存命中输入降至 $0.028/M、未命中 $0.28/M、输出 $0.42/M。
2026:V4、Flash/Pro 分层与高峰/闲时
2026 年 4 月,DeepSeek 预览 V4,用 Flash/Pro 能力分层取代了旧的 chat/reasoner 双模型(两者均 1M 上下文、均支持思考与非思考模式)。Pro 上市期至 5 月初有 75% 折扣,全线缓存命中价也降至原来的十分之一。
2026 年 8 月 16 日 16:00 UTC,DeepSeek 正式推出高峰/闲时定价:闲时恰好是高峰的一半,高峰窗口为北京时间 09:00–12:00 与 14:00–18:00(周一至周五)。相对春夏的平价,这是一次上调——路透社报道不同模型与 token 类型的涨幅在 50% 到 1100% 以上——尽管闲时仍比高峰便宜。
如今,2026 年 9 月 10 日对 Flash 而言再次转向下行:新的闲时输入(¥1.00)、输出(¥4.00)与缓存命中输入(¥0.02)都比 8 月的闲时价更低,缓存命中折扣也从 1/30 扩大到 1/50。Pro 价格保持不变。
驱动价格的三大杠杆
- 缓存——自 2024 年起,DeepSeek 就把缓存命中输入按未命中的零头计费。今天 Flash 上这一差距约为 50 倍,奖励稳定的 prompt 前缀与高频复用的上下文。
- Flash/Pro + 思考 effort——「两个模型」变成同一家族的「能力层 + 思考力度」旋钮。Flash 是吞吐与性价比层,Pro 是处理最难请求的天花板。
- 分时定价——DeepSeek 反复用高峰/闲时窗口(2025 折扣、2026 峰谷制)把可延后负载从繁忙时段挪开。闲时一直是便宜的通道。
两年间的总体信号:DeepSeek 在用缓存定价管理单位成本、用分时定价管理需求形状、用Flash/Pro 分层管理产品适配——而不是一个固定数字一以贯之。
如何读懂今天的价格
以今天的 V4 Flash 为例:闲时输入 ¥1.00 / 输出 ¥4.00 / 缓存命中输入 ¥0.02 每百万 token,高峰为两倍。对比 V4 Pro(闲时 ¥4.50 / ¥13.50,高峰 ¥9.00 / ¥27.00)与 7 月 30 日降价后的 GPT-5.6 Luna($0.20 / $1.20)。现在 Flash 的输出价在一天每个时段都低于 Luna,其缓存输入经济更是全市场最低。
实操打法没有变:保持稳定的 prompt 前缀以走缓存通道、把批处理与 cron 任务排到闲时、高并发常规工作默认 Flash 非思考模式——只在输出质量值得买单时才升级到 Pro 或更高思考力度。当前实时价格见 DeepSeek V4 Flash 定价。
总结
DeepSeek 的定价已从平价的 V2/V3 模型,走过 R1 独立推理 SKU 与 2025 年闲时折扣,演进到今天 Flash/Pro 的高峰/闲时体系。2026 年 9 月的 Flash 下调是这口钟摆的最新一次摆动——也提醒我们任何单一价格都只是快照,而非承诺。能穿越这些变化的策略,是把缓存、调度与模型路由当作设计输入,而不是固定的假设。
| 事件 | 输入(未命中) | 输出 | 缓存命中 | Notes |
|---|---|---|---|---|
| 2024-08 · 磁盘缓存 | $0.14 | — | $0.014 | 上下文缓存引入 |
| 2025-02 · V3 | $0.27 | $1.10 | $0.07 | V3 基线 |
| 2025-01 · R1 | $0.55 | $2.19 | — | 独立推理模型 |
| 2025-09 · V3.2-Exp | $0.28 | $0.42 | $0.028 | 稀疏注意力降价 50%+ |
| 2026-08 · V4 Flash 闲时 | ¥1.50 | ¥4.50 | ¥0.05 | 高峰/闲时制度上线 |
| 2026-09 · V4 Flash 闲时 | ¥1.00 | ¥4.00 | ¥0.02 | 9 月 10 日调价(高峰=2 倍) |
我们正在使用的好工具
我们正在使用这些工具自己进行开发和部署,好用,就推荐了。
Opencode Go
订阅时,您可获得 $5,直接抵消首月 go 费用。
可能是全球最便宜的 deepseek v4 flash 模型调用。
Vultr
获得 $300 测试 Vultr 云平台
被推荐用户需活跃 30 天以上且消费 $10–$25
Railway
无需复杂性即可部署任何内容(我们的各种前/后端服务和容器)
连接您的代码仓库,Railway 会处理其余部分
腾讯云 Tencent Cloud
云服务器、云数据库、COS、CDN、短信等云产品特惠热卖中
AWS的优质替代品,我们应用COS替代S3
硅基流动 SiliconFlow
¥16 元全平台通用代金券,领取之日起 180 天内有效
全场景产品矩阵,支撑 AI 应用全流程落地
Warp
世界上最好用的 AI 终端工具之一
我们可以直接在 Warp 中使用各种顶级模型,而不离开终端