DeepSeek 上下文缓存(也称磁盘缓存)会存储 prompt 前缀的计算结果并在匹配请求时复用,缓存命中输入按普通输入价的约 1/50 计费。
DeepSeek 会从第一个 token 开始缓存 prompt 的计算结果。当你发送新请求时,系统会检查 prompt 开头是否与已缓存的前缀匹配。如果匹配,就复用缓存结果——并只收取缓存命中价格,而非完整输入价。
关键细节:匹配是前缀式的且从第 1 个 token 开始。只要改动 prompt 开头的任何内容——哪怕一个字符——整个缓存都会失效。
截至 2026 年 9 月 10 日,DeepSeek V4 Flash 缓存未命中输入高峰价 ¥2.00/百万(闲时 ¥1.00),而缓存命中仅 ¥0.04/百万(闲时 ¥0.02)——折扣高达 98%。V4 Pro 比例大致相同:高峰 ¥9.00 未命中 vs ¥0.30 命中。闲时两者再减半。
这让缓存成为 DeepSeek 计费模型中最大的成本杠杆。稳定的 system prompt 加上可复用上下文几乎等于免费发送,而一次性独有 prompt 则按全价计费。
保持 system prompt 绝对固定并置于每次请求开头。把动态内容——用户查询、时间戳、结果——放在可复用前缀之后。像发布版本一样管理 prompt 改动,并在每次变更后观察命中率趋势。
四种用量 CSV 类型让缓存变得可见:每个请求都会导出 input_cache_hit_tokens 与 input_cache_miss_tokens,因此仅凭账单数据就能测出真实命中率与各 Key 的缓存经济。
上下文缓存是机制(存储并复用前缀计算),缓存命中率是指标(以低价计费的输入 token 占比)。良好的 prompt 结构能提升命中率,这正是获取缓存收益的方式。
缓存命中输入按未命中输入的约 1/50 计费——约 98% 的折扣。在高命中率负载下,可令总输入成本降低一半以上。
会。DeepSeek 缓存从第 1 个 token 起前缀匹配,prompt 开头的任何改动都会使整个缓存失效。请把 prompt 改动当作代码发布,并在之后监控命中率趋势。
我们正在使用这些工具自己进行开发和部署,好用,就推荐了。
订阅时,您可获得 $5,直接抵消首月 go 费用。
可能是全球最便宜的 deepseek v4 flash 模型调用。
获得 $300 测试 Vultr 云平台
被推荐用户需活跃 30 天以上且消费 $10–$25
无需复杂性即可部署任何内容(我们的各种前/后端服务和容器)
连接您的代码仓库,Railway 会处理其余部分
云服务器、云数据库、COS、CDN、短信等云产品特惠热卖中
AWS的优质替代品,我们应用COS替代S3
¥16 元全平台通用代金券,领取之日起 180 天内有效
全场景产品矩阵,支撑 AI 应用全流程落地
世界上最好用的 AI 终端工具之一
我们可以直接在 Warp 中使用各种顶级模型,而不离开终端