DeepSeek 缓存命中率是输入 token 中按「缓存命中」低价而非全价计费的比例——越高越好,因为缓存命中输入最低仅需未命中单价的 1/50。
DeepSeek 的用量导出会为每个请求包含两行输入 token 数据:input_cache_hit_tokens(缓存命中)与 input_cache_miss_tokens(缓存未命中)。缓存命中率就是缓存命中量除以总输入 token(命中 + 未命中)。
命中率 50% 意味着一半输入 token 走了缓存通道。由于 DeepSeek 对缓存命中按未命中价的约 1/50 计费,这一个数字对账单的影响极其显著:从 20% 提升到 60%,输入成本可降低一半以上。
真实 DeepSeek 负载的命中率通常在 40% 到 96% 之间。例如在 OpenCode Go 上,DeepSeek V4 Flash 的真实缓存命中率达 96%,这就是它实际成本远低于标价的原因。
实用区间:低于 20% 通常意味着稳定前缀太短,或可变内容在 prompt 中太靠前;20–40% 可用但仍有空间;40–60% 很强;60%+ 对客服、模板化抽取等重复工作流非常优秀。
DeepSeek 采用前缀匹配:从第一个 token 开始缓存计算结果,因此 prompt 开头的任何变动都会使缓存失效。保持 system prompt 固定、把动态内容放在最后、把 prompt 改动当发布版本一样管理。
查看真实命中率最直接的方式:把账单 CSV 上传到用量分析仪表盘,图表会一目了然地展示每日缓存命中率和各 Key 的命中/未命中对比。
是——缓存命中输入按未命中价的约 1/50 计费,命中率每提高一个百分点都在降低输入成本。更高的命中率没有坏处,唯一的问题是能否通过 prompt 结构达成。
真实负载通常在 40% 到 96% 之间。OpenCode Go 上的 DeepSeek V4 Flash 维持在 96%。低于 20% 说明 prompt 前缀不稳定;对多数生产团队 40% 以上即健康。
把 DeepSeek 账单 CSV 上传到用量分析仪表盘即可。它从 input_cache_hit_tokens 与 input_cache_miss_tokens 两列计算命中率,并展示每日趋势和各 Key 明细。
我们正在使用这些工具自己进行开发和部署,好用,就推荐了。
订阅时,您可获得 $5,直接抵消首月 go 费用。
可能是全球最便宜的 deepseek v4 flash 模型调用。
获得 $300 测试 Vultr 云平台
被推荐用户需活跃 30 天以上且消费 $10–$25
无需复杂性即可部署任何内容(我们的各种前/后端服务和容器)
连接您的代码仓库,Railway 会处理其余部分
云服务器、云数据库、COS、CDN、短信等云产品特惠热卖中
AWS的优质替代品,我们应用COS替代S3
¥16 元全平台通用代金券,领取之日起 180 天内有效
全场景产品矩阵,支撑 AI 应用全流程落地
世界上最好用的 AI 终端工具之一
我们可以直接在 Warp 中使用各种顶级模型,而不离开终端