DeepSeek-V4 系列 · API

DeepSeek API
定价与模型

V4 系列两档模型,上下文 1M tokens、输出最高 384K tokens。按百万 tokens 计费,缓存命中输入低至 ¥0.02,同时兼容 OpenAI 与 Anthropic 两种接口格式。

输出价格 · 每百万 tokens
deepseek-v4-flash ¥2
deepseek-v4-pro更强 ¥6
缓存命中输入最低
¥0.02 / 百万 tokens
价格

两档模型,按需选择

单位:元 / 百万 tokens。输入分「缓存命中」与「缓存未命中」两档,命中缓存可大幅降低成本。

计费项 deepseek-v4-flashV4-Flash-0731 deepseek-v4-pro旗舰V4-Pro-0813
输入 · 缓存命中 ¥0.02 ¥0.025
输入 · 缓存未命中 ¥1 ¥3
输出 ¥2 ¥6
💰 计费:消耗 token 数 × 单价 🎁 余额:充值余额与赠送余额并存时,优先扣赠 📌 口径:¥0.025 即 2.5 厘 / 百万 tokens
模型能力

两档模型共享的核心能力

V4 系列在长上下文、思考模式与接口兼容上保持一致的规格。

上下文 1M tokens
单次可承载约 75 万字的中文上下文,长文档与代码库一次放得下。
输出最高 384K tokens
单次响应的最大输出长度,适合生成长篇内容与大批量结果。
思考模式
默认开启深度思考,可在非思考与思考模式间切换,适配不同延迟需求。
JSON 输出
结构化 JSON 输出,便于下游程序直接解析。
工具调用
Function Calling 能力,可接入外部函数与 API 编排智能体。
双接口兼容
同时支持 Responses API 与 Anthropic API,迁移成本更低。
Chat 前缀补全 Beta
对话前缀补全能力,面向需预填充回复场景。
FIM 补全 Beta
填充式代码补全,仅支持非思考模式,适合 IDE 场景。
并发上限
flash 2500 / pro 500,详见下方并发说明。

API 端点

OpenAI 兼容格式
https://api.deepseek.com
Anthropic 兼容格式
https://api.deepseek.com/anthropic
并发与计费

配额与扣费规则

并发限制

deepseek-v4-flash2500 并发
deepseek-v4-pro500 并发

计费规则

  • 计费费用 = token 消耗量 × 单价,按模型实际用量累加。
  • 费用从充值余额赠送余额中扣除;两者并存时,优先扣赠
  • 价格可能调整,请以官方页面为准并定期核对。

近期价格调整提示

DeepSeek 官方计划近期整体上调 API 定价,预计涨幅较大。具体调整幅度与生效时间以官方公告为准,建议在调用前再次核对官方价格页面。