价格
两档模型,按需选择
单位:元 / 百万 tokens。输入分「缓存命中」与「缓存未命中」两档,命中缓存可大幅降低成本。
| 计费项 | deepseek-v4-flashV4-Flash-0731 | deepseek-v4-pro旗舰V4-Pro-0813 |
|---|---|---|
| 输入 · 缓存命中 | ¥0.02 | ¥0.025 |
| 输入 · 缓存未命中 | ¥1 | ¥3 |
| 输出 | ¥2 | ¥6 |
💰 计费:消耗 token 数 × 单价
🎁 余额:充值余额与赠送余额并存时,优先扣赠
📌 口径:¥0.025 即 2.5 厘 / 百万 tokens
模型能力
两档模型共享的核心能力
V4 系列在长上下文、思考模式与接口兼容上保持一致的规格。
上下文 1M tokens
单次可承载约 75 万字的中文上下文,长文档与代码库一次放得下。
输出最高 384K tokens
单次响应的最大输出长度,适合生成长篇内容与大批量结果。
思考模式
默认开启深度思考,可在非思考与思考模式间切换,适配不同延迟需求。
JSON 输出
结构化 JSON 输出,便于下游程序直接解析。
工具调用
Function Calling 能力,可接入外部函数与 API 编排智能体。
双接口兼容
同时支持 Responses API 与 Anthropic API,迁移成本更低。
Chat 前缀补全 Beta
对话前缀补全能力,面向需预填充回复场景。
FIM 补全 Beta
填充式代码补全,仅支持非思考模式,适合 IDE 场景。
并发上限
flash 2500 / pro 500,详见下方并发说明。
API 端点
OpenAI 兼容格式
https://api.deepseek.com
Anthropic 兼容格式
https://api.deepseek.com/anthropic
并发与计费
配额与扣费规则
并发限制
deepseek-v4-flash2500 并发
deepseek-v4-pro500 并发
计费规则
- 计费费用 = token 消耗量 × 单价,按模型实际用量累加。
- 费用从充值余额或赠送余额中扣除;两者并存时,优先扣赠。
- 价格可能调整,请以官方页面为准并定期核对。
近期价格调整提示
DeepSeek 官方计划近期整体上调 API 定价,预计涨幅较大。具体调整幅度与生效时间以官方公告为准,建议在调用前再次核对官方价格页面。