2026年8月16日的价格表
DeepSeek 在 2026 年 8 月 16 日调整 API 定价,表面上是一次降价,实际上把价格拆成了一张调度表。V4-Flash 峰时输入缓存命中每百万 token 0.014 美元,缓存未命中 0.44 美元,输出 1.32 美元;V4-Pro 峰时对应为 0.044 美元、1.32 美元和 3.96 美元,谷时统一减半。
若只看最便宜的输入价,模型确实越来越便宜;若看完整任务,价格正在从 token 转向思考。低价入口决定试错会继续增加,任务结构才决定最终成本,工程调度决定这轮红利能留下多少。
这套定价还引入了更强的调度约束。两个模型都支持 100 万上下文和最高 384K 输出,Thinking mode 默认开启;峰时覆盖 UTC 01:00-04:00 与 06:00-10:00,其余时间为半价谷时。并发限制也分层,Flash 为 2500,Pro 为 500。
价格表背后的意思很直接:模型厂商不再只卖单位生成能力,也在卖缓存命中率、时间窗口、并发额度和推理深度。每一项都能被工程优化,也都可能在粗放的 agent 里变成隐性账单。
V4-Pro 的产品化进一步放大了这个变化。它在 2026 年 8 月 13 日正式商用,reasoning effort 支持 low、high 和 max,并提供 Responses API 与 Codex 集成优化。
对交互式产品,这意味着可以按任务选择思考强度;对 agent,这意味着默认配置会变成成本和延迟的乘数。一个任务多走十轮,每轮多想几千 token,看到的就不是单价,而是系统账单。
占生成量87%的思考token
Simon Willison 对 Qwen 3.8 27B 的本地测试给出了最直观的案例。这个模型默认 reasoning effort 为 xhigh,最大上下文 262144。让它在 SVG 里画一只鹈鹕,模型花了约 21 分钟,思考 token 22276 个,输出 3223 个;关闭 reasoning 后,同题只花 137 秒,输出 3715 个 token,但质量明显下降。
按思考 token 除以思考与最终输出合计计算,思考部分约占 87%,速度差接近十倍。代价差不在输入,而在看不见的推理过程;使用者若只记录最终输出,就会把主要成本漏掉,也会低估任务的商业可用性。
这不是孤例。他在视觉定位测试里也发现,开启 reasoning 时 bounding box 表现强,关闭后位置出错。也就是说,思考并不是厂商为了涨价添加的装饰项,在很多任务里就是能力的一部分。关掉它确实能省钱和省时间,但错误率、返工和人工校验会把成本换一个科目重新记回来。
要注意,DeepSeek 和 Qwen 的 reasoning effort 是厂商特定参数,档位不能直接等同。案例的价值不在比较两个模型的强度等级,而在证明同一任务的隐藏推理过程会显著改变时间、质量和成本。
开发者真正要管理的,是任务成本而不是 token 成本。一个完整任务至少包含六项:缓存未命中输入、reasoning token、最终输出、等待时间、失败重试和并发机会成本。前四项写在账单和监控里,后两项经常只体现在团队效率与用户流失里。模型越便宜,越要把这些项放在同一个函数里看。
Agent 会把每一个默认值放大。搜索、工具调用、状态读取、代码修改、测试回滚,每一步都可能触发一次模型调用。如果每次调用都默认高强度思考,agent 的延迟会从几秒变成几分钟,成本会从几美分变成几美元。
如果全部关闭思考,工具链又可能在小判断上反复失败。这里的核心不是思考越多越好,而是把 reasoning effort 当作路由策略,而不是全局开关,也不是上线前的临时配置。
4%缓存折扣的路由清单
缓存是另一条分界线。DeepSeek 新价表里,V4-Flash 峰时缓存命中价格不到未命中的 4%,V4-Pro 也约为未命中的 3%。这不是小优惠,而是架构设计的回报。
稳定系统提示、工具描述、代码上下文和检索语料应该尽量进入可复用层;变化中的用户输入和临时指令则留在未命中侧。谁把上下文设计成稳定结构,谁就能拿到价格表里最大的折扣。
峰谷调度同样值得进工程流程。日报、批量评估、离线测试和语料处理可以放到半价窗口;客服、交易辅助、交互式编码和 agent 循环更关心响应速度,不适合机械错峰,也不该由拍脑袋决定。
成本优化的关键不是把所有请求拖到夜里,而是把任务分成延迟敏感、成本敏感和吞吐敏感三类,再分别设定路由。这是推理调度的术,也应该是 agent 架构里的显性策略。
这里需要一个概念:思考密度。它指完成任务所消耗的 reasoning token 与最终输出、任务价值和错误代价之间的关系。高密度适合数学证明、复杂代码修改、投资归因和跨系统编排;低密度适合格式转换、摘要、简单分类和已知流程执行。思考密度不是模型参数,而是工程治理指标。
解释力的边界也要说清。思考密度适合解释 token 账单和等待时间,不适合直接衡量智能水平。reasoning token 多,可能代表问题难,也可能代表模型绕路;reasoning token 少,可能代表高效,也可能代表没有检查关键分支。必须结合成功率、返工率和人工审核率,才能判断一个任务的合理密度。
对开发者,落地清单并不复杂。第一,把 reasoning effort、thinking mode、cache hit rate、reasoning tokens、输出 token、失败率和端到端时长写入日志。第二,为任务建立成本基线,而不是只比较模型目录价。第三,把低风险批量任务放到谷时,把高风险交互任务保留在高吞吐路径。第四,缓存稳定上下文,压缩工具描述,减少 agent 每轮重复携带的材料。
产品经理也要换口径。过去问模型多少钱一次,现在要问一次任务多少钱、多久完成、失败后谁兜底。一个便宜但需要三次重试的模型,可能比一个贵但一次通过的模型更贵;一个快速但边界判断差的模型,也可能把成本转移到用户投诉和人工复核。token 价格只是入口,任务价格才是产品经理应该看的单位。
2027年前的3个情景
未来一年的三个情景可以这样看。基准情景是模型厂商继续细分缓存、峰谷和思考定价,开发者把推理路由写进标准架构。上行情景是推理优化让 reasoning 成本快速下降,agent 在保持质量的同时把延迟压进交互容忍区间。下行情景是默认思考继续膨胀,agent 多轮循环把成本和等待时间推高,企业被迫限制自动化范围。
什么信号说明本文判断错了?如果新模型的 reasoning token 大幅减少,质量却没有下降;如果缓存和峰谷价差被竞争压缩到无关紧要;如果 agent 成功率提高后不再需要多轮重试;如果开发者的账单结构重新由最终输出主导,那么思考涨价就只是这一代模型的临时现象。
反过来,若 API 报表里 reasoning token 占比持续上升,这个判断会越来越成立。那时,推理预算会像当年的云计算预算一样,从可选项变成架构治理的默认项。
模型降价的道,不在于把每百万 token 的标价打到更低,而在于让每一次思考花在值得的地方。生成已经便宜,判断仍然昂贵;输出可以压缩,返工很难压缩。下一代 AI 应用的成本优势,会来自会分配思考的人,而不是只会切换最便宜模型的人。
Sources
DeepSeek API Docs,DeepSeek API Pricing,2026-08-16
DeepSeek API Docs,DeepSeek V4-Pro GA 公告,2026-08-13
DeepSeek API Docs,DeepSeek API 首页,2026-08
Simon Willison,Qwen 3.8 27B,2026-08-16
uapis.cn 知乎热榜,DeepSeek 新定价与开发者价格讨论,2026-08-17