2026 年 9 月 10 日 12:00,DeepSeek 官方对 V4 Flash 系列正式降价:闲时输入缓存命中从每百万 Token 0.05 元降到 0.02 元(-60%),缓存未命中 1.5→1 元(-33%),输出 4.5→4 元(-11%),高峰时段仍为空闲的 2 倍。同一天,V4.1 Flash 开启内测,官方称「能力更强、速度更快、成本更低」。
这是个好消息——但只说对了一半。对真正管账单的人来说,更该警惕的是另一件事:模型厂商的单价越来越不代表你的真实成本。一个把「思考」算进账单、却从不让你看见的推理模型,可能让你的实际支出是「可见回答」的 3-10 倍。
本文把 2026 年 LLM API 账单里最容易被忽略的三道隐藏乘数摊开,并说明 Yady 怎么把账做「透」。
一、看不见的「思考税」:thinking token 按输出价计费
带推理能力的模型——OpenAI 的 o 系列与 GPT-5.x(reasoning_effort)、Google Gemini Thinking(thinkingBudget)、Claude extended thinking、DeepSeek R1 类——在给出可见回答之前,会先在内部跑一段「思考链」。这段 token:
- 由模型生成、计费按输出价;
- 通常不返回给你看,只返回计数;
- 体量往往是可见输出的 3-10 倍;
- 缓存、批处理都不折扣(每次都现生成,无异步批处理折扣)。
实测例子(来自公开计费拆解):一个 14 token 的回复「Got it, I've refunded order #8842.」,背后可能是 4809 个 reasoning token 按输出价计费——不可见部分约占该轮成本的 300 倍以上。一个客服 Agent 每天 500 通、每通 8 轮、平均每轮 3000 thinking token,仅思考 token 一项就是约 1200 万 token/天,按 GPT-5 thinking 的 $10/MTok 约 $120/天、合 $3600/月,叠在输入、可见输出、缓存之上。
更隐蔽的是:thinking token 吃掉你的 max_output_tokens 预算。一次高 effort 推理爆发可能先耗掉 80% 的输出额度,可见回答才开始——参数设小了还会出现「返回 200 OK、content 为空、却全额计费」的空响应失败。
竞品从不讲这件事。TeamoRouter、硅基流动、OpenRouter 的卖点永远是「模型多、便宜、好接」,从不会提醒你:你为那个「会思考」的模型,可能付了 10 倍于肉眼所见的价格。
二、峰谷分时 + 上下文阶梯:单价之外的第二道乘数
就算没有推理模型,单价也常常「骗人」:
- 峰谷分时:DeepSeek 官方至今采用峰谷分时,工作日 9:00-12:00、14:00-18:00 高峰,价格翻倍。你以为的「每百万 4 元输出」,高峰其实是 8 元。
- 上下文阶梯:Gemini 在超过 200K 上下文后,整段请求按 2 倍 计费,不是超出部分、是「全段翻倍」。
- 系统提示词空耗:没有开 prompt caching 的长系统提示,每次请求都按全价输入重算;开了缓存通常能省 50-90%,但很多平台默认不告诉你开没开。
- 重试乘数(详见本站前文《重试税》):一次超时可能被计费 3 次。
这些乘数是相乘的:高峰 + 长上下文 + 推理思考 + 未缓存系统提示,真实成本可以是标价的 10 倍以上。这解释了为什么 DeepSeek 9 月降价后,有开发者实测「综合调用成本约降 40%」——降幅取决于缓存命中率、输入输出比,而不是单价数字本身。
三、DeepSeek 降价,跟你这边什么关系(诚实说)
必须说清楚边界:Yady 的上游是火山引擎方舟官方授权通道,不是 DeepSeek 开放平台直连。方舟侧对 DeepSeek-V4-Flash 的定价以方舟公示为准,我们不代方舟承诺降价幅度。
但对你(调用方)侧,Yady 一直坚持三条,与上游是否调价无关:
- 固定倍率、不随时段浮动:本站对你侧一律 1.27× 固定倍率,不随调用时段浮动;上游峰谷差价由我们承担——你不会因为「踩到高峰」被收 2 倍。这一点直接对冲了上面第二节的「峰谷分时」陷阱。
- 上游调价提前公告、不静默变更:上游官方调价(如本次 DeepSeek V4 Flash 09-10 降价)我们提前公告,绝不静默变价。
- 不承诺全网最低价:我们卖的是「可审计的干净调用链」,不是最低单价。把账做透,比把价压到看不见更值钱。
四、Yady 把账单做「透」:逐笔明细可导出
钱袋子安全的核心,不是「更便宜」,而是「看得清」。Yady 默认给你一条可审计的调用链:
- 逐笔明细可导出:每笔调用带
request_id、真实模型名/版本、input/outputtoken 拆分、调用时间、渠道。若你调用的模型(含未来上架的推理模型)返回 thinking token 字段,我们照样记进明细,不替你藏。 - 固定倍率可反算:对照 1.27× 固定倍率,你能用明细直接算清每一分钱,无隐藏项。
- 数据不留存、不用于训练:你的 Prompt 与返回内容不出境、不被拿去训练。
- 方舟官方授权、境内链路:上游授权可证,来源合法。
一句话:竞品让你「猜」账单里发生了什么;Yady 让你「导」出每一笔,自己算。
五、给你的对账清单(立刻能做)
- 看 thinking token 行:用推理模型时,在明细里找 reasoning/thinking token 字段——它通常 3-10× 于可见输出。占比过高,说明你在用高 effort 跑简单任务。
- 看 output/input 比:多数编码任务健康比 3:1-5:1;输出远超输入,多半在生成冗余内容。
- 看时段标记:确认你的通道有没有峰谷翻倍;Yady 用户无此顾虑(我们承担差价)。
- 开启逐笔明细导出:做月度对账,按
request_id归原因重试、异常长上下文、思考 token 占比。 - 别为「会思考」的模型无脑付溢价:很多简单任务,非推理模型效果等价却零思考税。
---
Yady API(yczc.top)· 方舟官方授权通道 · 固定 1.27× 倍率不随时段浮动 · 逐笔明细可导出 · 数据不留存不训练 · 上游调价提前公告。把账做透,比把价压到看不见更值钱。