你多久没认真拆过 API 账单了
9 月 13 日到 17 日,2026 国家网络安全宣传周技术应用体验区在济南开张。很多人盯着「合规」两个字发愁,但落到钱袋子上最实在的一件事是:合规成本最终会反映在你的账单里。
可惜绝大多数人看账单只看一个总价,从不拆。今天我们把「调一次 API」拆开,你会发现自己至少多付了 4 笔冤枉钱。
调一次 API,其实有 6 笔账
别再只算「输入 + 输出」两笔。一次真实调用,账单上通常藏着 6 笔:
- 输入 token(prompt):你发过去的上下文,基础必要;
- 输出 token(completion):模型回你的内容,基础必要;
- 思考 / 推理 token(reasoning):推理模型先「想」再答,这部分往往不可见、无缓存折扣、还吃掉你的 max_output 额度——前面我们专门讲过它的隐藏黑洞;
- 缓存命中 vs 未命中:稳定前缀(如固定 system prompt)命中缓存,单价远低于标准输入价;没命中就按全价走,两者能差几十倍;
- 失败 / 重试请求计不计费:网络抖一下、超时一次,很多站重试重试,失败的那几次也照样扣;
- 流式中断 / 超时计费边界:客户端断了、超时了,那段已生成未收完的 token 算不算你的钱。
6 笔里,4 笔是冤枉钱
把可优化、最容易超支的 4 笔单独拎出来,照着砍:
- ① 不该开的推理:问答、摘要、结构化抽取这类非推理任务,别开着 thinking。开着就是白白为「思考过程」付钱;
- ② 没命中的缓存:把 system prompt 写稳、跨请求复用同一前缀,命中缓存档单价直接下来。Yady 上游方舟缓存命中低至 0.02 元 / 千 token 起;
- ③ 失败也扣:查明细里「失败请求」有没有单独的计费标记。没有标记 = 你可能正在为没拿到的回复买单;
- ④ 为中断买单:客户端做好断点续传、把超时设合理,别让半截流式输出悄悄计费。
竞品为什么不讲这些
TeamoRouter 主推 0 折福利版 / 低价、硅基流动和 OpenRouter 主推模型数与生态——但很少主动披露三件事:思考 token 单不单列、失败请求计不计费、缓存命中价和标准价差多大。而这三件,恰恰是成本黑洞最爱的藏身处。
低价 ≠ 真便宜。一个把 6 笔全摊开、每一项都能在明细里核对的平台,才叫「钱袋子安全」。
Yady 的诚实做法(不掩饰)
我们把这 6 笔做成能当场验的真东西:
- 固定 1.27× 倍率:不随调用时段浮动,上游峰谷差价我们担;
- 缓存命中低至 0.02 元 / 千 token:方舟官方授权通道,把可缓存部分真缓存住;
- 逐笔明细如实记录:每次调用的失败状态、思考 token 都单列,可核对、不藏进隐藏乘数;
- 数据不留存、不用于训练:你的 Prompt 不被拿去练模型。
同时我们不掩饰:方舟当前仅激活 1 个模型、不承诺全网最低价、不代办算法备案、不替你承担输出端合规责任。
30 秒自查
打开你现在的账单,照 6 笔逐条核对:思考 token 单列了吗?缓存命中价公示了吗?失败请求有没有计费标记?流式中断怎么算?四笔冤枉钱,你砍掉几笔?