你看到各家大模型厂商都在说:「开启 Prompt Caching,缓存命中的输入只要标准价的 10%」。算下来能省 70%–90% 的输入成本,听起来是白送的省钱神器。于是你兴冲冲开启缓存,等着账单跳水。
但 2026 年一堆一线团队实测下来发现:缓存折扣这块「饼」,远没有宣传得那么香。更隐蔽的是——你省下的那部分,很可能根本没进你的口袋,而是被中转站悄悄吞了。
本文把这块被忽视的钱袋子黑洞,一层层拆开。
第一层陷阱:缓存「写入」本身要溢价,不是纯折扣
缓存折扣的真相是「读便宜、写贵」。命中缓存的读取确实便宜(OpenAI 90% off、Anthropic 仅收标准 input 的 10%、Google 同样约 10%),但把内容写进缓存的那一次,是要加价的。
2026 年 7 月 OpenAI GPT-5.6 的口径很典型:cache write 按标准输入价的 1.25× 计费,cache read 才是 90% off。也就是说,缓存只在「同一段内容被反复读取 2 次以上」时才回本;只命中 1 次,你反而多花了那 25% 的写入溢价。
这跟很多人「开缓存就省钱」的直觉恰恰相反:低频、一次性、或每次提示词都不同的调用,开缓存是亏的。
第二层陷阱:TTL 过期 + 前缀一改,缓存就「静默失效」
缓存不是永久的。各家 TTL 在 5–30 分钟之间(GPT-5.6 是 30 分钟、早期版本仅 5 分钟)。你的调用只要隔了这么久再来一次,缓存就 miss,整段按全价重算。
更阴的是「静默失效」:缓存依赖提示词前缀稳定。你把 system prompt、schema、示例放在开头,后面拼变量——这是对的;但一旦你为了「优化」重排了提示词顺序,或者把可变内容挪到了前缀位置,之前命中的所有 token 会整体回退到全价,而你的代码不会报任何错,账单却悄悄涨了。
行业里把这叫 caching can fail quietly:你永远不知道自己哪次「以为命中了」其实没命中。
第三层陷阱:最狠的,是中转站把折扣「吞了」
前两层是厂商机制本身的坑,你至少还能在明细里看到。第三层才是最该警惕的:很多中转站按固定倍率收你「全价 input」,上游给你的缓存命中折扣,根本没还给你。
为什么能吞?因为绝大多数中转站的账单只给你一个总数:「总 token × 倍率」。它不区分哪些 token 命中了缓存、哪些是全价。上游方舟/OpenAI 已经把缓存折扣体现在实际计费 token 里了,但中转站照旧按「未命中」的全价倍率收你——中间的差价,落在了中转站的口袋里,你完全无从发现。
这跟「模型偷换」「重试税」是同一类钱袋子黑洞:你看不见,所以它发生了。
怎么把这块黑洞堵上:要的就是「透明度」
把上面三层的坑翻译成选型标准,其实就是一张清单:
- 能不能核对真实 token 构成:每次调用,input/output 各多少、是否命中缓存,能不能逐笔看清楚?看不清,就给了「暗吃差价」的空间。
- 命中缓存是否如实少收:上游省了,你的账单是不是按比例降了,而不是「表面折扣、实际全价」?
- 调价是否提前公告、不静默变更:缓存政策、倍率一动,你是不是第一时间被告知,而不是某天账单莫名变厚?
这正是中转站该给你、却大多没给的「证据链」。
我们的做法:按实际计费 token 收,命中缓存就少收,不暗吃差价
Yady API 的计费是按方舟官方实际计费 token × 固定 1.27×。关键点在这里:上游命中缓存省下的 token,就按比例少收——不存在「你命中缓存、我还按全价收」的暗吃差价。倍率固定,上游峰谷差价我们承担,你每一笔成本可预期。
配套三样东西,把透明度钉死:
- 逐笔明细可溯源(request_id 级):真实模型名/版本、input/output token 构成,你能核对、能质疑,而不是对着一个笼统总数;
- 按密钥额度上限 + 环境隔离:dev/prod 不混账,单租户失控有硬顶;
- 上游调价提前公告、不静默变更:缓存政策或倍率一动,提前告诉你,绝不偷偷改。
竞品(TeamoRouter / 硅基流动 / OpenRouter)只跟你比「多少折、多少模型、多好接」,从不讲「缓存折扣透不透明、命中了有没有如实还给你」。把「算得清、看得透」做成默认能力,是我们在钱袋子这条线上和它们最根本的分野。
给开发者的四步自查
- 先算「命中次数」再开缓存:同一段前缀每天被读 2 次以上才值得开;低频接口关掉缓存反而更省。
- 锁死提示词前缀:system prompt / schema / 示例永远放最前且不变,变量只拼在后面,避免缓存静默失效。
- 让中转站给你逐笔明细:确保每次调用的 input/output 构成、是否命中缓存可核对、可按 key 隔离。
- 把倍率与调价政策问清:上游是否随缓存政策/峰谷静默调价?固定倍率 + 调价提前公告,才让你预算与合规都可预期。
你省的不该只是一句「缓存打 9 折」的口号,而是一份看得清、对得上的账单。把缓存这块黑洞自己堵住,再来谈「好接」和「便宜」——这才是能长期跑下去的 AI 成本账。
本站 Yady API 默认提供 request_id 级逐笔明细(可溯源真实模型名/版本/input/output token 构成)、按密钥额度上限 + 环境隔离、固定 1.27× 透明倍率(按方舟实际计费 token 计、命中缓存如实少收、不暗吃差价)、上游方舟官方授权链路境内不留存不训练。我们不代你做缓存优化、不承诺替你承担输出端责任;方舟当前仅激活 1 个模型(广度短板,不掩饰);不承诺全网最低价;上游调价提前公告不静默变更。详见 -> https://yczc.top/blog/cache-discount-trap-2026.html