挑中转站,很多人盯着「模型多不多、单价廉不廉」。但真正让账单失控的,往往不是这两样——是输出 token,以及你根本没察觉的上游静默换模型。
一、9 月 14 日那晚,你的模型被偷偷换了
DeepSeek 在 9 月 14 日 12:00 起正式退役 V4 Pro:所有写成 deepseek-v4-pro 的请求,被静默路由到 V4.1 Flash,并按 Flash 价格计费。官方原话是「有序退役」,代码里写死 V4 Pro 的请求依旧返回 HTTP 200——只是背后跑的已经是另一个模型、另一个价。
业内把这种变更叫最危险的形状:nothing falls over, so nothing alerts(什么都不报错,所以没人报警)。你的评测脚本假设的是 V4 Pro 的推理深度,分数会在生产环境里悄悄漂移,而日志里一个错都没有。
更扎心的是:首批开发者实测,V4.1 Flash「速度确实更快了,但烧钱也更快」。
教训只有一句:上游静默换模型、静默调价,是你账单上对不上的最大盲区。挑平台,先看它换模型/调价会不会提前告诉你。
二、为什么输出 token 才是吞金兽
输出 token 是模型一个一个顺序生成的,算力刚性、省不下来,所以定价普遍是输入的 3 到 10 倍:
- GPT-4o mini:输出约 4× 输入
- Claude Sonnet:约 5×
- GPT-5 档:约 8×
落到你最熟悉的 DeepSeek V4 Flash(闲时,元/百万 tokens):
- 输入·缓存命中:0.02
- 输入·缓存未命中:1.00
- 输出:4.00
输出是缓存命中输入的 200 倍。而 9 月 10 日那轮降价,缓存命中砍了 60%、输入砍了 33%,输出只动了 11%,而且绝对值仍卡在涨价前的两倍价(涨前输出 2 元,现在还是 4 元)。
一句话:降得最狠的是缓存命中,最烧钱的输出几乎没让。长文生成、代码补全、Coding Agent、深度推理——这些场景烧的全是输出 token。
三、4 个开关,把账单砍下来
每个都能在一个下午改完,省下来的钱会叠加。
开关 1:给每个请求设 max_tokens 封顶。 输出是供应商利润最厚的一段,也是你唯一能「一不小心归零」的段。一个失控的生成(死循环、啰嗦的推理轨迹、停不下来的总结)一次就能吐出上万 token。设个上限,既省钱也让延迟可预期。
开关 2:打开上下文缓存。 多轮对话、Agent、RAG 这类长上下文,系统提示词和文档前缀每次都重发。DeepSeek 的自动缓存把重复前缀降到缓存命中价(0.02 元),直接省约 90%。三个习惯让它生效:系统提示词保持稳定、别把变量拼到前缀最前面、复用稳定会话上下文。
开关 3:按 key / 按项目设硬上限。 Agent 一旦失控(工具调用循环、重试风暴),单 key 能在几分钟内爆量。给每个 key、每个项目设月度/日级硬上限,等于给账单装了保险丝。
开关 4:逐笔明细可出证。 账单真正的坑不在单价,在于「出了事你才发现不了」。每次调用给 request_id 级明细、思考 token 单列、能导出对账,异常(某 key 突然翻 10 倍、某模型偷偷被替换)当天就能看见。
四、Yady 的取舍:不靠隐藏乘数赚钱
我们把上面 4 件事,变成承诺写进服务:
- 固定倍率,不随时段浮动。 上游有峰谷差价,由我们承担,不转嫁给你。
- 上游换模型、调价,提前公告,不做静默变更。 9 月 14 日那种「你账单对不上还不知道」的事,在 Yady 不会发生。
- 逐笔 request_id 明细可导出,思考 token 如实入账,不掺水。
- 方舟官方授权 + 境内链路不出境 + 不留存不训练。
也诚实交代短板:方舟通道当前只激活 1 个模型(DeepSeek-V4-Flash)。输出 token 的单价由上游定,我们不在上面加任何隐藏乘数——你看到的就是上游价叠固定倍率。
五、30 秒自检:你的账单经得起 4 问吗?
- 每个请求都设
max_tokens了吗? 没设的,先设。 - 系统提示词稳定、能命中缓存吗? 命中即白捡那 60% 降幅。
- 每个 key 有硬上限吗? 没有的,Agent 场景迟早爆一次。
- 每笔调用能给 request_id 级明细、能导出对账吗? 给不了的,换平台。
省不省、省多少,你的调用日志说了算,不是「降价 60%」的通稿说了算。把 4 个开关打开,再拿自己的账单算一遍——比看任何价格表都准。