指数在跌,账单在涨:这不是数据打架
先摆两个同周发生、方向完全相反的事实。
一边在跌。 2026 年 9 月 1 日,数据服务商 Silicon Data 编制的大语言模型 token 支出指数(彭博代码 SDLLMTK)首次跌破每百万 token 1 美元关口,报 0.97 美元,创该指数 2025 年底推出以来的最低纪录。它是按使用量加权计算全球主流大模型实际成交价的核心基准,从 5 月底的 2.04 美元一路跌到 8 月初的 1.16 美元,再跌破 1 美元,仅过去 7 天又跌了 8.6%。
一边在涨。 2026 年 8 月 16 日 16:00 UTC(北京时间 8 月 17 日 00:00)起,DeepSeek 对 V4 系列启用峰谷分时定价。V4-Flash 输出价从原来的每百万 token 2 元,变成谷时 4.5 元、峰时 9 元——涨幅 125% 到 350%。路透对这次调整的总结是:整体涨幅在 50% 到 1100% 之间,取决于模型、token 类型和调用时刻。
同期的第三方追踪数据更直白:DeepSeek 提价约 3 到 12 倍之后,调用量还在涨;智谱 API 均价上涨 101%,同期 token 用量增长超过 40 倍。致同咨询交易支持服务合伙人梁伟在接受《21世纪经济报道》采访时的判断是,行业正在从「白菜价」转向分层定价——高附加值场景的用户真正买的不是更便宜的 token,而是更低的任务失败率和更稳定的生产系统。
那为什么指数还在跌? 因为它算的是使用量加权均价。海量低价轻量模型、缓存命中价、近乎免费的引流层被大量调用,把均价一路往下拽;而你主力在跑的那个模型、那个时段、那次缓存未命中,恰恰是被涨价的部分。
换句话说:指数跌是别人的,账单涨是你的。 这两件事完全可以同时成立。
2026 年新增的三个隐性计费变量
过去两年选 API,大家比的都是「同一个模型,谁便宜」。2026 年开始,单价表只能解释你账单的一部分——下面这三个变量,才是近几个月账单突然变贵的真正原因。
变量一:时段——同一个请求,价格能差 1 倍
峰谷分时的规则非常硬:
| 项 | 规则 | | --- | --- | | 高峰时段 | 北京时间 09:00–12:00、14:00–18:00(工作日) | | 低谷时段 | 其余全部时间;周六、周日全天按低谷计 | | 谷峰关系 | 低谷价 = 高峰价 ÷ 2 | | 计价锚点 | 按平台收到请求的时刻计,不是处理完成的时刻 | | 时区基准 | 峰时段以 UTC 定义,周末判定以北京时间为准 |
以 DeepSeek-V4-Flash 为例,单位:元 / 百万 token:
| token 类型 | 调价前 | 低谷 | 高峰 | 低谷涨幅 | 高峰涨幅 | | --- | --- | --- | --- | --- | --- | | 缓存命中输入 | 0.02 | 0.05 | 0.10 | +150% | +400% | | 缓存未命中输入 | 1.00 | 1.50 | 3.00 | +50% | +200% | | 输出 | 2.00 | 4.50 | 9.00 | +125% | +350% |
两个容易被忽略的补充:2026 年 8 月 23 日 00:00 起,官方把周末全天统一按低谷计费,相当于每周高峰时段从 49 小时压缩到 35 小时,变相让利 14 小时。而火山引擎方舟对自家托管的 DeepSeek-V4 系列按量计费同样执行高峰时段自动 ×2,费用中心的「用量明细」里每笔请求都带一个「计费时段标识」字段(PEAK / OFF_PEAK),可以逐条核对。
这意味着:同一个模型、同一段 prompt、同样的 token 数,09:30 发出和 13:30 发出,成本差整整一倍。 时间,第一次变成了 API 账单上的一个显性变量。
变量二:缓存——30 倍价差,比挑供应商更划算
这是三个变量里杠杆最大、也最常被忽略的一个。
还是 V4-Flash,低谷时段的输入:缓存命中 0.05 元,缓存未命中 1.50 元——相差 30 倍。高峰时段是 0.10 元对 3.00 元,同样 30 倍。
对比一下量级你就有感觉了:挑一家便宜 20% 的中转站,省下的是 20%;把缓存命中率从 20% 提到 70%,省下的是输入成本的一大半。后者的量级远大于前者。
提高命中率的方法不复杂,但必须写进规范,靠自觉没用:
- system prompt 放在请求最前面,且保持稳定。 缓存是从前缀开始匹配的,前缀一变,后面全部作废。
- 不要在前缀里插入时间戳、随机数、UUID、trace_id。 这是最常见的自伤行为——为了让日志好看,把
当前时间:2026-09-04 13:37:22塞进 system prompt 第一行,等于每次调用都是 100% 未命中。 - 多轮对话的历史顺序固定,只追加不重排。 排序变了,前缀就断了。
- 用
user_id参数做租户级 KV-cache 隔离。 官方支持该参数,既能提高命中率,也顺带解决多租户之间的调度与内容安全隔离。
变量三:时区——中国开发者是最吃亏的一群
峰时段是按 UTC 定义的,所以「你什么时候在上班」直接决定了你要不要付双倍。按 2026 年 9 月时区换算,当地工作日 09:00–17:00 落在高峰窗口的比例:
| 所在地 | 工作日 8 小时中落在峰时的时长 | 占比 | | --- | --- | --- | | 新加坡 / 中国(UTC+8) | 6 小时 | 75% | | 班加罗尔(UTC+5:30) | 4.5 小时 | 56% | | 伦敦(UTC+1) | 2 小时 | 25% | | 美东(UTC-4) | 0 小时 | 0% | | 美西(UTC-7) | 0 小时 | 0% |
北京时间的白天工作时段,几乎完整覆盖了两个高峰窗口——中国团队是最容易为峰时买单的一群人。反过来,一个面向美西用户的产品,白天调用基本碰不到峰时。
还有一个隐藏坑:峰时判定是「周一到周五(UTC)」,所以美西周日 18:00–21:00 属于 UTC 周一峰时,照样双倍。
如果调用量 24 小时均匀分布,峰时占 35/168 小时即 20.8%,混合倍率约 1.21×;但对一个「白天跑业务、晚上没流量」的典型中国 B2B 应用,这个倍率会显著高于 1.21×。
四步自查:先把钱花在哪弄明白
不要凭感觉调,先把数据拉出来。这四步只需要你自己的调用明细。
第 1 步:把调用明细按小时聚合,看峰谷分布。 导出逐笔明细,按「请求小时」分组统计输入/输出 token 与金额,标出 09–12、14–18 两个窗口的占比。如果这两个窗口占了你 60% 以上的量,那么错峰就是你的第一优先级。
第 2 步:算缓存命中率。 命中率 = 缓存命中输入 token ÷ 总输入 token。低于 30% 的,先别谈换供应商——你的前缀规范大概率有问题,这是白送的钱。
第 3 步:算输出 token 占比。 输出单价通常是输入的 2–3 倍,而且思考(thinking)过程的 token 也按输出计费。输出占比超过 40% 的应用,削输出比压输入更有效。
第 4 步:给任务打标签。 把你的调用分成三类:实时(用户在线等)、近实时(分钟级可接受)、批处理(小时级可接受)。只有第一类必须在峰时跑。 大多数团队会发现,真正必须实时的调用不到 30%。
四个省钱动作,按性价比排序
动作 1:错峰调度(见效最快)。 把第三类批处理任务——日报生成、离线摘要、数据清洗、批量 embedding、评测集跑分、历史数据回填——挪到 12:00–14:00、18:00–次日 09:00 和整个周末。工作量通常只是一个 cron 表达式或一个队列的延迟投递,成本直接减半。
动作 2:稳定前缀,提缓存命中(杠杆最大)。 按上文四条规范改造请求构造。特别是把 system prompt 里的时间戳、随机数挪到用户消息而不是系统前缀里。
动作 3:削输出。 非必要不开最强 reasoning effort;给每次调用设 max_tokens 上限防止失控;能用结构化模板(JSON schema)压缩的就别让模型自由发挥;把「让模型复述一遍问题」这类冗余输出删掉。
动作 4:分层调度。 分类、抽取、格式转换、简单改写这类标准化任务交给轻量模型;只在复杂推理、高精度生成等核心环节调用旗舰模型。这已经是 2026 年的主流做法——东方证券研报也指出,多模型分层调度与协同应用正成为行业新趋势,单一高价旗舰模型全覆盖的模式正在退场。
Yady API 这边:能给什么,给不了什么(如实交代)
诚实性是本站一贯的做法,这里把边界一次写清。
我们能给的:
- 上游是火山引擎方舟官方授权通道,不是账号池、不是共享 Key,来源口径可核验。
- 本站按固定倍率计价,不随调用时段浮动。 同一模型、同样 token 数,你 09:30 调还是 13:30 调,你付的钱一样。上游通道的峰谷差价由我们承担,你的账单是可预期的——不用一边写代码一边看表。
- 逐笔调用明细可导出,你可以按小时自行聚合,做上面那四步自查。数据不留存、不训练,原样透传。
- 人民币计价、1.27× 透明倍率、新用户赠额度、充值阶梯优惠(50 元 95 折 / 100 元 9 折 / 200 元 85 折 / 500 元 8 折)、单级 8% 邀请返利(无入门费、无层级抽成)。
我们给不了的:
- 不代客做调度。 错峰队列、缓存前缀规范、分层路由都是你应用层的事,本站只提供透明计费和可导出明细,不托管你的业务逻辑。
- 不承诺全网最低价。 我们的定位是「可预期、可核验、可追责」,不是「绝对最便宜」。如果你只看单价表,市场上确实有更低的报价。
- 模型广度目前受限。 方舟通道当前仅激活 1 个模型(DeepSeek-V4-Flash),多模型分层调度这件事,我们还在补。
- 上游若调整分时段结算,我们会提前公告,不做静默变更。 这一条是承诺。
一句话收尾
2026 年的 API 成本,已经从「选一家便宜的」变成「把时段、缓存、时区三件事管起来」。指数跌破 1 美元是真的,你的账单在涨也是真的——差别在于你是被这三个变量推着走,还是主动管理它们。
能自己管的,先把明细导出来做那四步自查。管不了的(比如上游通道的峰谷结算规则),选一个愿意把差价扛下来、把明细给你、把变更提前告诉你的供应商,就够了。