2026 年下半年,大模型 API 的价目表出现了一个诡异的景象:同一个人,打开两个不同的后台,看到的 DeepSeek-V4-Flash 报价能差出好几倍。一边是原厂在提价,一边是托管商在降价——两条反向运动的曲线同时出现,意味着「开源模型的权重、推理服务和最终产品」正在被彻底拆开。
这本来是好事:竞争让价格更透明。但对调用方来说,它也藏着一个老陷阱:最便宜的那一档,往往不是你真正买到的那一档商品。 这一篇,我们把「超低价」拆开看,顺便给你一套把账单算到最后一分钱的方法。
一条消息,两个价格:2026 下半年的定价权争夺战
8 月 17 日零时,DeepSeek 对 V4-Pro 正式版引入峰谷计费,新价全面生效。媒体算了一笔账:峰段输出价格涨到 27 元/百万 tokens,缓存未命中 9 元/百万 tokens,缓存命中 0.30 元/百万 tokens——分别是此前价格的 4.5 倍、3 倍、12 倍,空闲时段统一为峰段一半。
同一周,另一头的曲线却在向下。在 OpenRouter 这种聚合平台上,同一份 DeepSeek V4-Flash 权重,由数十家第三方服务商提供推理,最低报价低至 $0.05 / $0.16(输入/输出,每百万 tokens),约为官方低谷价的四分之一。
「抬价的是原厂对自己端点的定价权,压价的是别人拿同一份权重做托管的边际成本。」一位行业观察者这句话点破了本质:原厂牌价,已经不等于模型的市场服务价格。 你看到的「超低价」,很可能是别人用更低成本的芯片、量化、批处理、集群调度压出来的边际报价——它卖的是「推理算力」,不是「你以为的那份服务」。
三个事实:原厂在涨,托管商在降,菜单在缩
把最近半个月的动态摊开,会发现三件事同时发生:
- 原厂在抬价。 DeepSeek 之外,智谱 GLM Coding Plan 新版三档月费分别上涨约 141% / 261% / 130%,计费方式也从请求次数改成 Token 消耗积分制;非高峰时段才给 50% 抵扣。
- 托管商在打折。 OpenRouter 上 DeepSeek V4-Flash-0731 由 Open Inference、AkashML、NovitaAI 等多家报价,最低只有官方低谷价的约四分之一;国内 SiliconFlow 把 V4-Flash 从固定价改成峰谷分时后,峰段输入/输出也只比官方便宜 5% 上下,缓存命中价反而贵 3 倍。
- 模型菜单在缩。 硅基流动将于 2026-09-11 下线 Nex-N2-Pro、Qwen3.5-397B-A17B、MiniMax-M2.5 等多款模型;阿里云百炼也将在 2026-10-10 退役 30+ 个 legacy 模型 ID(qwen-turbo 等)。聚合平台的「模型越长越香」叙事,正在被上游自己的收缩打脸。
把这三件事放在一起看:上游在收紧、原厂在提价、第三方在清库存式甩卖。这时候冲着「全网最低」去选平台,买到的很可能是一个正在收缩、随时变价、来源说不清的通道。
![三件同时发生的事:原厂抬价、托管商打折、模型菜单收缩]()
超低价到底「省」了什么:五道看不见的账单
超低价不是魔法,它省掉的成本,最后都会以另一种形式回到你身上。最常见的五道「看不见的账单」:
- 没有 SLA。 最低报价往往对应「尽力而为」的算力,高峰期 503、超时、偶发降级是常态。你的生产流量赌在别人的闲时余量上。
- 来源不可核验。 报价最低的托管商,很少能说清模型来自哪条官方授权通道、能不能出示授权。ICP 许可证只证明你在境内合法经营信息服务,解决不了「上游模型来源是否合法」。
- 数据过代理 = 处理者风险。 中转站天然具备 TLS 终止与请求解密能力,你提交的代码、合同、对话都以明文经过它的服务器。一旦数据经代理并发生收集、存储、传输,中转站就依法成为《个人信息保护法》下的个人信息处理者——你(调用方)的数据出境、个保影响评估、单独同意义务被一并转嫁。
- 随时变价、静默变更。 没有提前公告义务的低价通道,今天 $0.05 明天可能 $0.20,你的成本模型一夜作废。
- 模型菜单在收缩。 依赖「二道转售」的聚合平台,上游一撤模型就消失,提示词、评测、用户预期全部重做。
换句话说,超低价省掉的是「可靠性、可追责、可核验、可预期」这四样东西。对跑着生产流量的团队,这四类缺失的代价,远高于每百万 tokens 省下的几毛钱。
![最便宜不等于最划算:用 1000 万 token 月负载算三种方案真实单价]()
算笔账:最便宜 ≠ 最划算
我们用一个常见的轻量负载算笔账:每月 1000 万输入 + 1000 万输出 tokens,跑 DeepSeek-V4-Flash 这类模型。
- 方案 A · 官方低谷价(理想态):按官方谷段输入约 ¥1.58、输出约 ¥4.75/百万 tokens 估算,月度约 ¥63。但低谷窗口有限(官方谷段才覆盖夜里、午休和周末),真实业务很难全落谷段。
- 方案 B · 聚合平台峰谷浮动:峰段输入 ¥3、输出 ¥9,缓存命中 ¥0.30——比官方只便宜 5%,缓存价反而贵 3 倍,且低价窗每天只有 6 小时(02:00–08:00)。业务绝大多数落在峰段,真实单价逼近官方峰段甚至更贵。
- 方案 C · 固定倍率通道(Yady):上游为火山方舟官方授权通道,报价 = 方舟通道价 × 1.27 固定倍率,不随峰谷浮动。输入约 ¥0.56、输出约 ¥1.68/百万 tokens(方舟通道价)×1.27 ≈ 输入 ¥0.71、输出 ¥2.13/百万 tokens,月度约 ¥28。无论你几点调用,单价都一样,成本可预期。
注意:方案 C 的单价之所以能压到接近官方低谷,是因为我们自己承担上游峰谷差价,不把浮动甩给用户。这不是「比官方更便宜」的谎言,而是「把不可预期的波动锁死成一口价」的生意。
把账单算到最后一分钱:Yady 的三招
我们不做「超低价引流」,只做「算得清账」。给你三招,把每一分钱对到明处:
第一招:固定倍率,不随峰谷浮动。 本站所有模型统一 1.27× 透明倍率,上游若调整分时段结算,我们提前公告、不做静默变更。你的预算表不用每天重算。
第二招:逐笔明细可导出,做三方对账。 每一笔调用都留下:上游凭据/发票 ↔ 本站账单 ↔ 你自己的调用日志。三张表对得上,才算账清。下面是给你的对账清单:
- 上游端:保留火山方舟的调用账单与授权凭据,确认模型来自官方授权通道、链路境内不出境;
- 本站端:在 Yady 控制台导出逐笔调用明细(含模型、tokens、耗时、金额),核对与上游是否一致;
- 你的日志:把业务侧请求 ID 与本站明细里的 request_id 关联,出现异常调用能追到具体哪一次。
第三招:阶梯充值折扣,充得巧更省。 本站充值阶梯折扣已生效:充 50 元打 95 折、充 100 元打 9 折、充 200 元打 85 折、充 500 元打 8 折。轻量试用选 50 档,长期生产直接 500 档把单价再砍 20%——前提是你能预估月度用量。叠加固定倍率,真实单位成本比「看起来便宜」的浮动价更可控。
诚实边界:我们能给什么,给不了什么
把话挑明,不嘴硬:
- 能给:方舟官方授权通道(链路境内不出境)、数据不留存不训练、逐笔明细可导出做三方对账、固定 1.27× 倍率 + 阶梯充值折扣、上游调整提前公告。
- 给不了(不掩饰):方舟当前仅激活 1 个模型,广度是短板;我们不承诺「全网最低价」——因为最低价往往对应上面那五道看不见的账单;我们也不代办算法备案、不替你承担输出端合规责任。
选平台别只看价格,先把来源、资质、保障三关过完。便宜如果建立在「来源说不清、数据过代理、随时变价、没有 SLA」上,那省下的几毛钱,迟早从一次生产事故里加倍吐出来。
四步自检:你的 API 账单靠不靠谱
照着这四条过一遍,答不上来的那条,就是你的风险点:
- 来源核不核得出? 能不能说清模型来自哪条官方授权通道、能不能出示授权?
- 价格变不变得动? 有没有「提前公告、不做静默变更」的承诺?你的成本模型稳不稳?
- 账单对不对得上? 能不能导出逐笔明细,做「上游凭据 ↔ 本站账单 ↔ 你的日志」三方对账?
- 兜底有没有? 有没有 SLA、出问题时的退款与数据迁出保障、可签的数据处理协议?
四条全过,才算把钱袋子真正锁死。Yady API 上游为火山方舟官方授权通道、数据不留存不训练、逐笔明细可导出、阶梯充值折扣已上线——把这篇的自检表用起来,比盯着「全网最低」那几个字管用得多。