你上个月给大模型 API 付了多少钱?如果只能报出一个总数,你并不孤单——但这恰恰是最危险的状态。
2026 年的真实数据是:企业 AI 支出里有 26% 被白白浪费(eCorpIT 实测)。钱不是被「单价」吃掉的,而是被「说不清花在哪」吃掉的。当你的账单只是一行总数字,你既看不到是哪个用户烧的、哪个功能烧的、哪次会话烧的,也根本无从优化。
这一篇,我们聊一个竞品几乎不提、但直接关系到你钱袋子的命题:成本归因——把每一分钱,追到「谁、在哪个功能、哪次会话」。
一笔账单背后的「糊涂账」:成本散在四个账本里
传统 IT 成本,你至少能在云厂商控制台里按项目、按资源、按标签拆开看。但 AI API 支出一进 LLM,就散了。
eCorpIT 2026 年的复盘指出,AI 成本往往分散在四类账本里:模型推理费、向量库/缓存费、Agent 编排与工具调用费、以及被重试/超时悄悄重复计费的「隐形税」。四类账本各自独立、互不通气,月底你手里只有一张被聚合过的总单。
更要命的是,连美国联邦层面的 AI 预算框架都在补课:FOCUS 1.4(2026-06-04 批准)至今仍不含 AI 模型身份或 token 列——也就是说,官方预算口径都还没把「这一笔钱对应哪个模型、多少 token」记进去。你指望靠聚合账单自查,天然少了一层坐标。
传统云 FinOps 在 LLM 上为什么失灵
很多团队照搬云的 FinOps 方法论来管 LLM 成本,结果五个地方集体翻车(LeanOps 2026 归纳):
- Cost Explorer 看不到 LLM 内部:你能看到「调了一次 API、花了多少钱」,但看不到这次调用里 prompt 多少 token、completion 多少 token、命中了几次缓存。账单停在「黑盒」层。
- 预留容量不适用:云的预留实例能打折,但 LLM 推理価格随模型、随上游峰谷浮动,没有「锁一年省三成」的玩法。
- Right-Sizing 不映射到模型选型:云上把 4 核升 8 核能省钱;LLM 上把 GLM-4-9B 换成 V4-Flash 可能反而更贵或效果崩盘,单纯「缩配」行不通。
- Tagging 不进供应商账单:你在自家系统打的标签,供应商那张发票上一个字都不带——这是最致命的一条,我们下面专门拆。
- 异常检测漏掉 Agent 失控:传统监控盯着 CPU、QPS;Agent 半夜自己循环调用、把预算烧穿,告警系统可能毫无波澜。
Tagging 救不了你:token 调用没有「资源」可贴标签
云 FinOps 的精髓是「给资源打标签,按标签分摊成本」。但 LLM 的每一次推理是无状态的一次性调用,没有一个长期存在的「虚拟机」「数据库实例」能让你贴标签。
DoiT 2026 说得很直白:对 token 调用做 tagging 是无效的,因为根本没有可被贴标签的资源对象。归因这件事,必须移到「流量层」——也就是你发请求的那一刻、那一个 key、那一次会话,由中转/网关来记。
换句话说,能给你做成本归因的,不是你账单右下角的总价,而是你调用链路上那一层能不能把每一笔请求留痕。
真正的烧钱黑洞:Agent 失控 + 网关不拦
为什么归因这么紧迫?因为「不归因」的代价比以前高出一个数量级。
nx1.io 2026 的实测:同样的任务,Agent 类工作负载的 token 消耗是普通聊天的 5 到 30 倍。一个多步 Agent 每步把历史上下文重发一遍,第 1 步 8k token,第 10 步可能已经涨到 6 万到 10 万 token——你根本意识不到。
更狠的是:很多网关只在请求完成后才计费,请求前不评估预算。一个失控的 Agent 跑了一整夜,账单天亮才告诉你「超了」。反过来说,做得好的 AI 网关会在请求前就评估预算——被拦截的那一次,成本是零。
所以「钱袋子安全」在 Agent 时代被重新定义:不是「单价够不够低」,而是「谁能在我烧穿之前拦住我,并且告诉我钱烧在了哪」。
把账单追到「谁·哪个功能·哪次会话」——你能拿到什么
竞品大多只给你一张聚合账单 + 一条「本月已用 X 元」的提示。真正能帮你归因的中转站,至少该给你这四样:
- 逐笔明细可导出,到 request_id 级:每一笔调用都能对应到「哪个 key、哪个模型、什么时间、多少 token、命中没命中缓存」。这是归因的原材料。
- 按密钥额度上限 / 环境隔离:一个 key 就是一条成本线。给生产、测试、各个功能、各个大客户各发一个 key,账单天然按 key 切开——key 即维度。
- 多智能体拆 key 归因:每个 Agent 用独立 key,哪个 Agent 失控、哪条 Agent 链路最烧钱,一眼可见,而不是混在总数里猜。
- 固定透明倍率:单价可预期,归因出来的是「真实用量 × 固定倍率」,不会被峰谷或暗调倍率污染。
把这几样凑齐,你的账单就从「一行总数」变成「一张可下钻的表」:点开一个 key,看到它下面每个会话、每次请求的明细。
四步把成本归因做扎实(可抄作业)
- 一功能一 key,或一用户一 key:不要全公司共用一个 key。把 key 当成成本维度来设计,而不是当成「钥匙」来省。
- 环境隔离:dev / test / prod 用不同 key,甚至不同配额。否则测试脚本半夜刷爆,你会算不清是生产用户还是测试在烧钱。
- 拉逐笔明细按 request_id 对账:定期导出明细,按 key、按时间、按会话聚合,找出「top 烧钱会话」。这一步靠中转站给的明细接口,不靠你肉眼翻总单。
- 给 key 设硬额度上限:超了就封,而不是只发一条告警。告警是损失已经发生后才提醒你;硬上限是损失发生前就截断。Agent 失控场景下,差的就是这一道。
竞品为什么不讲「成本归因」
你看 TeamoRouter、硅基流动、OpenRouter 的定价页,比的是「多少折」「多少模型」「多好接」。没有人把「逐笔明细可归因」「按 key 拆账」「请求前预算拦截」当成卖点讲——因为这些恰恰是中转站最该做、却最容易被「低价叙事」盖过的基本功。
当一个平台只跟你谈「全网最低价」,却不谈「钱花在哪、能不能追、超了拦不拦」,你拿到的是一个更便宜的糊涂账,不是一个更可控的钱袋子。
诚实边界 + 本站能给什么
我们把话挑明:
- 能给:上游走方舟官方授权通道,固定 1.27× 透明倍率不随峰谷浮动;逐笔明细可导出、可溯源到 request_id 级;按密钥额度上限 + 环境隔离,让你的成本天然可按 key / 用户 / 功能 / 会话归因;上游调价提前公告,不做静默变更。
- 给不了 / 在补:方舟当前仅激活 1 个模型(广度短板,不掩饰);Agent 层 token 优化是你应用层自己的事,我们不代你写重试或收敛逻辑;不承诺全网最低价。
- 我们不做:不代你做内容审核、不代办备案、不替你担输出端或智能体行为责任;不改你的数据、不留存不训练。
成本归因不是一句口号。它意味着:当某天老板问「这个月 AI 钱花哪了」,你能打开一张表,指着某一行说「是 XX 功能、XX 客户的 XX 次长会话」——而不是对着总单挠头。
把账单追清楚,是你控住钱袋子的第一步。Yady 把这第一步,做成默认能力。