云计算百科
云计算领域专业知识百科平台

AI 账单为什么是预估的 30 倍:LLM 成本的 3 个陷阱和一套管理框架

上个月,一家 SaaS 客户的技术负责人来找我,开口就甩了一张账单截图:“我们去年 12 月上线 AI 助手,立项时的成本测算是一个月 8000 块。这是 8 月的账单,18 万。财务现在天天追着我要解释。”

我让他把账单拆给我看。供应商后台的报表只有一行总数——这本身就是第一个问题:你连钱花在哪都不知道。

花了两周,我们把他的调用链理了一遍,账单按 模型 × 调用方 × 场景 拆开之后,三个数字让他沉默了:客服场景的输入 Token 是输出的 14 倍(历史对话没截断,第 20 轮重发前 19 轮);38% 的调用是一次\”JSON 解析失败后重新生成\”(没人给失败重试记账);还有 5 个\”离线摘要\”任务,因为配置写错走了实时旗舰接口(同样的活,单价差 50%)。

AI 项目的财务事故,大多不是\”效果不行\”,而是\”成本失控\”——而失控的根源,是成本从头到尾没被当成一个工程指标管过。

今天把这套完整的成本管理框架拆开:先拆账单、再拆 3 个陷阱、然后讲单位经济学、最后给降本杠杆和预算告警机制。每一步都能直接抄。


一、先拆账单:钱到底花在哪

拿到月度账单,第一件事不是砍,是拆。拆的维度就三个:模型 × 调用方 × 场景。

前提是网关层记账:每一次模型调用,记录 model / api_key / scenario_tag / input_tokens / output_tokens,聚合出一张这样的表:

场景 模型 输入Token 输出Token 成本(元) 占比
客服-FAQ qwen-turbo 42,000,000 3,100,000 680 38%
客服-工单 qwen-max 8,500,000 2,900,000 1,020 57%
摘要-离线 qwen-turbo 96,000,000 1,200,000 95 5%

这张表会自己说话:

  • 客服-FAQ 的输入是输出的 13 倍——正常问答场景输入输出比在 2-4 倍,13 倍大概率是历史对话全量重发;
  • 客服-工单用旗舰模型占了 57% 成本——要回答的问题是\”每条工单都配旗舰模型吗\”;
  • 摘要-离线 9600 万输入 Token 只花了 95 块——如果这批任务走的是批量接口而不是实时接口,成本还能再砍一半。

没有这张表,一切优化都是猜。 而大多数团队没有这张表的原因,是记账埋点没在架构里——网

赞(0)
未经允许不得转载:网硕互联帮助中心 » AI 账单为什么是预估的 30 倍:LLM 成本的 3 个陷阱和一套管理框架
分享到: 更多 (0)

评论 抢沙发

评论前必须登录!