AI Token 价格虚高十倍?别急着怪模型,先把这笔账算明白
很多团队做 AI 项目时,都经历过这个场面:
产品演示很惊艳,老板当场点头;账单出来那一刻,财务脸都绿了。
一开始只是一个智能客服,后来加了知识库、联网搜索、长上下文、多轮追问、结果校验、自动生成报告……每个功能看着都“只多一点 token”。月底一汇总,费用直接从几千跳到几十万。
派拓网络(Palo Alto Networks)CEO Nikesh Arora 曾抛出一个很尖锐的判断:当前 AI token 的市场价格,可能比合理水平高出约十倍。
这个数字够狠,也不必急着把它当成精确结论。它真正值得大家警惕的地方在于:你付的钱,未必都在为模型智能买单。大量预算,可能消失在错误的架构、低效的调用和不透明的报价里。
Token 到底是什么?为什么它能把预算“吃”没?
可以把 token 理解成模型读写文本时使用的计费颗粒。
它不是严格按“字”算,也不是严格按“词”算。中文、英文、代码、标点,拆分方式都不同。对使用者来说,不需要天天盯着分词器,但必须记住一件事:
你发给模型的内容要钱,模型回给你的内容也要钱。
一个看似普通的问答,往往不只是“用户问题 + AI 回复”。真实请求常常长这样:
系统提示词
+ 角色规则
+ 历史聊天记录
+ RAG 检索到的文档片段
+ 用户本次提问
+ 工具调用结果
+ 模型输出
用户只问了一句:“这个订单为什么退款?”
后台却可能塞进了 20 页操作手册、近十轮对话、整段订单 JSON、几份相似的知识库文档。用户觉得自己问了 10 个字,你的系统却可能给模型喂了几万 token。
钱就是这么烧掉的。悄无声息,还特别合理——每一层看起来都有“存在的必要”。
“虚高十倍”到底高在哪?不是模型贵,是整条链路都在加价
把 token 单价理解成一杯咖啡的标价,很容易误判。
你看到的是咖啡 30 元,实际付的钱里还含着商场租金、配送费、包装、平台抽成、损耗、门店空转和品牌溢价。AI 也是这个逻辑。
1. GPU 没跑满,闲置成本照样摊进价格里
训练和推理都依赖昂贵的 GPU。问题是,很多算力并没有长期满载。
企业业务流量有明显高峰:
- 上午 10 点,客服咨询猛增
- 下午 3 点,内部员工集中生成报告
- 半夜 2 点,几乎没人调用
云厂商和平台要为高峰预留资源。低谷期闲着的 GPU,也得有人买单。最终,这部分成本往往被折算进每百万 token 的报价里。
你买的不是纯粹的“模型输出”,还在为别人的峰值流量交房租。
2. 企业常常把大模型用在“小题大做”的任务上
一个客服机器人要判断“用户是在问物流,还是在问退款”,本质是分类任务。
很多团队却直接上旗舰模型,配一大段提示词,要求它分析语气、提炼意图、引用条款、输出 JSON。一次判断,成本比实际需要高出一截。
更离谱的是,有些系统连下面这些活都交给昂贵模型:
- 文本去重
- 关键词匹配
- 格式校验
- 敏感词拦截
- 日期提取
- 是否为空的判断
这就像请资深律师来帮你检查 Excel 单元格有没有填日期。能做,当然能做。只是账单也会很“资深”。
3. 长上下文被当成了万能药
模型上下文变长,是好事。可不少团队把它用成了偷懒工具。
知识库里搜到什么,就一股脑塞进去;历史会话不裁剪,全部保留;用户上传 200 页 PDF,整本丢给模型总结。
结果通常是三连击:
- 输入 token 激增
- 响应变慢
- 回答质量未必更好
模型不是资料仓库。给它喂太多杂讯,它也会迷路。
4. 中间层太多,价格和效率一起变模糊
很多企业的调用链是这样的:
业务系统
→ AI 应用平台
→ Agent 框架
→ 网关服务
→ 云厂商模型平台
→ 基础模型
每加一层,都可能增加:
- 服务费
- 并发冗余
- 日志与存储开销
- 重试次数
- 数据传输成本
- 不透明的套餐溢价
中间层不一定没价值。问题在于,没人把每层成本单独拉出来看。
于是大家只知道“AI 很贵”,却不知道贵在哪儿。
先别砍预算:用这张成本公式,把钱花在哪儿找出来
做 AI 成本管理,别只盯着“每百万 token 单价”。那是供应商给你看的价格标签,不是你真实的业务成本。
建议把单次调用成本拆成这几项:
单次任务成本
= 输入 token 成本
+ 输出 token 成本
+ 检索成本
+ 工具调用成本
+ 重试成本
+ 审核与人工兜底成本
+ 基础设施分摊成本
再往业务层翻译:
每解决一个客服问题花多少钱?
每生成一份合格报告花多少钱?
每转化一条销售线索花多少钱?
这才是老板和业务负责人真正该看的数。
一个简单例子
假设你的销售助手每天处理 1 万次请求:
- 每次输入:8000 token
- 每次输出:1000 token
- 平均有 15% 请求因为超时或格式错误重试一次
- 每次还要调用一次联网搜索
看起来只是“聊天机器人”,实际已经是一个持续燃烧的推理工厂。
如果团队只压缩模型输出,却不处理 8000 token 的输入上下文,省下的钱很有限。真正的大头,往往藏在历史消息、检索文档和重复调用里。
一套能直接落地的 Token 降本方案 🧰
把请求按难度分流,别让旗舰模型包打天下
给任务做三档路由:
| 任务类型 | 推荐方案 | 典型场景 | | --- | --- | --- | | 规则型任务 | 代码、正则、传统分类器 | 提取订单号、检查字段、敏感词过滤 | | 常规语言任务 | 小模型或高性价比模型 | 摘要、标签、意图识别、改写 | | 高风险复杂任务 | 强模型 + 人工兜底 | 合同审阅、代码诊断、复杂决策建议 |
别迷信“一个最强模型解决一切”。模型选型应该像打车:两公里路没必要叫豪华商务车。
给 RAG 设置“检索预算”
知识库检索最容易失控。
可以直接定几条硬规则:
- 每次默认只取 3~5 个最相关片段
- 单个片段控制在合理长度,避免整页硬塞
- 相似度低于阈值的内容不进入上下文
- 文档先切块、去重、清洗,再建立索引
- 对常见问题做答案缓存
用户问“怎么申请退款”,系统没必要把退款政策、物流政策、会员政策、隐私政策全部扔进去。相关内容够用就行。
砍掉无意义的聊天历史
多轮对话很容易变成“记忆垃圾场”。
一个实用做法:
- 保留最近 3~6 轮关键对话
- 更早的内容压缩成一段摘要
- 用户切换话题后,主动清空无关上下文
- 工具返回的大段原始数据,不要永久挂在聊天记录里
比如用户已经从“查询订单”切换到“投诉商品质量”,三十分钟前的物流轨迹没必要继续占着上下文。
控制输出长度,别让模型写作文
不少提示词里写着:“请尽可能详细地回答。”
这句话很贵。
更好的写法是:
用不超过 5 条要点回答。
每条不超过 40 字。
信息不足时直接说明缺少什么,不要猜测。
输出长度受控,成本更稳,用户也不用在一屏废话里找答案。双赢。
给重试设上限,防止故障时账单爆炸
接口超时、JSON 格式不对、工具调用失败,都可能触发自动重试。
平时看不出问题。流量一高,重试会像复制粘贴一样把调用量翻倍。
建议直接落规则:
- 单次请求最多重试 1~2 次
- 重试前缩短上下文或切换备用模型
- 相同错误进入熔断,不要无限循环
- 每天统计重试 token 占比
如果你的重试成本超过总 token 的 5%,就该查日志了。这个洞通常比想象中大。
别只问“token 单价多少”,采购时要追问这 6 个问题
供应商报价再漂亮,也别急着点头。把下面的问题抛出去:
- 输入和输出 token 是否分开计费?
- 缓存命中后,token 是否有折扣?折扣规则是什么?
- 限流、超时和重试产生的请求如何收费?
- 是否收取最低消费、平台服务费或专属实例费用?
- 价格是否包含日志、向量库、联网搜索、内容审核等配套能力?
- 能否导出按模型、应用、部门、接口维度拆分的明细账单?
拿不到明细账单的 AI 服务,后面大概率也很难管住成本。
别接受“你们这个月大概用了这么多”的模糊报表。AI 成本和广告投放一样,不能归因,就无法优化。
避坑清单:这些操作最容易把 Token 烧成烟花 🎇
- 把整份 PDF 原文塞进提示词:先解析、分段、检索,别整包投喂。
- 每次请求都携带完整用户画像:真正需要的字段才传。
- 所有任务默认调用最贵模型:建立模型路由,按难度派单。
- 让模型反复输出固定格式:能用模板、代码生成的,就别让模型临场发挥。
- 没有缓存机制:高频 FAQ、固定文档摘要,缓存一次能省很多次调用。
- 只看总账单,不看调用链:总账单只能让人心痛,链路分析才能找到病灶。
- 忽略失败请求:失败不代表免费。很多失败请求,token 已经扣了。
一个更现实的判断:Token 会降价,乱用模型的代价不会自动消失
模型能力会进步,硬件会迭代,推理效率也会继续提高。长期看,token 单价大概率会往下走。
可别把希望全押在“以后会更便宜”。
因为业务方也会同步加码:上下文更长、Agent 更复杂、工具调用更多、用户量更大。单价降了,使用量可能涨得更猛。就像硬盘越来越便宜,大家存的视频却越来越大。
真正能让你每天少烧一笔钱的,不是等报价单变薄,而是建立成本意识:
每一次模型调用,都要有明确的业务价值;每一段送进上下文的内容,都要经得起一句追问——它真的有必要吗?
把这句话贴在 AI 项目看板上,能帮团队避开不少昂贵的“聪明方案”。