
上篇文章聊了 Token 是什么,这一篇只谈钱:大模型 API 的这笔账到底该怎么算、成本又能从哪里省下来。
先给结论。报价单上的统一口径是"元/百万 Token",但同一个模型其实有两个价:你发进去的内容按输入价算,AI 生成的内容按输出价算。省钱的路子有三条,效果从小到大依次是:让它少说废话、把重复内容走缓存、把简单任务换成便宜模型。其中最后一条最狠——公开价目表上不同模型的输出价能差出几十倍,靠选型省下来的钱,往往比谈折扣多得多。
另外,买套餐时还会碰到另一套口径:积分。它像话费余额,不同模型扣得快慢不同,但你只需要盯一个数。再搭配"一折模型",在模型够用的前提下,同样的积分能多跑不少次。
看价目表最容易漏掉的一点:输入和输出是两个价,而且输出通常明显更贵,一般是输入的数倍,具体比例因厂商、模型和上下文档位而异。
原因不难理解:读一段话,模型是"看",一次能扫完;写一段话,得一个字一个字地生成,更耗算力。
多轮对话里,前面的内容每轮都要再送一遍,所以聊得越久,输入这部分越大。而推理模型的"思考过程"也按输出计费,开了深度思考,账单涨得比想象中快。
第一条省钱办法就藏在这里:让它少说废话。同一个问题,要求"直接给结论、别复述题目、别写总结",砍掉的恰恰是贵的那一半。
对于那些反复送进去的重复内容,部分接口支持按缓存价计费,命中时比正常输入价便宜不少。
什么场景用得上?客服机器人(每次都带同一套话术规则)、文档问答(反复贴同一份手册)、代码助手(每次都带同样的项目约定)。这些场景里重复部分占比很高,缓存的效果最明显。
怎么用上?想让缓存命中,把固定不变的内容放在最前面,别每次改动它;一旦改动了已缓存的那段前缀,就可能命中不了。另外缓存的写入与存储本身也可能计费,是否支持、怎么算,以各模型的官方说明为准。
这是三条路里效果最大的。公开价目表上的模型,输出价从每百万几块钱到上百块都有,最贵的和最便宜的能差出几十倍。如果所有活都用最贵那个跑,等于用专家的价钱做整理格式的事。
下面用一张表直观感受下量级(数字是每百万 Token 的公开报价示意,不代表某一家价目表):
模型档位 | 输入(元/百万token) | 输出(元/百万token) |
|---|---|---|
便宜档小模型 | 1 | 2 |
主力编程模型 | 6.5 | 27 |
主力通用模型 | 8 | 28 |
顶配旗舰 | 20 | 100 |
两个规律一眼就能看出来:同一个模型,输出都比输入贵(主力和旗舰差三到五倍);跨模型看,顶配旗舰的输出价是便宜档的 50 倍。
所以更值得先做的不是谈折扣,而是按任务复杂度盘一遍:哪些活其实不需要最贵的模型。改错别字、整理格式、简单分类、抽取字段这类活,便宜模型往往够用;复杂推理、关键决策、难代码再上旗舰。这么一分,省下的量往往很可观。折扣可以谈,但先得把活分开。
按量付费看的是"元/百万 Token";而包月套餐通常换一种说法,叫积分。它的用处是把多个模型的账合成一个数,你不用记每个模型多少钱一百万,只看还剩多少分。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。