首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >Token 计费全解析:输入输出两个价、缓存、积分与模型选型省钱指南

Token 计费全解析:输入输出两个价、缓存、积分与模型选型省钱指南

原创
作者头像
Archive
发布2026-09-03 15:18:05
发布2026-09-03 15:18:05
470
举报
文章被收录于专栏:随笔随笔

上篇文章聊了 Token 是什么,这一篇只谈钱:大模型 API 的这笔账到底该怎么算、成本又能从哪里省下来。

先给结论。报价单上的统一口径是"元/百万 Token",但同一个模型其实有两个价:你发进去的内容按输入价算,AI 生成的内容按输出价算。省钱的路子有三条,效果从小到大依次是:让它少说废话、把重复内容走缓存、把简单任务换成便宜模型。其中最后一条最狠——公开价目表上不同模型的输出价能差出几十倍,靠选型省下来的钱,往往比谈折扣多得多。

另外,买套餐时还会碰到另一套口径:积分。它像话费余额,不同模型扣得快慢不同,但你只需要盯一个数。再搭配"一折模型",在模型够用的前提下,同样的积分能多跑不少次。

一次调用,其实收了两笔钱

看价目表最容易漏掉的一点:输入和输出是两个价,而且输出通常明显更贵,一般是输入的数倍,具体比例因厂商、模型和上下文档位而异。

原因不难理解:读一段话,模型是"看",一次能扫完;写一段话,得一个字一个字地生成,更耗算力。

  • 输入(便宜的那半):你发给它的内容——提示词、贴进去的文档、前面几轮的对话记录,都算输入。
  • 输出(贵的那半):它写给你的内容——回答、生成的代码、改写后的文案,都算输出。

多轮对话里,前面的内容每轮都要再送一遍,所以聊得越久,输入这部分越大。而推理模型的"思考过程"也按输出计费,开了深度思考,账单涨得比想象中快。

第一条省钱办法就藏在这里:让它少说废话。同一个问题,要求"直接给结论、别复述题目、别写总结",砍掉的恰恰是贵的那一半。

第二次能不能便宜些:缓存

对于那些反复送进去的重复内容,部分接口支持按缓存价计费,命中时比正常输入价便宜不少。

什么场景用得上?客服机器人(每次都带同一套话术规则)、文档问答(反复贴同一份手册)、代码助手(每次都带同样的项目约定)。这些场景里重复部分占比很高,缓存的效果最明显。

怎么用上?想让缓存命中,把固定不变的内容放在最前面,别每次改动它;一旦改动了已缓存的那段前缀,就可能命中不了。另外缓存的写入与存储本身也可能计费,是否支持、怎么算,以各模型的官方说明为准。

最狠的一招:把活派给对的模型

这是三条路里效果最大的。公开价目表上的模型,输出价从每百万几块钱到上百块都有,最贵的和最便宜的能差出几十倍。如果所有活都用最贵那个跑,等于用专家的价钱做整理格式的事。

下面用一张表直观感受下量级(数字是每百万 Token 的公开报价示意,不代表某一家价目表):

模型档位

输入(元/百万token)

输出(元/百万token)

便宜档小模型

1

2

主力编程模型

6.5

27

主力通用模型

8

28

顶配旗舰

20

100

两个规律一眼就能看出来:同一个模型,输出都比输入贵(主力和旗舰差三到五倍);跨模型看,顶配旗舰的输出价是便宜档的 50 倍

所以更值得先做的不是谈折扣,而是按任务复杂度盘一遍:哪些活其实不需要最贵的模型。改错别字、整理格式、简单分类、抽取字段这类活,便宜模型往往够用;复杂推理、关键决策、难代码再上旗舰。这么一分,省下的量往往很可观。折扣可以谈,但先得把活分开。

买套餐时的另一套口径:积分

按量付费看的是"元/百万 Token";而包月套餐通常换一种说法,叫积分。它的用处是把多个模型的账合成一个数,你不用记每个模型多少钱一百万,只看还剩多少分。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 一次调用,其实收了两笔钱
  • 第二次能不能便宜些:缓存
  • 最狠的一招:把活派给对的模型
  • 买套餐时的另一套口径:积分
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档