Token 计价的基本功
Token 是模型的计费单位,中文大约 1 个汉字 1-2 个 token(各家分词器不同,经验上按 1 汉字 ≈ 1.5 token 估够用),英文大约 1 个单词 0.75 个 token。报价都是「每百万 token 多少钱」,而且输入和输出分开计,输出通常贵 3-5 倍——因为生成是逐个 token 串行算的,比读入贵得多。
以 2025 年前后的公开价格为参照系(价格变动快,这里只作量级参考):GPT-4o 级别大约输入 2.5 美元、输出 10 美元每百万 token;DeepSeek 把国产价格打到了输入几毛人民币、输出几块钱每百万 token 的水平,相差一两个数量级。这就是为什么同样一个功能,选不同模型成本结构完全不同。
算一笔真实业务的账
假设一个 AI 问答产品,每次请求:system prompt 加检索结果约 2000 token 输入,用户问题 100 token,模型回答 500 token 输出。单次成本 = 2100 × 输入单价 + 500 × 输出单价。用旗舰模型大约 2-3 分钱人民币,用 DeepSeek 级别可能不到 1 厘钱。再乘上量:10 万 DAU、人均每天 5 次请求,一天 50 万次调用,旗舰模型一天一万多块、一个月三四十万,便宜模型一个月几千块。
这个测算里最容易漏的是「隐藏输入」:RAG 塞进去的检索段落、多轮对话累积的历史消息、Agent 每一步的思考过程,全都是输入 token。对话到第 20 轮,历史消息可能滚到上万 token,每轮都要重新付一遍。所以长对话场景的成本是随轮次平方级涨的,产品必须有截断或摘要压缩策略。
成本怎么反向决定产品设计
成本意识会实实在在改变功能形态,举几个典型决策:
- 流式输出不只是体验优化,也是成本保护——用户看到一半发现答非所问会打断,省掉后面生成的输出费用。
- 长文档功能要设上限。「上传整本书全文问答」听着美好,一本 30 万字的书每次提问都带全文就是几十万输入 token,必须用 RAG 只取相关段落,或者先摘要再问答。Kimi 当年主打的超长上下文,实际产品里也配了用量限制,账算不过来。
- 对话轮次和上下文长度要做策略:超过 N 轮自动摘要压缩历史,或者新会话清零。这既控成本也防止上下文稀释导致的质量下降,一举两得。
- Agent 功能要按任务计价而不是按轮次。一个 Agent 任务跑下来几十次调用、十几万 token 很正常,如果按普通对话的免费额度放行,成本立刻失控。Manus 这类产品按任务积分收费,根源就在这。
定价和免费额度的设计
推理成本是订阅定价的锚。ChatGPT Plus 20 美元一个月,背后大致对应一个重度用户的推理成本加毛利;Cursor 20 美元档位包含固定额度的高速请求,超了降速或加钱,本质是把模型成本转成了额度体系。设计免费额度时记住一个经验比例:免费用户的成本要能被付费转化覆盖,行业里免费转付费通常只有个位数百分比,所以免费额度必须抠——按「让用户体验到核心价值的最小次数」来给,比如每天 3-5 次深度功能、轻量功能不限。豆包敢大规模免费,是因为背靠字节把推理成本压到了极低的水平,这是少数人的游戏,别盲目学。
降本的四板斧
一是 prompt 瘦身,system prompt 里废话每多 1000 token,百万次调用就多一笔可观的冤枉钱;二是缓存,重复率高的前缀(system prompt、常见问题的检索结果)用 prompt 缓存,命中部分价格能打到一折;三是模型路由,简单问题分流给小模型,实践里能省一半以上;四是输出约束,能要 200 字就别让它写 800 字,输出单价贵, verbosity 就是成本。