商业化与增长

算力成本怎么摊进定价里?毛利怎么守住?

91学AI·2026/8/14·9 阅读

先算清单次服务成本,这是一切的地基

推理成本的算法不复杂:每次请求的输入 token 乘输入单价,加输出 token 乘输出单价,再乘上失败重试、多轮上下文膨胀带来的放大系数。难的是很多人忘了放大系数。一次看似简单的「用户问一句」,背后可能是塞了几万字 RAG 上下文的请求,实际成本是表面 token 量的三五倍。Agent 类产品更夸张,一个任务跑二十轮工具调用,成本是普通对话的几十倍。

算出来之后,把它换算成「每个日活用户每天烧多少钱」,再乘 30,你就得到了单用户月成本——这个数字跟你的订阅价一比,毛利立刻现形。我见过一个 AI 陪伴产品,重度用户单用户月推理成本 80 多块,会员费收 30,卖得越多亏得越多,这不是生意,是慈善。

用户成本是幂律分布的,别按平均值定价

AI 产品的使用强度极其不均:经验上头部 5% 的重度用户能烧掉 40% 甚至更多的算力。如果你按平均成本定价,等于轻度用户补贴重度用户,而重度用户往往是工作室、爬虫、套利者,你补贴的不是忠诚客户,是薅羊毛的。

这就是订阅制的「自助餐问题」,解法有三个,现实中通常组合用:一是额度制,订阅含固定额度,超额降速或转按量付费,Cursor 现在就是这个结构;二是公平使用条款,明面上不限量,但保留对异常使用的限速权——这条路 Cursor 2025 年走过,沟通不好就是公关灾难,我的建议是宁可明码标价也别玩暗限;三是分层定价,把重度用户识别出来引导到更贵的档位,200 美元的 ChatGPT Pro 干的就是这件事。

压成本的五个手段,按性价比排序

第一是模型路由。不是所有请求都需要旗舰模型,简单分类、改写、摘要走小模型,成本能砍一个数量级。一套好的路由系统能把平均推理成本压掉一半以上,这是毛利保卫战的头号武器。

第二是缓存。相同或相似请求的结果缓存住直接返回,高频场景(比如客服、FAQ 类)缓存命中率做到 30% 不难,等于白捡三成毛利。

第三是上下文瘦身。系统提示词、RAG 召回内容、历史对话,每一块都要审计。把 8000 token 的召回内容精排到 3000 token,成本立降六成,很多产品的成本问题其实是不肯做减法的懒惰问题。

第四是批处理和异步。非实时需求(报告生成、批量处理)走离线队列,用低谷算力或批量折扣,成本又能砍一半。

第五才是蒸馏和自研小模型,投入大、周期长,适合量已经足够大、前四招榨干之后的阶段。

毛利红线定多少

SaaS 行业惯例是毛利 75% 以上才算健康,AI 产品短期内到不了,我的判断是分阶段设线:早期验证期毛利可以是负的,烧钱换数据换心智,这没问题;进入收费验证后,毛利至少要转正并看到通往 50% 的路径;规模化阶段冲 60-70%。如果一门生意在可预见的成本曲线上永远到不了 50% 毛利,要么是定价错了,要么是这个产品形态本身不成立。

别忘了一个利好:推理成本一直在降

同等能力的模型推理价格,2023 到 2025 年降了接近两个数量级,DeepSeek 这类高效率模型又把行业底价往下拽了一截。这意味着今天算不过来的账,十八个月后可能自动算过来了。聪明的做法是把成本下降预期设计进商业模式里:早期用限额扛住成本,把「更便宜更强」的红利留给毛利扩张,而不是第一时间全部让给用户去打价格战。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.