训练是建厂,推理是开工
训练是把海量数据喂给模型、调整参数的过程,一次性投入,贵在建厂。外界估计 GPT-4 这个量级的训练成本在几千万到上亿美元,几千张高端 GPU 跑几个月。推理是模型上线后每次回答问题的过程,单价便宜,但量大,是持续的水电费。
这个区分对 PM 很实在。你算 API 成本、定免费额度、设计会员定价,算的都是推理的账,按 token 计费的那张价目表就是推理成本加利润。你跟老板汇报「为什么用户量涨了成本扛不住」,根源也在这里:训练费是一次性的,推理费随调用量线性涨。
这个成本结构也解释了行业分工:掏得起几亿美元练基座的就那几家,绝大多数公司的选择是调 API 或部署开源模型。所以 PM 做技术选型时,「从零自研训练」基本可以直接划掉,你的决策空间在「调谁家的 API、要不要私有化部署、要不要微调」。
泛化是及格线,过拟合是常见病
泛化是模型在没见过的数据上也能答对,这是机器学习存在的意义,否则背答案就行了。过拟合是模型把训练数据背下来了,连里面的噪声和巧合一起背,一到真实环境就露馅。
PM 要警惕的落地版本是:demo 在精心挑选的 case 上惊艳,上线遇到真实用户就拉胯。我见过一个客服意图识别项目,内部测试集准确率 95%,上线掉到 80% 出头,原因是真实用户说话带方言、错别字,一句话里还混着两个意图,测试集里根本没有这些。教训就一条:评测集必须贴近真实流量分布,而且要随线上数据定期更新。
准确率不是唯一指标,容错看场景
推荐系统猜对六成就有商业价值,医疗辅助诊断做到 99% 也没人敢全自动。差别不在技术,在错误的代价。GitHub 公开提过 Copilot 的建议接受率在三成上下,听着不高,但接受的都是白捡的效率,拒掉的只是浪费一次 Tab 键,容错极高。
还要分清两种错误的代价。内容审核里,放过一条违规内容(漏报)可能惹来监管,误删一条正常内容(误报)只是得罪一个用户,所以审核阈值宁可偏严。推荐场景反过来,推错十条用户手指一划就过去了。定指标时 PM 要拍板的是阈值放哪边,不是只接一个准确率数字。
所以 PM 该问的不是「准确率多少」,而是「错的那部分长什么样、谁来兜底」。错 5% 的意图识别,如果这 5% 能平滑转人工,产品就能上;如果错误集中在退款这类高敏感意图上,再多人工兜底都悬。错误的分布比平均值重要得多。
这些概念怎么用在日常工作里
估可行性时问三个问题:有没有数据、数据有多少、标注要花多少钱。冷启动期最大的成本往往不是算法,是攒数据。定验收标准时别只写离线准确率,要加上线上指标,比如解决率、转人工率、满意度,离线高线上低的情况太常见了。
评审需求时,我习惯把「能不能用 AI 做」翻译成三件套:数据从哪来,验收看什么指标,错了谁兜底。三件套都有答案,这需求才排得上期;缺任何一个,先补作业再谈开发。
验收时还有个常见分歧:算法同学报的指标是测试集上的,而测试集经常被调参过程「看光了」,相当于开卷考。重要项目我会要求留一份谁都不碰的隐藏测试集,只在验收时用一次,这个数字才接近真实的泛化能力。
跟算法沟通时,放弃「能不能做到 100%」这种问法,换成「错误集中在哪类 case 上、迭代一轮能压到多少」。前者只能得到敷衍,后者才是排期的依据。