公司真题库

【腾讯】以 32B 参数级别的模型服务为例,作为产品负责人,你会如何评估和规划上线初期的算力与硬件投入?

91学AI·2026/8/14·11 阅读

考察点

这道题出自腾讯 AI 产品经理一面(长上下文/算力方向),是 AI PM 里少见的「硬核算账题」。面试官不指望你比 Infra 工程师更懂 GPU,但要看你有没有「产品需求→流量预估→资源需求→成本」这条换算链路的意识。最常见的翻车答法是两种:一是完全不算账,「先上线再说」;二是拍脑袋买一堆卡,上线后利用率 5%。这题也考协作界面——算力规划是产品和 Infra 团队来回对齐的过程,产品经理要给出的是需求侧的输入(流量模型、SLA 要求、增长预期),不是替代工程师做技术选型。追问会往「流量预估偏了怎么办」「峰值怎么扛」「怎么降单位成本」方向走。

参考答案

第一步:把产品方案翻译成流量模型

算力规划的所有输入来自产品侧的三个数:目标用户量、人均调用频次、单次调用的 token 规模。举个例子:功能上线初期灰度给 100 万 DAU 的产品入口,预估渗透率 10%(10 万人会用),人均每天 5 次对话,每次平均输入 2K token、输出 500 token——这就是每天 50 万次请求、约 12.5 亿 token 的吞吐需求。

再把日均换算成峰值:互联网产品的调用不是均匀分布,早晚高峰通常是均值的 3-5 倍,还要留营销活动的突发余量。假设峰值系数取 4,峰值 QPS 大概是 50 万 ÷ 86400 秒 × 4 ≈ 23 QPS,首 token 延迟要求比如 2 秒内。这组数字就是甩给 Infra 团队的需求文档。

第二步:算显存账,定单实例形态

32B 模型是道明确的分水岭:FP16 精度下光权重就占约 64GB 显存,单张 80GB 的卡(A800/H800 级别)放不下,至少要 2 卡张量并行;如果用 INT8/FP8 量化,权重压到 32GB 上下,单卡能跑,但要在效果回归评测通过后才敢用——量化对长文本和复杂推理的影响要实测,不能只看跑分。另外 KV cache 是隐形的显存大户:上下文越长、并发越高,KV cache 占的显存越多,32K 上下文的几十路并发就能吃掉几十 GB,这也是为什么长上下文场景要单独规划。结论:FP16 稳妥路线按 2-4 卡一个推理实例估,量化路线按 1-2 卡估,单实例能扛的并发量让 Infra 用 vLLM 这类框架实测压出来,一般是几十路并发的量级。

第三步:由峰值反推实例数,但按「阶梯」采购

用峰值 QPS 除以单实例吞吐,得到理论实例数,再乘上冗余系数(可用区容灾、滚动升级,一般 1.3 左右),就是总需求。但一次买满是新手错误,我的做法是阶梯投入:上线前先按预估值的 50% 备量(自建或包年),剩下的用云上弹性资源兜峰值;上线后每周看真实流量曲线,用两周数据校准预估模型,再决定第二批投入。AI 产品的流量是最难估的——功能火不火没人敢打包票,阶梯投入就是用略高的单价买「估错了不死」的保险。

第四步:上线后盯三个数,驱动降本

算力投入不是一次性动作,上线后我会和 Infra 每周对三个数。GPU 利用率:长期低于 40% 说明备多了,缩容或转给训练任务;长期高于 70% 说明在危险边缘,用户体验随时可能崩。单 token 成本:这是北极星,所有降本手段(量化、投机解码、请求合并、闲时调度)都反映在这个数上。P99 延迟和超时率:成本的护城河,任何降本动作不许击穿 SLA。

降本杠杆按见效速度排:请求层做缓存(相同/相似 query 直接命中,高频问答场景能省 20-30% 的调用)、按复杂度路由(简单问题给小模型,通常一大半请求根本不需要 32B)、最后才是模型压缩和蒸馏。这些杠杆的共同原则是:先在离线评测集上证明效果不降,再灰度,省成本不能以偷偷降体验为代价——用户说不出来哪里变了,但留存会替你说话。

产品经理在这条链路里的位置

最后表个态:容量数字的终稿是 Infra 出的,但产品经理要对三件事负责——流量预估的输入质量(渗透率和频次估错了,后面全错)、SLA 的定义(多快的首 token 延迟算达标,这是体验需求不是技术参数)、以及成本红线(单位经济模型里,单用户每月算力成本不能超过多少,功能才成立)。这三件事想清楚了,和 Infra 的协作就不会变成「你要多少卡」的扯皮。

可能的追问

  • 流量预估不准怎么办? 答:承认必然不准,所以用阶梯投入+快速校准对冲;预估时给三档(悲观/中性/乐观),资源按中性值备一半,乐观值对应的扩容预案提前和云厂商谈好,真爆了 48 小时内能加上。
  • 峰值扛不住时产品侧能做什么? 答:排队降级策略——非核心场景(如批量导出)排到闲时,核心对话保 SLA;极端情况降级到小模型并明示用户;这些开关要在上线前就做好,别等出事再开发。
  • 自建 GPU 和用云怎么选? 答:看利用率的确定性——长期稳定高负载自建划算(摊销下来单价低),波动大和试错期用云。上线初期几乎总是云优先,等流量曲线平稳了再谈自建。
  • 32B 和 7B 的体验差距值回成本差吗? 答:分场景——闲聊、简单问答用户感知不到差别,路由给小模型;复杂推理、长文写作感知明显,保大模型。与其问「值不值」,不如问「哪些请求必须用大模型」,通常答案是三成以内。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.