公司真题库

【科大讯飞】你这个 AIGC 项目用了什么算法模型?为什么选它?

91学AI·2026/8/14·7 阅读

考察点

这是科大讯飞 AI 产品经理岗业务技术面的高频追问,通常跟在「介绍一下你的项目」后面,是判断项目真伪的第一道筛子。背出来的项目讲不清「为什么是这个模型而不是别的」,真实做过的能讲出一连串约束和试错。面试官想听的核心理路是:选型不是选「最强」的模型,而是在数据、延迟、成本、部署方式这些约束下找最优解。讯飞自己就是模型厂(星火),又是语音和教育硬件出身,面试官对「你评估过哪些候选、指标怎么比的」这种细节会非常敏感。追问一般往三个方向走:为什么不直接用最大的通用模型、微调做没做、效果数字是多少怎么来的。

参考答案

先讲约束,再讲选择

我回答这类问题的固定结构是:不先说答案,先说约束。以我做过的一个教育场景的作文批改项目为例,当时的硬约束有四条:单篇批改的端到端延迟不能超过 5 秒(学生拍照上传后在等);并发峰值出现在晚上 8-10 点,是白天的好几倍,成本扛不住一直开最大的模型;批改意见要符合教研给定的评分维度和话术规范,通用模型的自由发挥反而不合格;学校客户要求数据不出内网,公网 API 直接排除。这四条摆出来,候选范围就从「所有模型」收窄到「可私有化部署、中等规模、能做领域适配的模型」,选型其实已经完成了一大半。面试官真正想听的就是这个收窄过程——它证明你理解选型是工程决策,不是追榜单。

候选对比:用同一套评测集说话

范围收窄后我们实测了三档方案:直接调通用大模型 API(论证成本用,不作为正式候选)、百亿参数级的开源模型加 LoRA 微调、以及一个更小的垂直模型。关键动作是建评测集:让教研老师标注了几百篇覆盖各年级、各档次水平的作文,输出侧按「评分准确性、评语规范性、错误检出率」三个维度打分。跑出来的结果很典型:通用大模型错误检出率最高,但评语不规范的比例也高,而且按峰值并发算账,月度成本是开源方案的十几倍;小模型延迟和成本最好,但面对写得「不按套路」的作文泛化明显不够。中间档的 LoRA 方案在三个维度上没有单项第一,但综合分最高——这就是真实项目里最常见的结局,你选的不是最强项,是短板最少的那个。

为什么不上最大的模型,为什么不只用规则

这两个反向问题我会主动讲,因为面试官十有八九会问。不用最大模型,除了成本,还有一个很多人忽略的原因:输出不可控的代价。批改场景里,通用大模型偶尔会用超出学生年级的表述、或者给出和教研标准不一致的评分理由,这种 badcase 比例可能只有几个百分点,但对家长和老师来说,看到一次离谱评语对产品信任的打击远大于一百次平庸但正确的评语。不用纯规则,是因为作文是开放文本,规则能覆盖拼写和病句的显性错误,覆盖不了「论证不充分」「立意偏浅」这种语义判断——这正是当年小模型时代的作文批改产品都做不痛的原因。LoRA 微调的价值恰好卡在中间:用几千条教研标注数据把通用语言能力「掰」到教学规范上,既保留泛化,又锁住话术和评分口径。

PM 在这个决策里干了什么

最后一定要落到自己的贡献上,否则这道题就变成了算法述职。我的角色有三块:一是把业务约束翻译成算法能听懂的条件——「学校数据不出内网」翻译成「必须私有化部署,参数量上限受客户机房算力约束」;二是组织评测,评测集的维度、标注标准、争议仲裁规则是我和教研一起定的,算法同学只负责跑数;三是拍板,三个方案的数据摆在桌上,成本模型是我算的,最后选中间档、接受「错误检出率比通用模型低几个点换成本降一个量级」这个取舍,是产品决策。讲清这三块,这道题就从技术问答变成了产品经理能力展示。

可能的追问

  • 微调前后具体提升了多少? 答:给数字也给口径——以我们几百篇的标注评测集计,评语规范符合率从微调前的七成出头提到九成以上,这是提升最大的维度;错误检出率只涨了三四个点,因为基座模型本来的识别能力就不弱,微调主要解决的是「说对话」而不是「找对错」。
  • 如果客户预算砍半,你的方案怎么降级? 答:先砍并发峰值期的资源——用请求排队和预约批改把峰值摊平;再砍模型——换更小一档的开源模型,接受检出率下降,但用「教研规则+模型」混合策略保住高频显性错误的检出;最不济砍实时性,从 5 秒出结果改成异步通知。体验损失最小的是前两条。
  • 模型版本升级了,你跟不跟? 答:不自动跟。每次基座升级都走一遍评测集回归,核心三指标不掉才切,切的时候小流量灰度一周。踩过的坑是:新版本整体分更高,但在某类文体上回退了,全量后才发现,从此定了「分维度看,不只看总分」的规矩。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.