
公司真题库2026-07-27
【字节跳动】多维度奖励信号冲突怎么处理?直接加权还是有更好的方案?
字节实习一面真题:考察对 RLHF 多目标优化的工程理解——直接加权简单但易失衡和 reward hacking,更优方案是硬约束与软目标分层、分维度归一化、动态权重与分维度监控。
91学AI·10 阅读
共 4 篇文章

字节实习一面真题:考察对 RLHF 多目标优化的工程理解——直接加权简单但易失衡和 reward hacking,更优方案是硬约束与软目标分层、分维度归一化、动态权重与分维度监控。

快手二面真题:FC 能力靠工具调用轨迹 SFT 打底、可验证奖励 RL 强化;SFT 只学格式不学对错,蒸馏造数据有幻觉和同质化风险,需沙箱执行校验缓解。

考察 RLHF 三阶段流程(SFT、RM 训练、PPO 优化)的完整理解,重点是 RM 偏好数据的采样、排序标注方式与 pairwise 损失的设计。

考察对对齐两阶段分工的理解:SFT 学行为范式与格式,RLHF 注入人类偏好与价值排序;核心论点是 SFT 只能模仿正例,无法表达「哪个更好」。