
公司真题库2026-07-27
【字节跳动】多维度奖励信号冲突怎么处理?直接加权还是有更好的方案?
字节实习一面真题:考察对 RLHF 多目标优化的工程理解——直接加权简单但易失衡和 reward hacking,更优方案是硬约束与软目标分层、分维度归一化、动态权重与分维度监控。
91学AI·10 阅读
共 3 篇文章

字节实习一面真题:考察对 RLHF 多目标优化的工程理解——直接加权简单但易失衡和 reward hacking,更优方案是硬约束与软目标分层、分维度归一化、动态权重与分维度监控。

考察三种主流偏好优化算法的机制与取舍:PPO 的在线 RL 范式、DPO 的闭式偏好直接优化、GRPO 的组内相对优势,以及 DPO 省掉 RM 和采样的本质。

考察对对齐两阶段分工的理解:SFT 学行为范式与格式,RLHF 注入人类偏好与价值排序;核心论点是 SFT 只能模仿正例,无法表达「哪个更好」。