
公司真题库2026-07-27
【字节跳动】多维度奖励信号冲突怎么处理?直接加权还是有更好的方案?
字节实习一面真题:考察对 RLHF 多目标优化的工程理解——直接加权简单但易失衡和 reward hacking,更优方案是硬约束与软目标分层、分维度归一化、动态权重与分维度监控。
91学AI·10 阅读
共 2 篇文章

字节实习一面真题:考察对 RLHF 多目标优化的工程理解——直接加权简单但易失衡和 reward hacking,更优方案是硬约束与软目标分层、分维度归一化、动态权重与分维度监控。

考察 RLHF 三阶段流程(SFT、RM 训练、PPO 优化)的完整理解,重点是 RM 偏好数据的采样、排序标注方式与 pairwise 损失的设计。