
公司真题库2026-07-27
【字节跳动】DeepSeek-R1 最大的突破是什么?与之前版本相比主要改进有哪些?
字节实习一面真题:考察对 R1 技术路线的理解——核心突破是验证纯 RL 可涌现推理能力(R1-Zero)并全量开源,R1 用冷启动 SFT 加 GRPO 多阶段训练解决可读性与语言混杂问题。
91学AI·11 阅读
共 2 篇文章

字节实习一面真题:考察对 R1 技术路线的理解——核心突破是验证纯 RL 可涌现推理能力(R1-Zero)并全量开源,R1 用冷启动 SFT 加 GRPO 多阶段训练解决可读性与语言混杂问题。

拼多多一面真题:推理模型早期不支持 FC 的主因是训练管线缺工具调用轨迹而非上下文窗口;interleaved thinking 让思考与工具调用交替,解决推理与工具割裂,但放大成本与错误传播。