公司真题库

【字节跳动】DeepSeek-R1 最大的突破是什么?与之前版本相比主要改进有哪些?

91学AI·2026/7/27·14 阅读

考察点

这道题出自字节跳动 LLM 应用研发实习一面,考你对头部开源模型技术路线的跟进深度。面试官想听的八卦(便宜、火)之外的东西:R1-Zero 和 R1 的区别、纯 RL 为什么算突破、冷启动数据解决什么问题。追问会往 GRPO、蒸馏小模型、R1 在应用层的局限(不擅长工具调用、思考冗长)走。

参考答案

最大突破:证明推理能力可以靠 RL「长出来」,并且敢开源

R1 之前,业界的推理模型路线(以 o1 为代表)是黑盒——大家知道用了 RL,但细节全无,而且业界普遍默认需要大量人工标注的推理过程 SFT 打底。R1 系列里的 R1-Zero 做了一件激进的事:直接在基座模型(DeepSeek-V3-Base)上做纯强化学习,没有任何推理 SFT 数据,奖励信号就是规则化的对错判定(数学答案对不对、代码测试过不过)。

结果是模型在训练中自发涌现出长思维链行为:会自我验证、会反思、会推翻重来,训练日志里出现了著名的「aha moment」——模型在推理中途自己说「等等,我重新想一下」。这验证了推理能力不是必须从人类示范里模仿来的,可以被奖励信号激励出来。这是方法论层面的突破:它把「推理模型怎么做」从少数公司的秘方变成了可复现的公开配方。

第二个突破是全量开源。权重 MIT 协议开放,技术报告把训练流程、踩的坑都写清楚,还附赠基于 Qwen/Llama 蒸馏的一系列小模型。这直接引爆了整个开源社区的推理模型复现潮。

R1 相比 R1-Zero 的改进:解决「能用」问题

R1-Zero 证明了可行性,但直接不能用:推理过程可读性差、中英文混杂、格式混乱。R1 用多阶段管线修正:

  1. 冷启动 SFT:先构造几千条高质量长 CoT 数据微调基座,给模型的输出格式和语言习惯「定调」;
  2. 推理导向 RL:用 GRPO 做强化学习,奖励以规则化对错为主,外加语言一致性奖励压混杂问题;
  3. 拒绝采样 + 全场景 SFT:从 RL 后的模型采样,筛出好的推理数据,再混上写作、问答等通用数据做 SFT,把能力从数学代码扩展到通用领域;
  4. 第二轮全场景 RL:对齐人类偏好,兼顾有用性和无害性。

GRPO 本身也是值得一提的工程改进:它去掉了 PPO 里的 critic 网络,用同一问题一组采样的相对好坏做基线,显著降低 RL 训练的资源消耗。

相比 DeepSeek 自家之前版本

底座从 V2/V3 继承了很多:MoE 架构、MLA(多头潜在注意力,压 KV cache 大头)、V3 的多 token 预测。R1 的增量不在架构而在训练范式——它是第一个把「推理时计算」(test-time compute)作为核心卖点开源的模型,性能在数学和代码基准上对齐当时的第一梯队闭源推理模型,而 API 定价低了一个数量级。

应用层的清醒认识

答这题最后最好补一句局限性,显得你用过而不只是读过:R1 这类推理模型思考冗长、首 token 延迟高,不适合低延迟场景;早期版本工具调用能力弱,接 Agent 要额外处理;对提示词敏感,few-shot 反而可能干扰它的推理,零样本加清晰指令效果更好。

可能的追问

1. GRPO 和 PPO 的关键区别?

PPO 需要训练一个价值网络估计 advantage,开销大且不稳定;GRPO 对同一 prompt 采样一组回答,用组内奖励的均值方差做归一化得到相对优势,省掉 critic,实现和训练都更轻。

2. 为什么蒸馏的小模型也能有推理能力?

大模型的长 CoT 轨迹作为教师数据 SFT 小模型,小模型模仿的是「思考格式」;能力上限受小模型本身容量限制,但在数学这类模式化强的任务上迁移效果出奇地好。

3. R1 做业务问答 Agent 合适吗?

看场景:复杂多步推理任务值得用;高频简单问答用它成本延迟都不划算。常见做法是路由——简单问题走普通模型,难的才升推理模型。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.