Podcast Interview · DeepSeek Research History

#91 何俊贤:逐篇讲解 DeepSeek 关键九篇论文

这期三小时二十分钟的节目把 DeepSeek 从早期语言模型、MoE、MLA、代码模型、形式定理证明一路讲到 R1。它不是一场只谈 R1 的新闻评论,而是一条“研究问题如何连续变成工程组件、组件又怎样在可验证任务里汇合”的技术史。读者不需要先读过论文,下面会先把这条链讲完整,再讨论“低成本”和“涌现推理”这些叙事究竟有多少证据。

节目 #91 · 何俊贤 / 张小珺 · 约 3:20:53 · 11 个章节 · 论文原文、访谈口述与本文推断分层

第一遍:先把九篇论文组成的原文讲清楚

节目从 DeepSeek LLM 开始,顺着 MoE、V2、V3、Coder、Prover 和 R1 展开。下文保留嘉宾的讲解顺序和重点,不把后来知道的结果倒灌回早期论文。

节目时间论文或阶段节目在回答什么问题
00:00–00:21背景与 DeepSeek LLM一个开源团队怎样从 scaling law、数据和训练细节开始积累。
00:21–01:06DeepSeekMoE怎样让专家更专门化,同时降低每 token 计算。
01:06–01:40DeepSeek-V2MoE 与 MLA 如何一起解决容量、KV cache 和推理成本。
01:40–02:05DeepSeek-V3FP8、负载均衡、MTP 等工程选择如何把规模继续推上去。
02:05–02:47Coder / Coder-V2代码是不是一个可以提供执行反馈的语言世界。
02:47–03:01Prover / Prover-V1.5Lean 证明器如何把“答案对不对”变成机器可检验的奖励。
03:01–结束R1 / R1-Zero 与总结大规模 RL、冷启动数据和可验证奖励怎样合成推理模型。

1. DeepSeek LLM:先把“长期主义”落实为可复用的训练知识

何俊贤先讲 DeepSeek 的第一篇大模型论文,而不是直接从 R1 开始。他把它看成一个认真研究 scaling law 的起点:团队不只是把模型做大,而是比较模型尺寸、数据量、学习率、训练步数和中英文数据比例怎样共同影响效果。论文推出 7B 和 67B 等规模,强调开放权重、较大语料、监督微调和 DPO。嘉宾认为,它的特殊性未必是提出一个完全陌生的 Transformer,而是把训练过程中容易被忽略的实验细节写得足够完整。

“Longtermism”在节目里不是一句公司口号,而是一个研究习惯:先把数据、配方、评测和失败记录下来,后面的模型才能知道哪些选择已经被试过。主持人把这种低调、公开、愿意写细节的风格和后续论文联系起来。嘉宾也提醒,不能把每篇论文都当成孤立的 headline;后面出现的架构和 RL 组件,都建立在早期训练工程的积累上。

2. DeepSeekMoE:让专家分工,同时避免每个专家都学同一套东西

传统 MoE 的基本思路是:模型有很多专家,但每个 token 只激活其中少数几个。总参数因此可以很大,而每 token 的计算量不必按总参数增长。问题在于,如果专家切得不够细,或者路由没有形成真正分工,很多专家会学到高度重叠的知识,容量没有被有效使用。

DeepSeekMoE 提出两项关键做法。第一,把原本较大的专家切成更多、更细的专家,再让路由器激活更多个小专家,从而有更多组合空间;第二,保留一部分共享专家,负责所有 token 都需要的通用知识,把 routed experts 留给更专门的模式。何俊贤用“专家专业化”解释这套结构:不是强迫每个专家只会一个主题,而是减少重复,让路由可以更灵活地组合不同能力。

节目把它和成本联系起来。MoE 不是凭空增加能力,而是在固定激活计算下扩充总容量;它的真实收益取决于负载均衡、通信、路由开销和专家是否真的学会不同功能。嘉宾把这看成 DeepSeek 后续路线的底层组件之一,而不是 R1 出现后才突然发明的技巧。

3. DeepSeek-V2:MLA 解决的是 KV cache,MoE 解决的是容量—计算

V2 让节目进入一个常被混在一起的地方:模型参数规模很大,不等于服务时每 token 都要计算所有参数;上下文很长,也不等于模型能低成本保存所有历史。DeepSeek-V2 继续使用 MoE,并引入 Multi-head Latent Attention(MLA)。MLA 的核心直觉是,不把每个历史 token 的完整 Key 和 Value 都原样留在缓存中,而是把它们压缩到一个潜在表示,再在需要时恢复出参与注意力的内容。

这会直接影响推理成本。KV cache 越大,长上下文服务就越占显存和带宽;如果能把缓存压缩,模型可以在相同硬件上支持更长上下文或更高并发。何俊贤强调,MLA 和 MoE 是两个不同方向的节省:前者主要压缩历史状态,后者主要减少每 token 激活的前馈计算。它们组合在一起,才形成“总容量大、每 token 计算较低、KV cache 较小”的模型形态。

论文报告的 236B 总参数、21B 激活参数、128K 上下文以及 KV cache 和吞吐改善,是作者在自己的训练与硬件设置中给出的结果。节目用这些数字说明方向,但没有复现;读者应把它们看作论文自报,而不是跨模型无条件比较。

4. DeepSeek-V3:把算法选择、数值格式和训练系统拧成一根绳

V3 在节目中被讲成一篇“工程系统论文”。它继承 DeepSeekMoE 和 MLA,把规模推到 671B 总参数、每 token 激活约 37B,并报告用 14.8T token 预训练。真正值得注意的不是参数数字本身,而是团队如何处理规模变大后最容易出问题的地方:专家负载均衡、通信、低精度训练、训练稳定和每个 token 的预测目标。

节目重点解释了 FP8。低精度可以降低显存和计算成本,但会带来数值范围、累积误差和训练稳定性问题;因此它不是把所有数字简单换成 8 bit,而是要在矩阵乘、缩放、通信和异常处理之间建立一套稳定实现。V3 还使用辅助损失之外的负载均衡策略,减少为平衡专家而付出的额外训练代价,并加入 multi-token prediction,让模型在训练时同时预测未来多个 token,以帮助表示和推理。

何俊贤的解释是:DeepSeek 的“低成本”来自许多局部选择叠加,而不是一个神奇的算法。MoE、MLA、FP8、MTP、通信和训练监控每个只解决一部分问题,真正的收益在系统组合中出现。论文声称训练过程稳定且没有不可恢复的 loss spike;这仍属于论文自报,但它说明团队把训练稳定本身当成研究结果。

5. DeepSeek-Coder:代码把语言模型带进一个有执行反馈的环境

节目随后转向代码模型。DeepSeek-Coder 不是简单地把通用语料里混入一些代码,而是从项目级代码、跨文件关系、填空任务和多种编程语言出发,把代码能力作为一个专门的学习对象。嘉宾认为代码的特殊性在于,答案能不能编译、单元测试能不能通过,往往比自然语言评价更清楚。

这改变了后续训练的可能性:模型生成一段程序后,可以交给编译器、解释器或测试框架;执行结果会告诉训练系统它是否满足要求。它仍然会遇到测试覆盖不足、依赖环境、隐藏测试和“能运行但不正确”等问题,但反馈至少比纯文本偏好更接近可验证结果。Coder-V2 再把这一思路建立在 DeepSeek-V2 的中间 checkpoint 上继续训练,扩大语言支持和上下文,同时保留通用语言能力。

何俊贤把代码模型放在 R1 之前,是为了说明“可验证奖励”并不是突然从数学题里出现的。代码、数学和形式证明都在逐步把模型输出接入一个能给出成败信号的外部环境。

6. DeepSeek-Prover:把数学证明改写成 Lean 能检查的程序

自然语言数学题的答案可能需要人判断步骤是否合理;Lean 则是一种形式化证明助手,模型必须生成符合语法和定理库规则的证明,Lean 编译器可以检查它是否真的成立。DeepSeek-Prover 的关键工作,是利用数学竞赛题和自动生成流程构建大规模 Lean 语句—证明数据,再对模型进行训练。

节目里,合成数据的意义不是“让模型自己编故事”,而是把自然语言问题翻译成形式命题、生成候选证明、用证明器过滤错误数据。这样得到的训练集带有机器可验证的结构。Prover-V1.5 进一步利用证明助手的反馈做强化学习,并引入带探索奖励的 Monte Carlo Tree Search,让模型可以在多个证明路径之间搜索,而不是只生成一条完整证明。

这里出现了一个重要转折:奖励不再来自一个人或一个语言模型说“像是对的”,而来自 Lean 是否接受证明。嘉宾认为,形式证明是理解 DeepSeek 之后 RL 路线的关键实验场,因为它把“推理过程长不长”重新绑定到“结果是否可验证”。

7. R1-Zero:先让可验证奖励驱动推理,再讨论可读性

进入 R1 时,节目先解释 R1-Zero。它在大规模强化学习前不先做传统的监督微调,主要在数学、代码等有明确判定规则的任务上获得奖励:答案是否正确,代码测试是否通过。训练过程中,模型逐渐生成更长的思考,尝试检查、回退和重新推导。嘉宾不把这些行为直接称为“意识”,而是把它们视为策略在奖励约束下形成的可观察模式。

R1-Zero 的问题也被节目讲得很清楚:输出可能难以阅读,语言混杂,推理风格不稳定,且可验证任务之外的通用能力不一定好。也就是说,纯 RL 可以把模型推向更强的求解策略,却不自动带来好的表达、知识覆盖和人类偏好。

8. R1:加入冷启动和多阶段训练,把推理能力变得可用

R1 在 Zero 的基础上加入冷启动数据和多阶段训练。先用整理过的长思维链和高质量回答做监督微调,让模型学会更可读、更稳定的推理形式;再进行强化学习,把可验证任务的正确性继续推高;对于没有明确程序验证器的任务,则需要更一般的奖励模型、人工偏好或其他评估信号。

这解释了 R1 与 R1-Zero 的关系:Zero 说明“没有 SFT 也可能从 RL 中长出推理行为”,R1 则说明“要把这种能力交付给人,还需要冷启动、格式、通用任务和稳定性”。嘉宾认为,R1 的结果看起来像一条突然出现的路径,其实是前面 MoE、MLA、代码、证明器、数据和训练系统逐步积累后的汇合。

9. 节目最后的总结:低调、开放和可验证,比一个魔法公式更重要

主持人问 DeepSeek 为什么能在较低成本叙事中快速追上,何俊贤的答案并不是“他们找到了一招别人不知道的秘密”。他的解释是:团队长期积累了大量小而关键的工程与研究改进,并且把这些改进写成论文、开放权重或公开代码,让外部研究者可以理解、复现和继续改进。

关于数据,嘉宾认为高质量自然数据会越来越难找,合成数据和可执行环境会变得重要;但他没有说 scaling 已经结束,而是认为收益可能变得更依赖数据质量、验证器和任务设计。关于模型是否有意识,他保持谨慎:如果概念没有可操作定义和可重复测试,研究者不应把复杂行为直接升级为意识结论。

原文讲解到这里。下文才把这条论文链抽象成反馈结构,并审计“连续历史”“低成本”和“涌现”这些说法的证据。

第二遍:DeepSeek 的连续性更像“反馈目标逐步变硬”

节目最有价值的主线不是九个论文标题,而是模型输出所接受的反馈越来越具体。早期论文用 benchmark 和人工评价判断模型是否更好;MoE、MLA、FP8 把训练和服务的资源反馈写进架构;Coder 把输出接到编译器和测试;Prover 把数学推理接到 Lean;R1 再把可验证奖励和长程策略搜索推到通用推理模型。

容量反馈

MoE 让总参数和每 token 激活分开,专家路由暴露了负载与通信问题。

系统反馈

MLA、FP8、MTP 和训练稳定把显存、带宽、数值和时间变成模型设计变量。

结果反馈

代码测试、Lean 编译器和数学规则把“像正确”逐步替换为“可执行地正确”。

独立抽象DeepSeek 叙事中真正可迁移的资产,不是某个孤立模块,而是把任务、验证器、训练策略和基础模型连接成一条越来越短的反馈链。

把九篇论文放进一张机制图

阶段输入问题主要机制反馈或新能力
DeepSeek LLM开源模型怎样稳定扩展。规模、数据、学习率和训练研究。形成可复用的训练知识与基线。
DeepSeekMoE容量变大但计算不能等比例变大。细粒度专家 + 共享专家 + 路由。专家分工与稀疏计算。
V2 / V3长上下文、通信、数值和规模成为瓶颈。MLA、FP8、负载均衡、MTP、系统协同。更大的模型在可控成本下训练和服务。
Coder自然语言评价太软。项目级代码、填空、编译与单元测试。执行反馈。
Prover数学推理缺乏大规模可靠标签。合成 Lean 数据、证明器过滤、RL/MCTS。形式化验证反馈。
R1推理策略需要在长程搜索中自我改进。规则奖励、冷启动、多阶段 RL。更长思考与更强可验证任务表现。

这条链并不意味着每篇论文都直接“导致”下一篇,也不意味着所有组件都只服务 R1。更准确的说法是:它们共同构成一个组织可以反复尝试的技术栈,每个阶段都把某种失败变成下一阶段的设计约束。

证据审计:哪些数字来自论文,哪些是访谈解释

主张证据状态限制
DeepSeek-V2 报告 236B 总参数、21B 激活、128K 上下文和显著 KV cache/吞吐改善。V2 论文作者报告。依赖具体基线、硬件、精度和评测条件。
DeepSeek-V3 报告 671B 总参数、37B 激活、14.8T token 和 2.788M H800 GPU hours。V3 论文作者报告。不是独立审计的总成本,也不等于所有团队可复制。
Prover 在 Lean miniF2F 上达到较高全证明准确率。Prover 论文作者报告。采样数、测试集、形式化范围和证明搜索预算很关键。
R1-Zero 自发出现长思维链、自检等行为。R1 论文与节目转述。“涌现”是对训练轨迹的解释,不自动说明新的认知机制。
DeepSeek 的低成本来自许多小创新组合。嘉宾的综合判断,部分由论文技术细节支持。缺少完整训练账本和与同规模团队的受控对照。
团队开放、诚实、低调是快速进步的原因。嘉宾评价与公开论文风格。组织因果尚未被系统测量,存在事后解释风险。
不要把论文数量当成历史因果九篇论文能展示技术积累,但仅凭公开论文无法知道哪些内部实验被放弃、哪些工程投入没有发表、哪些成本数字没有计入。论文链是观察组织能力的窗口,不是完整的研发账本。

我的独立判断:DeepSeek 的可复制性在“验证器设计”而不在叙事标签

  1. 先找到可执行的反馈,再谈 RL 能否放大推理。 没有编译器、证明器、单元测试或可靠规则,RL 可能只会优化奖励代理。DeepSeek 的路线价值在于不断把任务改写成能检查的环境。
  2. “低成本”是系统乘积,不是单项折扣。 激活参数、KV cache、通信、低精度、训练稳定、数据和 GPU 利用率互相影响。复制一个 MoE 结构却没有相同的 kernel、负载均衡和监控,不能复制论文结果。
  3. R1 的推理能力与可读性是两个优化目标。 R1-Zero 说明正确性奖励可能诱导长程搜索;R1 的冷启动说明人类可读、语言稳定和通用任务需要额外约束。把二者混成“模型自己学会思考”会隐藏工程工作。
  4. 开放论文的战略价值是缩短外部反馈回路。 公开使社区能够复现、批评、蒸馏、改进,也让公司获得人才与信任;但开放并不等于证据充分,外部复现仍是关键一环。

什么证据会推翻或修正这篇判断

证据边界与资料索引

本文主材料是 Zhang Xiaojun Podcast #91 的完整节目与公开转录;节目按九篇论文讲解,但并非每篇都在节目中逐页复现实验。下面列出主要一手论文,论文中的性能和成本数字均保留为作者报告;嘉宾对研究文化、技术连续性、模型意识和未来数据路线的判断则明确标为口述或分析。

模型的参数、token、GPU hours、benchmark 和“涌现行为”都依赖版本、采样、训练预算和评测程序;本文不把作者自报结果改写成无条件的行业排名。

返回顶部 ↑