Skip to content

后训练是什么:DeepSeek-V4-Flash-0731 那条新闻顺着讲清楚

DeepSeek 在 2026 年 7 月 31 日推送了 V4-Flash 正式版。公告里有一行小字很值得记:

DeepSeek-V4-Flash-0731 的模型结构、尺寸和 DeepSeek-V4-Flash-Preview 保持一致,仅重新进行了后训练

一行字。把"模型"看作软件,这个声明等价于:

我们没改一行代码,只重跑了测试和发布流程,bug 修了 20 个。

听起来像是修了点 bug。然后公告里贴了一组新跑出来的基准分数:

基准V4-Pro-PreviewV4-Flash-0731
Terminal Bench 2.1未公示82.7
NL2Repo未公示54.2
Cybergym未公示76.7
DeepSWE未公示54.4
Toolathlon verified未公示70.3
Agent Last Exam未公示25.2
Automation Bench (Public)未公示25.1
DSBench-FullStack未公示68.7
DSBench-Hard未公示59.6

公告原话:"基准测试远超 V4-Pro-Preview"

但要补充一句诚实的话——DeepSeek 没有在 0731 公告里贴 V4-Pro-Preview 的对照数字。我们能确认的只有:V4-Flash-0731 在这些基准上跑出了上述分数,且被官方自己定性为"远超"上一代 Pro 模型。公告有意不贴对照,可能就是为了避免"以下犯上"的尴尬。

这让人没法不好奇:后训练到底是什么东西?为什么它能这么值钱?

下面我把这件事给研发同学讲清楚。

一、模型一辈子会经历几次"回炉"

一个现代大模型的生命周期大致是这样的:

原始基座模型(Base Model)
    │  预训练:读过几万亿 token 的"原始互联网"


    │  SFT(监督微调):给它看"问题 → 标准答案"对

    │  RLHF / DPO / GRPO:让"人对回答打分"或"自己比较",纠偏


对齐后的模型(Chat / Instruct)

    │  工具调用 / 长思维链 / 特定领域微调


面向产品的最终模型

预训练(Pre-training)做的事是用海量的"下一字预测"任务,把模型训练成一个"博览群书但不会听话"的家伙。它会续写,但它不知道是谁、你要什么、回答到哪算完。

后训练(Post-training)就是预训练之后的所有事情。这件事其实没有严格的界限,但行业里默认把它分成三件事:

  1. SFT(Supervised Fine-Tuning):让模型"听懂指令"。
  2. 偏好对齐(RLHF / DPO / GRPO):让模型的回答"是人类喜欢的"。
  3. 能力特化(Tool use / Long-CoT / Agentic):让模型"会干活"。

这三件事合起来,就是"后训练"。

二、类比:把模型想象成一个人

类比比定义好懂。假设你是一个刚毕业的学生:

  • 预训练:从小学读到研究生毕业。所有课本都读了一遍,做过无数习题。会写字,会读书,但没人教过你怎么"听老板的话"。
  • SFT(监督微调):你入职第一周,HR 给你 1000 个"前辈是怎么回复客户邮件"的模板,让你去背。你现在知道"回复客户邮件"长什么样了。
  • RLHF / DPO:经理随机挑一些你写的邮件,让另一个人类同事打分:"这封好,那封差。"你根据这些反馈调整自己。你开始"揣摩老板心思"。
  • GRPO / 工具特化:经理给你一堆真实的客户问题,让你自己想办法解决,做得好的发奖金,做得差的不发。你学会了"接活"。

整个过程里,你的大脑重量没变、知识储量没变——你变了的是"怎么用知识"。这就是后训练。

DeepSeek 0731 那条公告的本质:大脑没换,只是把你从"刚毕业"重新培训到了"资深员工"。

三、为什么"只改后训练"就能提这么多

研发同学习惯算账,我就把这个账算给你看。

3.1 预训练和后训练的成本结构完全不同

按当前业界的公开数据估算,训练一个 70B 量级模型:

阶段计算量数据量周期
预训练10⁶ ~ 10⁷ GPU 小时数万亿 token数月
后训练10⁴ ~ 10⁵ GPU 小时百万到千万条数周到数月

后训练比预训练便宜 1~3 个数量级。 这就解释了为什么每家头部模型厂商都在抢着做后训练——便宜、出分快。

3.2 同一个模型,"换教材"就能换风格

预训练决定的是"模型的天赋"。后训练决定的是"模型的工作方式"。

打个比方:同样的一个聪明人:

  • 给他律师教材 + 案件输出去 SFT → 他能做律师助理
  • 给他代码教材 + Issue 输出去 SFT → 他能做 Code Review
  • 给他电路教材 + 调试日志去 SFT → 他能做硬件调试

骨子里的"聪明"没变,但外部行为完全变了。

DeepSeek 0731 做的事,是把同一个 V4-Flash 的"教材"从 Preview 版换成正式版——新教材更好教,结果自然就强。

3.3 后训练可以"叠加"

后训练的几个阶段是可叠加的:

SFT(基础听话)
  + DPO(偏好对齐)
  + GRPO(Agent 能力)
  + 工具调用特化
  + 领域微调

每一层都建立在前一层的成果之上。DeepSeek 0731 在 V4-Flash 上加的"GRPO + Agent 强化"层,是它能跳这么多分的核心原因。

四、GRPO 到底是什么:DeepSeek 的招牌活

GRPO 是 DeepSeek 在 2024 年提出(DeepSeekMath 论文里第一次出现)的强化学习算法。这里我用最少的术语讲清楚它。

4.1 传统 RLHF 怎么做

传统 RLHF(以 OpenAI 著名的 InstructGPT 流程为代表)是这样的:

  1. 用 SFT 数据训一个奖励模型(Reward Model,简写 RM)—— 这是一个"人类喜好评分器"。
  2. 用 PPO 强化学习算法,让语言模型根据 RM 的打分去调整。

公式化地讲:

RM 给回答打分 → 这个分数当作奖励信号 → PPO 用这个信号更新模型

问题:RM 本身就是一个大模型。训练 RM 要钱,PPO 训练也要钱。一份力花两份钱。

4.2 GRPO 的关键洞察

既然是"打分",为什么不直接让模型自己给自己打分?

GRPO 的具体做法:

  1. 给定一个 prompt,让模型采样 N 个回答(比如 N=8)。
  2. 不要外部评分器,把这 N 个回答彼此比较——好的 +1 分,差的 -1 分。
  3. 用这个组内相对优劣作为奖励信号来更新模型。

直觉上:"这一组里第 3 个最好、第 5 个最差"——这个判断不需要外部裁判,模型自己拿着这 8 个答案就能比出来。

这样做的好处:

  • 砍掉了奖励模型——省了一半 GPU 内存和训练成本
  • 训练更稳定——相对比较比绝对打分更鲁棒
  • 更适合推理任务——可以鼓励"长思考链"而不是"漂亮短回答"

代价:

  • 一次要采 N 个回答,推理成本涨 N 倍
  • 有时候组内全好或全差,奖励信号弱

4.3 DeepSeek 0731 和 GRPO 的关系

诚实声明:0731 公告里没有披露具体配方。下面是基于公开信息的推断,不是公告原话。

我们能确证的事:

  • 公告原话:"仅重新进行了后训练"——意味着新模型和 Preview 的预训练基座完全一致
  • DeepSeek-V4 技术报告里写过后训练的两阶段流程是"专家模型培养 + 策略蒸馏"。
  • 行业内对 V4 时代后训练的工程实操描述普遍是"GRPO + OPD"两种技术结合。

把三点拼起来,可能的图景是:

V4-Flash 基座(与 Preview 共享)

   SFT 基础对齐(这一步两边都做过)

   V4-Flash-preview

   重新做后训练,可能是:
        ├─ GRPO 强化(针对 Agent 场景)
        └─ On-Policy Distillation(策略蒸馏)

   V4-Flash-0731

为什么"可能是这样"——因为 0731 提分重点全是 Agent 类基准(Terminal Bench / Cybergym / DeepSWE / Toolathlon),而 GRPO 这种"组内比较"的训练方式,对多步骤、有对错、可以用工具验证结果的任务特别有效。但这仍是推断,不是公告明示。如果你做技术决策,不要把"0731 用了 GRPO"写进你的产品文档。

四点五、一张被忽略的"官方后训练提分史"

我顺着 DeepSeek 官方更新日志(api-docs.deepseek.com/zh-cn/updates)往后翻,发现 "后训练红利"这件事不是 0731 才有。DeepSeek 历次版本提分,后训练都挑了大梁:

版本时间改了什么代表性涨幅(来自官方公告)
V3-03242025-03升级 deepseek-chatMMLU-Pro +5.3 / GPQA +9.3 / AIME +19.8 / LiveCodeBench +10.0
R1-05282025-05升级 deepseek-reasonerAIME +17.5 / GPQA +9.5 / LCB +9.8 / Aider +14.6
V3.12025-08混合推理架构 + 后训练SWE-bench Verified 66.0 / Terminal-bench 31.3(公告原话"通过 Post-Training 优化")
V4-Flash-07312026-07仅重新后训练9 个 Agent 基准全部刷新(见前文)

两年四次升级,每次能拿到 10 分以上基准涨幅的,几乎都伴随着后训练动作。这不是巧合,是行业法则——预训练边际收益递减,后训练红利期刚开始

一个有意思的细节:V3-0324 涨了 AIME 19.8 分,当年同期 OpenAI 同档模型静态基准涨多少?公开数据看不到对应版本,但 DeepSeek 是少数把"每次发了几个点"老老实实写在公告里的厂商。这种"诚实的版本日志"本身就是一种产品决策。

五、给研发的 takeaway

如果你正在做或和 LLM 相关的产品,这事值得记三件事:

5.1 不要把所有希望押在"换更强的模型"上

模型权重是"原材料",后训练才是"加工"。同代际模型换个对齐方式,分数能差一大截。你的 prompt 工程、上下文设计、任务结构设计,往往比"换模型"更划算。

5.2 后训练的红利不止属于头部

做后训练比做预训练便宜 1~3 个数量级。一个 7B 的小模型,经过精心设计的后训练,能在某些任务上超过 GPT-3.5(175B)级别的表现。与其"等 GPT 出新版",不如"自己拿开源基座做后训练"。

5.3 关注 "On-Policy Distillation" 这个新趋势

OPD(On-Policy Distillation,策略蒸馏)和 GRPO 是 2025~2026 年大模型后训练的两大新趋势。简单说:

  • GRPO:模型自己和自己比,自己学。
  • OPD:让一个"老师模型"(可以是更强的模型)的回答作为示范,模型照着学。

两者结合,能用相对较小的成本把模型能力提上去。

5.4 读 Paper 的优先级建议

如果想入门后训练,按这个顺序读:

  1. InstructGPT 原始论文(RLHF 三件套的鼻祖)
  2. Direct Preference Optimization 论文(DPO 替代 RM 的关键洞察)
  3. DeepSeekMath 论文(GRPO 第一次出现)
  4. DeepSeek-R1 报告(把 GRPO 推到极致)
  5. DeepSeek-V4 技术报告(专家模型 + 策略蒸馏的双阶段范式)

读完之后回过头看 DeepSeek 0731 的公告,不会再觉得"仅重新进行了后训练"是轻飘飘的一句。


注释与引用

  • DeepSeek 官方更新日志(最重要的一手来源)api-docs.deepseek.com/zh-cn/updates。本文"四点五"节那张提分史表,所有涨幅数字都来自这页日志。包含 V4-Flash-0731、V4、V3.2、V3.2-Speciale、V3.2-Exp、V3.1-Terminus、V3.1、R1-0528、V3-0324、R1、V3、V2.5-1210、V2.5、V2 硬盘缓存、API 升级、Coder-V2-0724、V2-0628、Coder-V2-0614、V2-0517 等共 18 条更新。
  • DeepSeek-V4 技术报告(Hugging Face):huggingface.co/deepseek-ai/DeepSeek-V4-Pro。Section 3 详述后训练流程(专家模型培养 + 策略蒸馏)。
  • 《AI 训练策略:SFT、DPO 与 GRPO 技术演进全解析》,腾讯云开发者社区——SFT / DPO / GRPO 演进路径。
  • 《DeepSeek 核心强化学习算法:GRPO 介绍》,CSDN 博客——GRPO 公式与代码示例。
  • 《DeepSeek-V4 后训练实操指南:GRPO 与 OPD 稳定收敛四要素》,CSDN 博客——V4 时代后训练实战建议。
  • 《LLM 大模型:post-training 方法概述》,博客园——后训练入门综述。
  • 《DeepSeek-R1 的四个训练阶段》,博客园——R1 训练流程,作为 V4 的前身参考。
  • 《LLM 大模型:post-training 之 SFT:让 LLM 学会"听懂人话"》,CSDN 博客——SFT 入门。

写作来源

本文核心事实来自:

  1. DeepSeek 官方更新日志api-docs.deepseek.com/zh-cn/updates)—— 4.3 节诚实声明、第四节"后训练提分史"表的所有数据,都是从这页逐条摘录的。
  2. DeepSeek-V4 技术报告Hugging Face)—— 后训练流程的两阶段范式说明。
  3. 业内对 V4 后训练实操的描述(CSDN 博客)—— 4.3 节"GRPO + OPD"配方的可能来源,但不是公告明示,详见 4.3 节诚实声明。

如果以后回头看哪些是"事实"、哪些是"推断",回头查这页官方日志最稳妥。


写在最后:大模型行业这两年最大的变化,不是"模型越来越大",而是"后训练越来越重要"。预训练的红利期过去了,互联网优质 token 几乎被用完(李乾坤博客 提到的业内共识)。接下来的胜负手会落在"怎么训"上,而不是"模型多大"。理解这件事,比懂某个具体算法更重要。

最后更新: