Appearance
后训练是什么:DeepSeek-V4-Flash-0731 那条新闻顺着讲清楚
DeepSeek 在 2026 年 7 月 31 日推送了 V4-Flash 正式版。公告里有一行小字很值得记:
DeepSeek-V4-Flash-0731 的模型结构、尺寸和 DeepSeek-V4-Flash-Preview 保持一致,仅重新进行了后训练。
一行字。把"模型"看作软件,这个声明等价于:
我们没改一行代码,只重跑了测试和发布流程,bug 修了 20 个。
听起来像是修了点 bug。然后公告里贴了一组新跑出来的基准分数:
| 基准 | V4-Pro-Preview | V4-Flash-0731 |
|---|---|---|
| Terminal Bench 2.1 | 未公示 | 82.7 |
| NL2Repo | 未公示 | 54.2 |
| Cybergym | 未公示 | 76.7 |
| DeepSWE | 未公示 | 54.4 |
| Toolathlon verified | 未公示 | 70.3 |
| Agent Last Exam | 未公示 | 25.2 |
| Automation Bench (Public) | 未公示 | 25.1 |
| DSBench-FullStack | 未公示 | 68.7 |
| DSBench-Hard | 未公示 | 59.6 |
公告原话:"基准测试远超 V4-Pro-Preview"。
但要补充一句诚实的话——DeepSeek 没有在 0731 公告里贴 V4-Pro-Preview 的对照数字。我们能确认的只有:V4-Flash-0731 在这些基准上跑出了上述分数,且被官方自己定性为"远超"上一代 Pro 模型。公告有意不贴对照,可能就是为了避免"以下犯上"的尴尬。
这让人没法不好奇:后训练到底是什么东西?为什么它能这么值钱?
下面我把这件事给研发同学讲清楚。
一、模型一辈子会经历几次"回炉"
一个现代大模型的生命周期大致是这样的:
原始基座模型(Base Model)
│ 预训练:读过几万亿 token 的"原始互联网"
▼
│
│ SFT(监督微调):给它看"问题 → 标准答案"对
│
│ RLHF / DPO / GRPO:让"人对回答打分"或"自己比较",纠偏
│
▼
对齐后的模型(Chat / Instruct)
│
│ 工具调用 / 长思维链 / 特定领域微调
│
▼
面向产品的最终模型预训练(Pre-training)做的事是用海量的"下一字预测"任务,把模型训练成一个"博览群书但不会听话"的家伙。它会续写,但它不知道你是谁、你要什么、回答到哪算完。
后训练(Post-training)就是预训练之后的所有事情。这件事其实没有严格的界限,但行业里默认把它分成三件事:
- SFT(Supervised Fine-Tuning):让模型"听懂指令"。
- 偏好对齐(RLHF / DPO / GRPO):让模型的回答"是人类喜欢的"。
- 能力特化(Tool use / Long-CoT / Agentic):让模型"会干活"。
这三件事合起来,就是"后训练"。
二、类比:把模型想象成一个人
类比比定义好懂。假设你是一个刚毕业的学生:
- 预训练:从小学读到研究生毕业。所有课本都读了一遍,做过无数习题。会写字,会读书,但没人教过你怎么"听老板的话"。
- SFT(监督微调):你入职第一周,HR 给你 1000 个"前辈是怎么回复客户邮件"的模板,让你去背。你现在知道"回复客户邮件"长什么样了。
- RLHF / DPO:经理随机挑一些你写的邮件,让另一个人类同事打分:"这封好,那封差。"你根据这些反馈调整自己。你开始"揣摩老板心思"。
- GRPO / 工具特化:经理给你一堆真实的客户问题,让你自己想办法解决,做得好的发奖金,做得差的不发。你学会了"接活"。
整个过程里,你的大脑重量没变、知识储量没变——你变了的是"怎么用知识"。这就是后训练。
DeepSeek 0731 那条公告的本质:大脑没换,只是把你从"刚毕业"重新培训到了"资深员工"。
三、为什么"只改后训练"就能提这么多
研发同学习惯算账,我就把这个账算给你看。
3.1 预训练和后训练的成本结构完全不同
按当前业界的公开数据估算,训练一个 70B 量级模型:
| 阶段 | 计算量 | 数据量 | 周期 |
|---|---|---|---|
| 预训练 | 10⁶ ~ 10⁷ GPU 小时 | 数万亿 token | 数月 |
| 后训练 | 10⁴ ~ 10⁵ GPU 小时 | 百万到千万条 | 数周到数月 |
后训练比预训练便宜 1~3 个数量级。 这就解释了为什么每家头部模型厂商都在抢着做后训练——便宜、出分快。
3.2 同一个模型,"换教材"就能换风格
预训练决定的是"模型的天赋"。后训练决定的是"模型的工作方式"。
打个比方:同样的一个聪明人:
- 给他律师教材 + 案件输出去 SFT → 他能做律师助理
- 给他代码教材 + Issue 输出去 SFT → 他能做 Code Review
- 给他电路教材 + 调试日志去 SFT → 他能做硬件调试
骨子里的"聪明"没变,但外部行为完全变了。
DeepSeek 0731 做的事,是把同一个 V4-Flash 的"教材"从 Preview 版换成正式版——新教材更好教,结果自然就强。
3.3 后训练可以"叠加"
后训练的几个阶段是可叠加的:
SFT(基础听话)
+ DPO(偏好对齐)
+ GRPO(Agent 能力)
+ 工具调用特化
+ 领域微调每一层都建立在前一层的成果之上。DeepSeek 0731 在 V4-Flash 上加的"GRPO + Agent 强化"层,是它能跳这么多分的核心原因。
四、GRPO 到底是什么:DeepSeek 的招牌活
GRPO 是 DeepSeek 在 2024 年提出(DeepSeekMath 论文里第一次出现)的强化学习算法。这里我用最少的术语讲清楚它。
4.1 传统 RLHF 怎么做
传统 RLHF(以 OpenAI 著名的 InstructGPT 流程为代表)是这样的:
- 用 SFT 数据训一个奖励模型(Reward Model,简写 RM)—— 这是一个"人类喜好评分器"。
- 用 PPO 强化学习算法,让语言模型根据 RM 的打分去调整。
公式化地讲:
RM 给回答打分 → 这个分数当作奖励信号 → PPO 用这个信号更新模型问题:RM 本身就是一个大模型。训练 RM 要钱,PPO 训练也要钱。一份力花两份钱。
4.2 GRPO 的关键洞察
既然是"打分",为什么不直接让模型自己给自己打分?
GRPO 的具体做法:
- 给定一个 prompt,让模型采样 N 个回答(比如 N=8)。
- 不要外部评分器,把这 N 个回答彼此比较——好的 +1 分,差的 -1 分。
- 用这个组内相对优劣作为奖励信号来更新模型。
直觉上:"这一组里第 3 个最好、第 5 个最差"——这个判断不需要外部裁判,模型自己拿着这 8 个答案就能比出来。
这样做的好处:
- 砍掉了奖励模型——省了一半 GPU 内存和训练成本
- 训练更稳定——相对比较比绝对打分更鲁棒
- 更适合推理任务——可以鼓励"长思考链"而不是"漂亮短回答"
代价:
- 一次要采 N 个回答,推理成本涨 N 倍
- 有时候组内全好或全差,奖励信号弱
4.3 DeepSeek 0731 和 GRPO 的关系
诚实声明:0731 公告里没有披露具体配方。下面是基于公开信息的推断,不是公告原话。
我们能确证的事:
- 公告原话:"仅重新进行了后训练"——意味着新模型和 Preview 的预训练基座完全一致。
- DeepSeek-V4 技术报告里写过后训练的两阶段流程是"专家模型培养 + 策略蒸馏"。
- 行业内对 V4 时代后训练的工程实操描述普遍是"GRPO + OPD"两种技术结合。
把三点拼起来,可能的图景是:
V4-Flash 基座(与 Preview 共享)
▼
SFT 基础对齐(这一步两边都做过)
▼
V4-Flash-preview
▼
重新做后训练,可能是:
├─ GRPO 强化(针对 Agent 场景)
└─ On-Policy Distillation(策略蒸馏)
▼
V4-Flash-0731为什么"可能是这样"——因为 0731 提分重点全是 Agent 类基准(Terminal Bench / Cybergym / DeepSWE / Toolathlon),而 GRPO 这种"组内比较"的训练方式,对多步骤、有对错、可以用工具验证结果的任务特别有效。但这仍是推断,不是公告明示。如果你做技术决策,不要把"0731 用了 GRPO"写进你的产品文档。
四点五、一张被忽略的"官方后训练提分史"
我顺着 DeepSeek 官方更新日志(api-docs.deepseek.com/zh-cn/updates)往后翻,发现 "后训练红利"这件事不是 0731 才有。DeepSeek 历次版本提分,后训练都挑了大梁:
| 版本 | 时间 | 改了什么 | 代表性涨幅(来自官方公告) |
|---|---|---|---|
| V3-0324 | 2025-03 | 升级 deepseek-chat | MMLU-Pro +5.3 / GPQA +9.3 / AIME +19.8 / LiveCodeBench +10.0 |
| R1-0528 | 2025-05 | 升级 deepseek-reasoner | AIME +17.5 / GPQA +9.5 / LCB +9.8 / Aider +14.6 |
| V3.1 | 2025-08 | 混合推理架构 + 后训练 | SWE-bench Verified 66.0 / Terminal-bench 31.3(公告原话"通过 Post-Training 优化") |
| V4-Flash-0731 | 2026-07 | 仅重新后训练 | 9 个 Agent 基准全部刷新(见前文) |
两年四次升级,每次能拿到 10 分以上基准涨幅的,几乎都伴随着后训练动作。这不是巧合,是行业法则——预训练边际收益递减,后训练红利期刚开始。
一个有意思的细节:V3-0324 涨了 AIME 19.8 分,当年同期 OpenAI 同档模型静态基准涨多少?公开数据看不到对应版本,但 DeepSeek 是少数把"每次发了几个点"老老实实写在公告里的厂商。这种"诚实的版本日志"本身就是一种产品决策。
五、给研发的 takeaway
如果你正在做或和 LLM 相关的产品,这事值得记三件事:
5.1 不要把所有希望押在"换更强的模型"上
模型权重是"原材料",后训练才是"加工"。同代际模型换个对齐方式,分数能差一大截。你的 prompt 工程、上下文设计、任务结构设计,往往比"换模型"更划算。
5.2 后训练的红利不止属于头部
做后训练比做预训练便宜 1~3 个数量级。一个 7B 的小模型,经过精心设计的后训练,能在某些任务上超过 GPT-3.5(175B)级别的表现。与其"等 GPT 出新版",不如"自己拿开源基座做后训练"。
5.3 关注 "On-Policy Distillation" 这个新趋势
OPD(On-Policy Distillation,策略蒸馏)和 GRPO 是 2025~2026 年大模型后训练的两大新趋势。简单说:
- GRPO:模型自己和自己比,自己学。
- OPD:让一个"老师模型"(可以是更强的模型)的回答作为示范,模型照着学。
两者结合,能用相对较小的成本把模型能力提上去。
5.4 读 Paper 的优先级建议
如果想入门后训练,按这个顺序读:
- InstructGPT 原始论文(RLHF 三件套的鼻祖)
- Direct Preference Optimization 论文(DPO 替代 RM 的关键洞察)
- DeepSeekMath 论文(GRPO 第一次出现)
- DeepSeek-R1 报告(把 GRPO 推到极致)
- DeepSeek-V4 技术报告(专家模型 + 策略蒸馏的双阶段范式)
读完之后回过头看 DeepSeek 0731 的公告,不会再觉得"仅重新进行了后训练"是轻飘飘的一句。
注释与引用
- DeepSeek 官方更新日志(最重要的一手来源):api-docs.deepseek.com/zh-cn/updates。本文"四点五"节那张提分史表,所有涨幅数字都来自这页日志。包含 V4-Flash-0731、V4、V3.2、V3.2-Speciale、V3.2-Exp、V3.1-Terminus、V3.1、R1-0528、V3-0324、R1、V3、V2.5-1210、V2.5、V2 硬盘缓存、API 升级、Coder-V2-0724、V2-0628、Coder-V2-0614、V2-0517 等共 18 条更新。
- DeepSeek-V4 技术报告(Hugging Face):huggingface.co/deepseek-ai/DeepSeek-V4-Pro。Section 3 详述后训练流程(专家模型培养 + 策略蒸馏)。
- 《AI 训练策略:SFT、DPO 与 GRPO 技术演进全解析》,腾讯云开发者社区——SFT / DPO / GRPO 演进路径。
- 《DeepSeek 核心强化学习算法:GRPO 介绍》,CSDN 博客——GRPO 公式与代码示例。
- 《DeepSeek-V4 后训练实操指南:GRPO 与 OPD 稳定收敛四要素》,CSDN 博客——V4 时代后训练实战建议。
- 《LLM 大模型:post-training 方法概述》,博客园——后训练入门综述。
- 《DeepSeek-R1 的四个训练阶段》,博客园——R1 训练流程,作为 V4 的前身参考。
- 《LLM 大模型:post-training 之 SFT:让 LLM 学会"听懂人话"》,CSDN 博客——SFT 入门。
写作来源
本文核心事实来自:
- DeepSeek 官方更新日志(api-docs.deepseek.com/zh-cn/updates)—— 4.3 节诚实声明、第四节"后训练提分史"表的所有数据,都是从这页逐条摘录的。
- DeepSeek-V4 技术报告(Hugging Face)—— 后训练流程的两阶段范式说明。
- 业内对 V4 后训练实操的描述(CSDN 博客)—— 4.3 节"GRPO + OPD"配方的可能来源,但不是公告明示,详见 4.3 节诚实声明。
如果以后回头看哪些是"事实"、哪些是"推断",回头查这页官方日志最稳妥。
写在最后:大模型行业这两年最大的变化,不是"模型越来越大",而是"后训练越来越重要"。预训练的红利期过去了,互联网优质 token 几乎被用完(李乾坤博客 提到的业内共识)。接下来的胜负手会落在"怎么训"上,而不是"模型多大"。理解这件事,比懂某个具体算法更重要。
