← 返回文章一览
技术笔记

AI 大模型:预训练 vs 后训练——会读书和会做事是两回事AI大規模言語モデル:事前学習 vs 事後調整——「知っている」と「できる」は別物

AILLM预训练后训练强化学习DeepSeek

📚 AI 大模型:预训练 vs 后训练——“会读书”和”会做事”是两回事

你有没有过这种困惑:同一个 AI,隔几个月好像突然”变聪明”了,可厂商说它架构没变、参数没变,那它到底变了什么?

2026 年 7 月 31 日,DeepSeek 发布 V4-Flash 正式版。官方更新日志里有一句轻描淡写却信息量巨大的话:

“DeepSeek-V4-Flash-0731 的模型结构、尺寸和 preview 保持一致,仅重新进行了后训练。”

仅仅”重新做了一次后训练”,一个激活参数只有 130 亿的轻量模型,在 Agent 能力上就跑出了逼近、甚至反超 490 亿激活参数的 V4-Pro 预览版的成绩。

这不是什么玄学。它正好戳中了今天大模型最核心、也最被低估的一个概念——预训练和后训练的根本区别

这篇文章,我想用一个简单的比喻,帮你把这两个词彻底搞懂,然后告诉你:为什么”后训练”正在成为 AI 军备竞赛里,那个被所有人偷偷加码的新战场。

🎓 先建立一个直觉:读万卷书 vs 上岗培训

想象两个人:

A 同学,寒窗苦读十多年,把图书馆里几百万本书全背下来了。天文地理、历史典故、数理逻辑、人情世故,样样都懂。但问题是——他从没跟人正经对话过,你问他问题,他说出来的话又臭又长、还经常跑题,甚至会说一些不合时宜的话。

B 同事,就是在 A 的基础上,接受了三个月高强度的”岗前培训”:学会了听懂老板的指令、按规范的格式汇报、知道什么时候该说重点、什么时候该闭嘴。入职后又经过反复的实战打磨,越来越像一个靠谱的职场人。

你觉得,A 和 B,谁更能帮你解决问题?

当然是 B。因为 A 只是”知道”,而 B 是”会做”。

预训练,就是那个”读万卷书”的 A——让模型海量学知识,掌握语言、事实和世界运行的规律。

后训练,就是那个”上岗培训”的 B——把模型从一个”什么都知道但不会好好说话的书呆子”,调教成一个”懂规矩、会办事、按你期望给答案”的专业助手。

🔑 一句话核心:预训练解决”知”,后训练解决”行”。一个决定模型”懂什么”,一个决定模型”怎么表现”。

📖 什么是预训练:让模型”读万卷书”

预训练是所有大模型的起点,也是最烧钱的一步。

它在做什么?

预训练的任务听起来简单得有点傻——让模型海量文本里”猜下一个词”(技术上叫 next-token prediction)。

给它半句话:“今天天气真”,它要学会预测下一个字最可能是”好”(而不是”吃”或”跑”)。

就这么一个朴素的任务,配上几万亿、几十万亿个 token 的海量文本,模型通过不断”猜对下一个词”来调整自己内部的几十亿、几千亿个参数,最终把语言的规律、世界的知识、逻辑的模式,全部”压进”了这些参数里。

🏗️ 用工程语言说:预训练产出的是 Base Model(基础模型)。它的任务只有一个——最大化”猜对下一个词”的概率。

产出的模型长什么样?

Base Model 你要是一上来就问它,你会得到:

一句话:预训练让模型”无所不知,但无法相处”。

预训练的三个特点

特点说明
💰 成本最高动辄数亿美元,超大规模 GPU 集群跑几个月
周期最长数据清洗、训练、调优都是以”月”为单位
📈 Scaling Law 主导”大力出奇迹”,数据和算力越大,能力越强

这也是为什么只有巨头玩得起预训练——它是一个资本密集型的活。

🛠️ 什么是后训练:让模型”上岗”

如果预训练是”把原料做成了一锅生米”,那后训练就是把它煮成熟饭、装盘、摆上桌。它是让模型从”Base”变成你能用的”Chat/助手”的关键一步。

后训练的三大核心手段:

1️⃣ SFT(监督微调):先学会”有问有答”

收集大量”人类问题 → 理想回答”的高质量标注数据,让模型照着标准答案学。

这一步,模型学会了基本的”对话礼仪”——你问,它答;你让总结,它总结;你让写代码,它写代码。

🥣 打个比方:这是”岗前培训”,教会新人基本的业务流程和话术。

2️⃣ RLHF / RL(强化学习):学会”按期望给答案”

光有标准答案还不够,因为”好答案”的标准五花八门。于是用奖励模型 + 强化学习,让模型自己去”试错”,答得好,给高分;答得差,打低分。反复迭代,直到模型学会了什么该说、什么不该说、什么样的答案更受欢迎。

🧠 这是最像”人类成长”的一步——不是死记硬背标准答案,而是在试错中学会了判断好坏的品味

在 DeepSeek 这类以推理见长的模型里,这一步用的是 GRPO(群组相对策略优化) 等强化学习算法,专门用来驯出模型的推理能力(R1 就是靠这一步,从一个基础模型硬生生”逼”出了奥数级别的逻辑推理)。

3️⃣ 蒸馏 / 对齐:把”多个专家”装进一个模型

有些团队会把后训练分成多个专业的”小老师”(编程专家、数学专家、Agent 专家各练各的),最后用知识蒸馏把它们的本事合并进一个模型里——既要多才多艺,又不能让它们互相”打架”、忘掉彼此的本领。

后训练的三个特点

特点说明
📄 数据量小但极精百万级的高质量标注,远小于预训练的万亿 token
💰 成本相对低但仍需大规模算力,且近年来投入占比飙升
🔄 迭代极快相比预训练以”月”计,后训练可以”周”级快速迭代

🎯 关键洞察:后训练正从”点缀”变成”主战场”。 早期大家觉得后训练只是”微调一下”让模型听话,但现在——它已经跟预训练平起平坐,甚至成了拉开差距的关键。

⚖️ 一张表看懂:预训练 vs 后训练

维度🏫 预训练🛠️ 后训练
目标学会”知识”(理解语言与世界)学会”行为”(按期望回答问题)
数据海量无标注文本(万亿 token)少量高质量标注(百万级)
成本极高(数亿美元 + 数月)相对低,但占比逐年飙升
能力来源通用知识与语言能力指令遵循、推理、对齐、任务专精
产出Base Model(基础模型)Chat 模型 / 助手 / 推理模型
迭代速度慢(月级)快(周级)
决定模型”懂多少”模型”好多少、会不会用懂的东西”

💡 一句话:预训练决定天花板,后训练决定你能摸到天花板多远。

🚀 最有力的证据:DeepSeek-V4-Flash-0731

理论说再多,不如看一个真实案例。7 月 31 日这个案例,几乎就是为”后训练的重要性”量身定做的。

发生了什么?

效果有多惊人?

指标V4-Flash-0731(13B激活,仅重后训练)V4-Pro 预览版(49B激活)
Terminal Bench82.7(2.1版)67.9(2.0版)
NL2Repo54.2
Cybergym76.7
Toolathlon verified70.3

一个激活参数只有 130 亿的轻量模型,靠”换了个后训练”,在自家 Agent 基准上,逼近甚至反超了激活参数 490 亿的 Pro 预览版——两者规模差一个数量级。

🎯 这里藏着最值得玩味的信号:参数规模的差距,正在被后训练的智慧追平。

这个案例说明了什么?

  1. 架构不是唯一决定因素——同样一副骨架,换一套”训练方法”,能力天差地别
  2. 后训练是”能力放大器”——尤其对 Agent(让 AI 用工具、完成任务)这类任务,后训练的加持立竿见影
  3. 训练方法和数据质量的权重正在上升——这也是”小模型打大模型”成为可能的原因

一点诚实

有两个事实我该如实说:

正因如此,我更愿意把它理解为:DeepSeek 正在验证一条务实的技术路线——不动架构、不扩参数,靠重新后训练 + 工具适配,就能把模型完成真实任务的能力再拔高一截。 这本身就是个很强的信号。

另一个有力佐证:DeepSeek-V3.2

其实早在 2025 年底,DeepSeek V3.2 就用数据说了同样的话:它的论文里明确写到,后训练阶段投入的计算预算,超过了预训练的 10%

⏫ 翻译一下:以前大家觉得预训练占 99% 的算力,后训练只是”修修补补”。但 DeepSeek 说,不,我单是后训练就烧掉了预训练十分之一的算力——换来的是跑平甚至超越 GPT-5、IMO 金牌级别的能力。

当后训练的单独立投入达到预训练的 10%+,它就已经不是”微调”,而是一项可与预训练分庭抗礼的工程。 这和我们看到的 V4-Flash-0731 是同一个故事的延续。

🤔 为什么这跟你有关?

你可能说:我又不做大模型,这跟我有什么关系?

关系大着呢。因为它正在改变整个行业的竞争逻辑

🔥 最终一句话——不要神化”参数”,也不要神话”架构”。让模型真正有用的是它的训练,尤其是那块最能显手艺、最能拉开差距的后训练。


📅 2026-08-06 | 🤖 由 Hermes Agent 辅助编写

相关文章

© 2026 9x9