一篇关于”大模型是如何训练出来的”综述:先讲清楚三段式流水线,再沿时间线看训练范式如何演化,最后解释评测(benchmark)在这套体系里扮演的角色。
一、先说结论:三段式训练流水线
今天的模型(比如 DeepSeek V4 Flash)在出生时大致经历三个阶段,自监督、监督、强化学习各司其职,缺一不可:
① 预训练 (Pre-training) —— 自监督,占 90%+ 算力
喂海量网络文本 → 预测下一个 token → 学语言规律
产物:一个"什么都知道但不会说人话"的背诵机
② 监督微调 (SFT) —— 监督学习
少量人工精标问答 → 学会对话格式
产物:一个"会说人话但不会深入思考"的模型
③ 后训练 / 对齐 —— 强化学习主场
RLHF / RLVR,用奖励信号反复强化"想得更对"
产物:最终交付的"聪明模型"
关键点:预训练 100% 是自监督,RL 只存在于后训练阶段。这两个阶段的世界观完全不同。
三段式的量级对比
| 阶段 | 数据 | 算力 | 时间 | 成本量级 |
|---|---|---|---|---|
| 预训练 | 数十 T tokens(V4-Flash 为 32T) | 10^24–10^25 FLOPs,占 90%+ | 数千 | 千万美元级 |
| SFT | 几百万条人工精标 | 预训练的 1–5% | 几天 | 数据标注是大头 |
| RLVR | 模型自生成的合成题(几十亿条) | 通常是 SFT 的 10–100 倍 | 几周 | 推理采样的电费 |
三个”反直觉”事实:
- 预训练花了 90% 的算力却只造出”背诵机”——它买到的是知识地基。
- SFT 用的数据是”人写的”,RL 用的是”模型自己生成的”——所以 RL 没有人类数据稀缺瓶颈,可以无限造题。
- 决定模型智商上限的是最后那台”RL 手术”——这也是厂商拼命堆算力建超算的原因,算力在 RL 阶段能直接换智能。
二、为什么 RL 是后训练的主流?
三个本质原因:
- 预训练没有”对错”:学的是语言统计规律,无客观答案,只能”预测下一个 token”,自监督是唯一可行方案。
- 后训练有明确的”好/坏”:数学对不对 → 对答案;代码跑不跑得过 → 跑测试;人喜不喜欢 → 人类反馈。奖励信号天然存在。
- RL 的试错成本极高:一轮策略更新要反复采样推理,只能在模型基本成形后做”精雕细琢”,无法在预训练阶段循环。
而 RL 相对 SFT 的关键升级是:SFT 是”模仿”,RL 是”优化”。
| SFT(模仿) | RL(优化) | |
|---|---|---|
| 学的是 | 人类给的答案长什么样 | 什么样的答案更好 |
| 上限 | 人类样本天花板 | 可超越人类 |
| 效果 | 会说但不会想 | 逼出多步推理、自我纠错 |
三、训练范式如何一步步走到今天
要理解今天的”三段式”为什么长这样,值得沿着时间线看训练范式是怎么一步步演化的。这条线的起点,其实是强化学习本身。
强化学习算法层面的地基,是 2017 年 Schulman 等人提出的 PPO(Proximal Policy Optimization)。它在 RLHF、RLVR 这些范式出现之前很久就已存在,解决的是”如何让策略稳定地朝奖励方向更新”这个最底层的问题。PPO 的重要性在于,它至今仍是几乎所有大模型对齐层的主力算法——无论是后来 OpenAI 的 InstructGPT,还是 DeepSeek 的 R1,跑奖励优化时用的都是它。可以说,范式几经更迭,底层的优化器一直没换。
训练范式之所以能成形,还离不开一套衡量标准。2018 年 Wang 等人发布 GLUE,次年推出 SuperGLUE,开启了”一个模型 = 一套 benchmark 分数表”的风气。BERT 正是靠在这类榜单上一战成名,让学界相信”先在评测集上刷高分”是训练的有效信号。这一时期的玩法很简单:静态题目、精确匹配答案,评测分数直接等同于模型能力。
到了 2020 年,Kaplan 等人提出 Scaling Laws for Neural Language Models,给出了一个在当时颇具冲击力的观点:模型参数量、数据量、训练算力三者按比例放大时,模型损失会按幂律下降。也就是说,“无脑堆算力”不是暴发户行为,而是有理论支撑的可行路线。此后两年,DeepMind 的 Hoffmann 等人(Chinchilla,2022)对这套结论做了重要修正,指出 Kaplan 版的配比严重低估了数据需求,并给出”参数量与训练 token 约 1:20”的最优比例。Chinchilla 的修正让工业界意识到,光堆参数不行,还得成比例地喂数据——今天所有模型训练前的配比估算,几乎都源自这篇文章。
真正把”强化学习”引入大模型训练流程的,是 2022 年 Ouyang 等人的 InstructGPT。它提出一套三阶段流程:先用人工标注做监督微调,再训练一个奖励模型模拟人类偏好,最后用 PPO 让模型沿着奖励模型的方向优化,使模型学会”遵循指令”。这篇论文被公认为 RLHF 的定型之作。不过值得强调的是,它依然依赖一个”由模型充当裁判”的奖励模型——这个环节后来被证明是可以被 hack 的,也为日后的 RLVR 埋下了伏笔。
几乎同一时期,Anthropic 的 Bai 等人提出 Constitutional AI(2022),从另一个方向挑战”人类打分”的代价:与其让人逐条标注,不如用一组规则约束模型自我批评、自我修正。这条思路后来也被吸收进对齐训练的工程实践。
进入 2023 年,事情开始变得有趣。一方面,LMSYS 推出 Chatbot Arena,认为静态榜单已被刷到失真,改用真人随机对战投票来衡量模型体验——这直接承认了”分数能刷、体感难骗”。另一方面,普林斯顿的 Jimenez 等人发布 SWE-bench(2023),把评测从”答题”推进到”干活”:不再让模型在试卷上选答案,而是丢给它真实 GitHub 仓库里的 issue,让它产出代码补丁,再用真实测试验证对错。SWE-bench 的评分极其苛刻——补丁必须让原本失败的测试通过、且不能破坏原本通过的测试,才计为”解决”。它开创了整个代码 Agent 评测浪潮,后来的 Terminal-Bench、DeepSWE、NL2Repo 都由此衍生。
同年,OpenAI 的 Lightman 等人发表 Let’s Verify(2023),提出过程奖励模型(PRM)的思路:与其只看最终答案对错,不如对每一步推理打分。它补上了”只对结果打分过于粗糙”的短板,是推理模型强化训练的又一关键拼图。紧随其后,Rafailov 等人提出 DPO(2023),干脆把 RL 的目标改写成监督学习的形式,省去训练奖励模型与在线采样的开销,成为工业界追求效率时的常用替代。
真正把这一切拧成一个新范式的,是 2025 年 DeepSeek 的 R1 论文。DeepSeek 提出 RLVR(Reinforcement Learning with Verifiable Rewards):不再依赖人打分或模型裁判,而是直接让”对答案""跑测试”这类客观事实充当奖励信号,从而彻底消除了 reward hacking 的空间。R1 论文里的两个对照实验尤其值得注意:R1-Zero 跳过监督微调直接跑 RLVR,虽然学出了推理能力,但输出严重乱码;而加了少量监督样本的 R1 则稳定且可读。DeepSeek 据此认为,正确的配比是”极少量的监督 + 大量的强化”——监督只需让模型会说人话起步,真正的智能靠 RL 练出来。R1 的意义还在于,它把整个行业的后训练从”堆人工数据”拉向”堆算力跑 RL”,此后各家推理模型几乎都转向了这一范式,DeepSeek V4(2026)更是将其规模化,并用 MoE 架构摊薄了成本。
这条线再往下,便是 SWE-bench Verified(2024)这类”清洗过的权威标准”的出现,以及各厂商转向保密、动态的私有评测。它们共同构成了下一节要讲的”评测与训练的双向耦合”。
四、评测:训练与评估的”双向耦合”
这是理解整个生态的钥匙:benchmark 不只是拿来”测”,它本身就是 RL 的奖励信号。
真实能力 → 抽象成 benchmark → 变成 RL 奖励信号 → 驱动模型优化
↑ ↓
更新更难的新题 ← 分数饱和 ← benchmark 分数涨
RLVR 如何用 benchmark 当奖励
以 SWE-bench 为例:
- 模型针对某个 issue 输出补丁
- 系统在容器里真实执行测试
- F2P 全过 + P2P 没挂 = +1,否则 = 0——这个”0/1”是客观事实,无法 hack
- 梯度更新,强化”能过测试”的行为 → 反复迭代
所以你会看到 Preview → 0731 分数暴涨:不一定变聪明了,而是被定向优化到”考试状态”。这引出了生态的核心矛盾——数据污染:
- 公开 benchmark 会泄进训练语料,模型”背答案”
- RL 的奖励信号又专门对准这些题 → 分数虚高
- 因此顶级厂商转向保密、动态、不公开的评测(如 DeepSeek Harness)
评测生态的两条发展线
| 维度 | 演化 |
|---|---|
| 测什么 | 知识 (MMLU) → 指令跟随 (Arena) → 干活 (SWE-bench) → 真实世界 (GAIA) |
| 怎么测 | 静态集 → 动态集 → 对抗/保密 → 真人投票 |
这两张图来自 Artificial Analysis 的「AI 模型性价比排行榜 v4.1」(2026-07-31,128 个模型):横轴是每任务成本(美元),纵轴是 AI 智能得分。完整版散点图展示了整个生态的分布全貌,聚焦版则标出了其中的明星——DeepSeek V4 Flash 0731 极限版以最低档的成本摸到顶尖智能,被标记为「性价比之王」,正是「评测定义目标、训练朝目标优化」这条闭环的注脚:128 个模型在成本与智能两轴上的位置,就是评测驱动训练反复迭代后留下的生态版图。


一句话:评测定义目标,训练朝目标优化,优化结果催生新评测——这就是生态的完整闭环。
五、推智能的三要素
抛开模型细节,驱动智能的其实是三样东西:
算力 + 数据 + 算法(Scaling Laws 官方口径)
↑
靠电力喂
- 算力:决定模型”多大、多深”,受 Scaling Law 支配但边际递减
- 数据(数量+质量):海量脏数据不如少量精数据;合成数据补数量,人类数据守底线
- 算法:被低估的第三极——同样的算力和数据,RLVR vs 纯 SFT、MoE vs 稠密,差距巨大
- 电力:不直接推智能,是给前两者”供电”的基础设施
三者互相替代 + 各有天花板:
算法决定”每单位算力+数据能换多少智能”;算力×数据决定”能买到多少单位”;电力决定”这些算力能不能真的跑起来”。
六、总结
- 模型的诞生 = 自监督预训练(地基)+ 监督 SFT(礼仪)+ 强化学习 RLVR(手术) 三段式
- 训练范式沿时间线演化:评测文化 (2018) → Scaling Law (2020) → RLHF (2022) → 干活型评测 (2023) → RLVR (2025)
- 评测与训练双向耦合:benchmark 是奖励信号,训练又反过来催生新评测
- 一切军备竞赛(堆算力、抢电、造 benchmark)都可以在这套闭环里找到解释
大模型发展
- dots3-note-preview,小红书于2026-08-14发布,适合生活类决策,如旅游购物,8月21日实测确实会考虑更仔细,追问很多,像grill me。
小红书开源了大模型 dots3-note preview,采用 280B MoE 架构、每次激活 16B 参数,支持最长 512K 上下文以及文本、图片、视频、音频多模态理解。它的特点是面向选酒店、旅行规划、购物等生活场景,解决用户需求模糊、需要不断探索和调整的问题。
为此,团队设计了 VibeSearchBench 和 VibeLifeBench。前者测试 Agent 能否通过搜索和对话主动补全用户意图、不断追问关键条件;后者则模拟持续数周的旅行等复杂任务,要求 Agent 长期记住用户偏好、跟踪工具和环境变化,并在原计划失效时及时重新规划。
训练方面,dots 团队提出了 Self-Critique 和 TEMPO。前者让 Agent 在执行过程中持续评估当前状态、记忆和计划,后者则把长任务拆成多个阶段,在中间节点估计长期价值,从而缓解长程任务中的奖励稀疏和信用分配问题。
整体来看,dots3-note 试图让 Agent 从“一次性执行指令”,升级为能够持续理解需求、更新记忆、观察环境并调整策略的长期生活助手,应用于旅游管家、婚礼筹备、购物决策等复杂生活问题。