模型训练#
AI 全栈 ② 训练与后训练:模型怎么训出来、怎么对齐、怎么按业务微调。模型结构见 MOC-LLM基础。
知识脉络#
模型训练
├── 训练与对齐
│ ├── LLM训练流程与对齐
│ ├── LoRA微调原理
│ └── 推理模型与思维链
└── 后训练工程
├── 后训练算法对比SFT-PPO-DPO-GRPO
├── 合成数据与拒绝采样
└── Embedding与Reranker微调plaintext知识点清单#
训练与对齐#
| # | 题目 | 频率 | 难度 | 状态 |
|---|---|---|---|---|
| 1 | LLM训练流程与对齐 | 高 | 困难 | done |
| 2 | LoRA微调原理 | 中 | 困难 | done |
| 3 | 推理模型与思维链 | 高 | 进阶 | done |
后训练工程#
| # | 题目 | 频率 | 难度 | 状态 |
|---|---|---|---|---|
| 4 | 后训练算法对比SFT-PPO-DPO-GRPO | 高 | 困难 | done |
| 5 | 合成数据与拒绝采样 | 中 | 进阶 | done |
| 6 | Embedding与Reranker微调 | 中 | 困难 | done |
建议学习顺序#
- 全景:训练流程与对齐(预训练 → SFT → RLHF/DPO/GRPO)
- 算法细节:后训练算法对比 SFT/PPO/DPO/GRPO
- 动手:LoRA/QLoRA 微调 → 合成数据与拒绝采样
- 检索模型:Embedding 与 Reranker 微调
- 前沿:推理模型与 RLVR
口诀速记#
- 训练三部曲: “预训练学知识、SFT 学格式、RLHF/DPO 学偏好”
- 选型: “简单用 Prompt,知识用 RAG,风格用微调”
跨域关联#
- 模型结构 → Transformer架构(LLM基础)
- 微调后部署 → 模型量化与本地部署(推理与模型服务)
- 效果验证 → LLM评测方法(AI评测与治理)