面试知识库

模型训练#

AI 全栈 ② 训练与后训练:模型怎么训出来、怎么对齐、怎么按业务微调。模型结构见 MOC-LLM基础。

知识脉络#

模型训练
├── 训练与对齐
│   ├── LLM训练流程与对齐
│   ├── LoRA微调原理
│   └── 推理模型与思维链
└── 后训练工程
    ├── 后训练算法对比SFT-PPO-DPO-GRPO
    ├── 合成数据与拒绝采样
    └── Embedding与Reranker微调
plaintext

知识点清单#

训练与对齐#

#题目频率难度状态
1LLM训练流程与对齐高困难done
2LoRA微调原理中困难done
3推理模型与思维链高进阶done

后训练工程#

#题目频率难度状态
4后训练算法对比SFT-PPO-DPO-GRPO高困难done
5合成数据与拒绝采样中进阶done
6Embedding与Reranker微调中困难done

建议学习顺序#

  1. 全景:训练流程与对齐(预训练 → SFT → RLHF/DPO/GRPO)
  2. 算法细节:后训练算法对比 SFT/PPO/DPO/GRPO
  3. 动手:LoRA/QLoRA 微调 → 合成数据与拒绝采样
  4. 检索模型:Embedding 与 Reranker 微调
  5. 前沿:推理模型与 RLVR

口诀速记#

  • 训练三部曲: “预训练学知识、SFT 学格式、RLHF/DPO 学偏好”
  • 选型: “简单用 Prompt,知识用 RAG,风格用微调”

跨域关联#