面试知识库

LLM 基础(模型原理)#

AI 全栈 ① 模型原理:大模型长什么样、怎么生成、能力边界在哪。训练见 MOC-模型训练,推理部署见 MOC-推理与模型服务。

知识脉络#

LLM基础
├── 模型结构
│   ├── Tokenizer与分词原理
│   ├── Transformer架构
│   ├── 注意力机制变体与位置编码
│   ├── MoE混合专家架构
│   └── Embedding原理与选型
└── 生成与能力边界
    ├── 解码策略与采样参数
    ├── 长上下文处理
    ├── 大模型幻觉与缓解
    └── 多模态大模型基础
plaintext

知识点清单#

模型结构#

#题目频率难度状态
1Tokenizer与分词原理高基础done
2Transformer架构高困难done
3注意力机制变体与位置编码高困难done
4MoE混合专家架构高困难done
5Embedding原理与选型高进阶done

生成与能力边界#

#题目频率难度状态
6解码策略与采样参数极高基础done
7长上下文处理高进阶done
8大模型幻觉与缓解高进阶done
9多模态大模型基础中进阶done

建议学习顺序#

  1. 先会用:Tokenizer → 解码采样参数
  2. 再懂原理:Transformer → 注意力变体与位置编码 → MoE → Embedding
  3. 知道边界:长上下文 → 幻觉 → 多模态

口诀速记#

  • Transformer: “Q 问 K 答 V 给货,多头并行残差稳”
  • 注意力变体: “MHA 全配是基准,MQA 共享、GQA 分组、MLA 压缩——后三个都在省 KV Cache”
  • MoE: “参数多、算得少——专家各管一摊,路由分活”
  • 采样: “温度调分布,top-p 截尾巴,惩罚防复读”
  • 长上下文: “窗口大不等于记得住——重要信息放首尾”

跨域关联#