面试知识库

推理与模型服务#

AI 全栈 ③ 推理与模型服务:怎么调模型、怎么把模型跑起来、怎么让它又快又省。

知识脉络#

推理与模型服务
├── 调用与输出
│   ├── LLM API调用与流式输出
│   └── 结构化输出与约束解码
├── 推理与部署
│   ├── LLM推理优化
│   ├── vLLM与高吞吐推理服务
│   ├── 前缀缓存与KV Cache复用
│   └── 模型量化与本地部署
└── 服务治理
    ├── LLM网关与多供应商路由
    └── AI应用成本优化
plaintext

知识点清单#

调用与输出#

#题目频率难度状态
1[LLM API调用与流式输出](/topics/llm-serving/LLM API调用与流式输出)极高基础done
2结构化输出与约束解码高进阶done

推理与部署#

#题目频率难度状态
3LLM推理优化中困难done
4vLLM与高吞吐推理服务高困难done
5[前缀缓存与KV Cache复用](/topics/llm-serving/前缀缓存与KV Cache复用)高进阶done
6模型量化与本地部署高进阶done

服务治理#

#题目频率难度状态
7LLM网关与多供应商路由高进阶done
8AI应用成本优化中进阶done

建议学习顺序#

  1. 会调用:API 调用与流式 → 结构化输出
  2. 会部署:推理优化 → vLLM → 前缀缓存 → 量化与本地部署
  3. 会治理:LLM 网关(限流/熔断/降级)→ 成本优化

口诀速记#

  • 推理优化: “量化省显存、KV 省重算、批处理提吞吐、推测解码降延迟”
  • 成本优化: “缓级压批(缓存/级联/压缩/批量)“

跨域关联#