推理与模型服务#
AI 全栈 ③ 推理与模型服务:怎么调模型、怎么把模型跑起来、怎么让它又快又省。
知识脉络#
推理与模型服务
├── 调用与输出
│ ├── LLM API调用与流式输出
│ └── 结构化输出与约束解码
├── 推理与部署
│ ├── LLM推理优化
│ ├── vLLM与高吞吐推理服务
│ ├── 前缀缓存与KV Cache复用
│ └── 模型量化与本地部署
└── 服务治理
├── LLM网关与多供应商路由
└── AI应用成本优化
plaintext
知识点清单#
调用与输出#
| # | 题目 | 频率 | 难度 | 状态 |
|---|
| 1 | [LLM API调用与流式输出](/topics/llm-serving/LLM API调用与流式输出) | 极高 | 基础 | done |
| 2 | 结构化输出与约束解码 | 高 | 进阶 | done |
推理与部署#
服务治理#
建议学习顺序#
- 会调用:API 调用与流式 → 结构化输出
- 会部署:推理优化 → vLLM → 前缀缓存 → 量化与本地部署
- 会治理:LLM 网关(限流/熔断/降级)→ 成本优化
口诀速记#
- 推理优化: “量化省显存、KV 省重算、批处理提吞吐、推测解码降延迟”
- 成本优化: “缓级压批(缓存/级联/压缩/批量)“
跨域关联#