面试知识库

面试文档构建规范(V4)#

本文件是 docs/interview/M*.md 系列面试文档的构建规范。每篇文档必须自包含——读一篇就够,不跳转到其他文档。


一、简历 Bullet Points(原文)#

以下五个 Bullet Point 是简历原文,M1-M5 各对应一条:

BP1 · 分层自适应调查引擎: 告警经规则引擎预处理(去重、时间窗聚合、拓扑级联关联)收敛至根因候选集;随后按确定性三级递进——Tier 1 已知故障通过 Runbook 匹配与前置条件校验直接处置,Tier 2 相似故障通过向量检索限定 3 轮定向验证历史根因,Tier 3 未命中时进入 ReAct Agentic Loop 深度调查。各级未命中自动递进至下一级,并继承已有证据。

BP2 · 假设驱动式调查机制: Tier 3 采用两阶段推理:LLM 先生成 3-5 条根因假设并按可能性排序,再在 ReAct Loop 中逐条调用工具定向取证,每轮输出结构化假设状态与置信度,达标即终止,避免非必要推理。

BP3 · Runbook 冷启动与自增长闭环: 初期导入通用 Runbook 实现冷启动;后续 Tier 3 调查经人工确认后,由 LLM 自动从证据链中提炼前置条件与处置步骤,生成结构化 Runbook 经审核入库,持续扩充 Tier 1 覆盖率。

BP4 · LLM 修复操作的安全治理: 将修复操作按资源域建模为参数受限的结构化工具,以调用白名单工具替代生成自由 shell 命令,消除命令注入与越权风险;高风险操作可通过飞书移动端一键审批,超时自动降级。

BP5 · 事务化修复与验证闭环: 为修复方案创建补偿事务,预生成补偿操作;执行前进行 CAS 漂移检测,失败自动补偿回滚;执行后通过三级递进门禁(命令成功→服务健康→指标恢复)逐级验证,形成执行-验证-回滚的自校验闭环。


二、模块清单与来源映射#

编号模块名对应代码吸收旧文档
M0项目全景与架构串讲整体01-Q1(5 层架构)、03-Q1(编排流程)、04(容错概览)、08-Q1(Harness 定位)。M0 必须包含模块间端到端链路图:M1→M2→M3→M4→M5 构成故障处理主线(告警入口 → 三级递进调查 → Runbook 积累 → 安全执行修复 → 事务化验证闭环),M6(Incident 状态机) 贯穿全程驱动状态流转,M7(RAG) / M8(队列 Worker) / M9(Benchmark) 是支撑层。面试开场”讲讲你的系统架构”直接用这张图。
M1分层自适应调查引擎app/preprocessing/, app/topology/, app/investigation/engine.py, app/investigation/graph.py, app/investigation/tier1.py, app/investigation/tier2.py01(告警风暴治理→预处理层)、03(Agent 编排→Tier 路由)
M2假设驱动式调查机制app/investigation/tier3.py, app/investigation/hypothesis.py, app/agents/, app/agents/subagents/03(Plan-Exec-Replan/Deep 模式)、08(Harness 并行编排/预算熔断)
M3Runbook 冷启动与自增长闭环app/runbooks/, data/topology_rules.yaml新增模块,无旧文档
M4LLM 修复操作的安全治理app/remediation/model.py, app/remediation/policy.py, app/tools/meta.py, app/services/aiops_service.py07-Q1~Q3(资源建模/白名单)、08-Q6(参数级权限)
M5事务化修复与验证闭环app/remediation/transaction.py, app/remediation/saga.py, app/remediation/regression.py, app/remediation/closed_loop.py, app/remediation/locks.py07-Q4~Q16(CAS/Saga/门禁/审批/对齐开源/飞书审批)
M6Incident 状态机与生命周期app/incidents/state_machine.py, app/incidents/models.py, app/incidents/repository.py, app/incidents/signature.py新增模块,无旧文档
M7RAG 混合检索管线app/rag/, app/services/rag_service.py, app/services/rag/02(RAG 检索管线全部)、05-部分(BM25 迁移)
M8后台队列、Worker 与并发控制app/queue/, app/db/, scripts/run_*.sh04(Worker 崩溃恢复/DLQ/Fail-open)、05(限流并发控制)
M9Benchmark 方法论与质量保证tests/, scripts/eval_*, scripts/loadtest.py00(压测方法与数据)、06(Benchmark 构建方法论)、09(集成调试)

旧文档(01-*.md ~ 09-*.md + LOADTEST_INTERVIEW_QA.md)在全部新文档完成后废弃。CONTEXT_ENGINEERING_INTERVIEW.md 独立保留。


三、统一文档结构#

每篇 M{N}-{名称}.md 必须包含以下板块,顺序固定:


四、构建原则#

  1. 自包含:读一篇搞定一个模块,不依赖其他文档。同一个概念在不同模块都用到的,在每篇里各自讲清楚,不写”详见 M{X}”。

  2. 从源码生成:每篇基于对应代码和 git 历史重新提取,不搬运旧文档的内容。旧文档只作为”有哪些点需要覆盖”的参考清单。

  3. 面试导向:所有内容服务于面试表达。开场钩子掌控节奏,流程讲清”怎么说”,踩坑讲清”为什么这么做”,问答覆盖面试官真实追问路径,前沿概念展示技术视野,技术选型表应对”为什么不用 XXX”。

  4. 踩坑是工程坑不是代码 bug:见第二板块的 ✅/❌ 定义。

  5. 数据要可追溯:所有出现在文档中的数字(降噪率、响应时间、覆盖率)必须注明来源——压测脚本、日志统计、还是合理估算。不编造数据。

  6. 逐篇交付:一篇做完、审完,再做下一篇。建议顺序 M0 → M1 → M2 → M3 → M4 → M5 → M6 → M7 → M8 → M9。


五、文件命名#

docs/interview/M0-项目全景与架构串讲.md
docs/interview/M1-分层自适应调查引擎.md
docs/interview/M2-假设驱动式调查机制.md
docs/interview/M3-Runbook冷启动与自增长闭环.md
docs/interview/M4-LLM修复操作的安全治理.md
docs/interview/M5-事务化修复与验证闭环.md
docs/interview/M6-Incident状态机与生命周期.md
docs/interview/M7-RAG混合检索管线.md
docs/interview/M8-后台队列Worker与并发控制.md
docs/interview/M9-Benchmark方法论与质量保证.md
plaintext

旧文件 01-*.md ~ 09-*.md + LOADTEST_INTERVIEW_QA.md 在全部新文档完成后统一删除。


六、各模块推荐覆盖的前沿概念方向#

供构建每篇文档第五板块时参考,不限于此列表:

模块推荐前沿概念方向
M0AIOps 成熟度模型、Event-Driven Architecture
M1Alert Correlation(基于图 vs 基于 ML)、Tiered Escalation Pattern
M2ReAct / Reflexion / Tree-of-Thought、Hypothesis-Driven Debugging
M3Runbook-as-Code / Automated Runbook Generation、Knowledge Flywheel
M4LLM 安全(Prompt Injection/Tool Poisoning)、Intent-Action Separation
M5Saga Pattern / Compensating Transaction、CAS 与乐观并发控制
M6有限状态机 vs Statechart、Event Sourcing
M7Hybrid Retrieval(Dense+Sparse+RRF)、Parent-Child Chunking
M8Backpressure / Consumer Group、Redis Streams vs Kafka
M9LLM 评测方法论(RAGAS/DeepEval)、混沌工程与故障注入

七、按面试场景速查(新文档完成后更新)#

占位:全部 M0-M9 完成后,在此补充类似旧 README 的速查索引。