面试知识库

BP14 · P0 自动修规则飞轮#

定位:面试官追问自动化规则生成与质量保障时的拷问预备。


核心口述(30 秒)#

“从 Rubric 报告自动采集泄露类 bad case,分流后 LEAK 类经两道闸(可脱类别+真泄露)确定性提取字面串,沉淀为脱敏规则。不让 LLM 生成正则。首轮真实 baseline 产 0 条规则——judge 假阳性被精确拦住。“


拷问链#

Q: 0 条规则说明什么?#

说明两道闸设计对了。judge 报的”泄露”全在轨迹(内部日志)里不在 summary.md(用户可见文本)里。不做真泄露闸就会把正常价格信息脱敏。

Q: 只修 LEAK 覆盖面够吗?#

设计重心是”不加错规则”不是”尽可能多修”。加错规则 > 漏规则。BANNED/JUDGMENT 需改工具/prompt,不是规则问题。

Q: 为什么不让 LLM 生成正则?#

LLM 正则质量不稳定。确定性从文本捞 scheme://host:port,re.escape 存字面。精确度高于 LLM 生成。

Q: —verify 验什么?#

确定性误脱回归:对已知正常文本跑新规则,检查是否误脱。不需要 LLM。


压力题#

Q: 只靠离线报告不够实时?#

对。线上实时采集留了 hook 点但未做。当前离线报告 + 手动触发 evolve_p0.py 够用。