BP12 · BadCase 飞轮与规则自进化#
定位:面试官追问质量闭环与自动化修复时的拷问预备。
核心口述(30 秒)#
“P0 安全腿:从 Rubric 报告采集泄露类 bad case → 分流(LEAK/BANNED/JUDGMENT) → LEAK 类经两道闸(可脱类别+真泄露)确定性提取字面串 → 沉淀脱敏规则。不让 LLM 生成正则。真实 baseline 产 0 条规则——judge 假阳性被精确拦住。“
拷问链#
Q: 0 条规则不是什么都没做?#
0 条是设计对了的证明——两道闸精确拦住 judge 假阳性。不做这两道闸,6 条错误规则会把正常价格信息脱敏。
Q: 为什么只有 LEAK 自动修?#
BANNED(违禁/仿品)无正确规则落点。JUDGMENT(超预算等判断类)规则堵不住——需改工具逻辑或 prompt。
Q: 为什么不让 LLM 生成正则?#
LLM 正则质量不稳定,误匹配危害 > 漏匹配。确定性从文本捞 scheme://host:port,存字面 re.escape。
Q: 三态管理的意义?#
候选不自动生效——人工审核后才生效或否掉。防止自动化管线加错规则。
Q: curated 和 learned 什么关系?#
curated 在代码里(事实来源),飞轮永不写。learned 是飞轮产出,两者合并使用但职责分离。
压力题#
Q: 只能修 LEAK 类,覆盖面不小了?#
对。但设计重心是”不加错规则”不是”尽可能多修”。加错规则把正常信息脱敏,比不脱敏更严重。覆盖面小但精确度高。