BP13 · 安全护栏与模型路由降级#
定位:面试官追问安全设计与成本控制时的拷问预备。
核心口述(30 秒)#
“四层安全护栏按请求生命周期从进到出:L1 工具白名单 → L2 prompt 边界 → L3 内容过滤 → L4 输出审核。四档模型路由降级:main→lite→minimal→fallback。fallback 不调 LLM,用已有候选拼诚实清单。“
拷问链#
Q: L3 为什么命中替换而非拒绝?#
拒绝 = 给攻击者廉价 DoS 手段。替换敏感内容但保留正常字段。
Q: lite 档为什么不换弱模型?#
实测弱模型多绕几轮反而更慢更贵。只关 reasoning 不换模型。
Q: minimal 档为什么真收工具?#
提示”省着用”模型不当回事。真收走成本放大器工具,只留收尾链。
Q: fallback 为什么绕过 post_reflect?#
终结纪律要求重发模型,但预算已耗尽。否则死循环。
Q: 日志脱敏为什么用 structlog processor?#
全局拦截一处配置,不是每个 logger.info 前套一层。
Q: prompt injection 测试?#
拒绝、未泄露 prompt 结构、话题带回购物。
压力题#
Q: 四层安全能防真实攻击?#
不能防所有——没有方案能。未防 Unicode 同形字。但覆盖常见攻击面。高级防护需 NFKC 归一+同形字表,误伤面陡增。
Q: 进程内状态多副本?#
排队/熔断/去重在内存。升级路径:挪 Redis。当前单进程够用。