BP6 · 数据 ETL 与 RAG 知识库#
定位:面试官追问数据清洗与 RAG 设计时的拷问预备。
核心口述(30 秒)#
“6 平台 ETL + 5 类 RAG 品类卡 2000+ 张。关键改进是两段式检索:resolve_category 品类投票确定目标品类,fetch_cards 按 resolved 品类精确取卡——一次性语义搜索会混品类。OpenSearch Hybrid 用 english 分词(英文语料),中文 query 靠 KNN 跨语言。“
拷问链#
Q: 两段式 vs 一次性语义搜索?#
一次性 recall 可能更高但 precision 差(混品类)。两段式牺牲极少 recall 换大幅 precision 提升。品类投票准确率实测很高。
Q: 为什么用确定性规则聚合而不是 LLM 生成卡片?#
可复现 + 无 GPU + 真实数据统计。LLM 只用于多维度属性分布这一类。
Q: OpenSearch 为什么用 english 而不是 ik?#
语料是英文 Amazon 商品。中文 query 靠 KNN 向量跨语言。
Q: 科学计数法价格怎么发现的?#
Walmart 数据 96% 价格是科学计数法(如 1.795e+01),直接 float() 能解析但容易在字符串处理中丢精度。加回归测试覆盖。
Q: 索引名不匹配导致静默空召回怎么防?#
统一配置 + 部署检查清单。换环境必须同步重建索引。
压力题#
Q: Amazon 占 99.75% 不是数据偏斜严重吗?#
是。platform=“all” 搜出来全是 amazon。不修——不是 bug 是数据分布。真实场景每个平台有自己的 API,数据量均衡。