中 进阶
LLM评测方法#
一句话答案#
LLM 评测结合自动指标(BLEU/ROUGE)、LLM-as-Judge(GPT 评分)、人工评估和领域基准测试(MMLU/HumanEval)。
核心要点
四层评测体系:
| 层次 | 方法 | 适用场景 | 成本 | 局限 |
|---|---|---|---|---|
| 自动指标 | BLEU/ROUGE(n-gram 重叠度) | 翻译/摘要粗筛 | 极低 | 只衡量表面相似度 |
| LLM-as-Judge | 强模型(GPT-4)给回答打分 | 开放式生成评估 | 中 | 有评判偏差 |
| 领域基准 | MMLU(57 学科)、HumanEval(代码) | 模型能力横评 | 低 | 静态题库,易过拟合 |
| 人工评估 | 标注员多维度打分 | 关键场景抽检 | 高 | 慢、主观、难规模化 |
LLM-as-Judge 三大偏差:
- 长度偏好:倾向给更长的回答打高分 → 控制回答长度后对比
- 位置偏差:先出现的回答更易获高分 → 随机打乱顺序
- 自我增强:同家族模型互评分数虚高 → 用不同家族模型交叉评判
RAG 专项评测(RAGAS 框架):
| 指标 | 评测对象 | 含义 |
|---|---|---|
| Faithfulness | 生成端 | 回答是否完全基于召回文档(检测幻觉) |
| Answer Relevance | 生成端 | 回答是否切题 |
| Context Precision | 检索端 | 召回文档中相关的占比 |
| Context Recall | 检索端 | 相关文档被召回的比例 |
实际项目评测流水线:
- 自动指标快速迭代(每次 Prompt 修改后跑)
- LLM-as-Judge 细评(每周/每版本)
- 人工抽检关键 case(上线前)
面试回答(2分钟版)
LLM评测需要多维度结合,没有单一银弹。第一层是自动指标,BLEU和ROUGE通过计算生成文本和参考答案的n-gram重叠度来评分,速度快成本低,但只能衡量表面相似度,对开放式生成不够准确。第二层是LLM-as-Judge,用一个强模型(比如GPT-4)给其他模型的回答打分,平衡了成本和评估质量,但需要注意评判模型本身的偏差(比如偏好长回答)。第三层是人工评估,最准确但成本最高速度最慢,适合关键场景抽检。领域基准测试方面,MMLU测通用知识广度覆盖57个学科,HumanEval测代码生成能力。实际项目中建议组合使用:先用自动指标做粗筛快速迭代,再用LLM-as-Judge做细评,最后人工抽检关键case。对于RAG系统还要额外评测检索召回率和答案的忠实度(是否基于检索内容回答而非编造)。
追问与易错
追问方向:
- LLM-as-Judge 的偏差怎么纠正?你们项目怎么做的? → 三招:随机打乱回答顺序(消位置偏差)、控制回答长度后对比(消长度偏好)、用不同家族模型交叉评判(消自我增强)
- RAGAS 评测集怎么构建?需要多少条? → 从真实文档人工编写 QA 对(Question + Ground Truth + Source Chunk),覆盖直接命中/跨段落/多跳三种难度。最少 50 条起步,DocMind 用 52 条 × 7 类别
- 自动指标和人工评估不一致时怎么办? → 以人工评估为准(金标准),分析不一致的 case 找规律——通常是自动指标的评估维度不够(如 BLEU 不评逻辑正确性)
- 怎么评测 RAG 系统的检索质量和生成质量? → 检索看 Recall@K 和 MRR(文档是否找到且排名靠前),生成看 Faithfulness(是否基于检索内容)和 Relevance(是否切题)。用 RAGAS 框架自动化
易错点:
- ❌ “BLEU/ROUGE 能评所有任务” → 只适合有标准答案的场景,开放式生成不适用
- ❌ “LLM-as-Judge 完全客观” → 有长度偏好、位置偏差和自我增强三大偏差
- ❌ “基准测试分数高=实际效果好” → 静态题库易过拟合,需结合领域实测