⚖️

LLM裁判(LLM-as-a-Judge)

LLM-as-a-Judge
前沿概念
评测质量

LLM裁判(LLM-as-a-Judge)指用大模型来评估其他模型或生成内容的质量:给裁判模型一份评分标准(Rubric)和待评内容,让它输出分数、排名或改进建议。人工标注一名内容可能要几分钟到几十分钟,LLM 几秒完成,成本相差百倍。

常见用法

  • 成对比较(Pairwise):给两个回答,让裁判选更好的那个(比绝对打分更可靠)
  • 参考答案对照:拿标准答案比对待测回答
  • 无参考打分:直接按维度(准确性、有用性、安全性)打分
  • 群体裁判(Panel):多个模型/多次投票,降低单一裁判的偏见

已知偏差(用之前必须知道)

偏好长回答、偏好自家风格(自偏置)、位置偏差(先看到的占优,需交换顺序评两次)、才能评文采难评事实。对事实性任务要谨慎,最好配合可验证指标。

典型应用

Chatbot Arena 的风格控制、各类 AI 应用的离线回归测试、RAG 答案质量抽检、合成数据的过滤器。它是“AI 评测 AI”闭环的核心组件,也是 RLHF/RLAIF 中奖励模型的近亲。

🔗 探索更多 AI 工具板块

除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。

☆ 0