LLM 作为裁判是什么?
模型升级后,怎么知道它真的变好了?最靠谱的办法是找人来一条条打分,但既贵又慢。LLM-as-a-Judge 的思路是:让一个「裁判模型」来当评委,把待测模型的回答丢给它,让它按预先定好的标准打分、写评语、判好坏。它怎么当裁判?
成对比较把 A、B 两个模型的回答摆在一起,让裁判说哪个更好——适合「新版本有没有退步」这类对比。
单条打分
给一条回答打分数或分等级,比如相关性、准确性、是否有帮助。
按标准卡(Rubric)评估
先给裁判一份详细的评分细则,让它逐条对照,减少主观随意。
它的优势在哪?
快且便宜人工评一条要几分钟,裁判模型几秒钟就能出结果,成本低几个数量级。
可规模化
每天跑几千条、几万条评估不再是问题。
可复现
只要固定 prompt 和参数,结果基本可重复,适合做回归测试。
它的坑
裁判也会「偏心」——偏爱长答案、偏爱自己的风格、容易漏掉事实错误。所以不能完全取代人工,通常的做法是「裁判先初筛,人再抽查」,或者用多个裁判交叉打分。一句话记住:LLM-as-a-Judge 就是「让 AI 当考官」——快是快,但别把它的分数当成圣旨。
评论