用大模型自动评估回答质量的方法。
把 AI 请上评委席,打分比老师改卷还麻利;可它自己也会带主观,偶尔一本正经地判错。
用于模型评测和答案打分,能省人力,关键结果仍宜人工复核。
LLM
LLM-as-a-judge 本质上是把 LLM 用作自动评分器或比较器。
Benchmark contamination
如果评测题目或答案被模型提前见过,LLM-as-a-judge 的分数可能失真。
AI-bias
当评委模型本身带有偏见时,评分结果也可能跟着偏。
Human-in-the-loop
在高风险或重要评测中,通常要配合人工复核来兜底。