评测者与模型方均不知关键身份或测试条件的评测设计。
双盲 AI 评测像匿名阅卷、封存题库:评委认不出模型身份,模型方也摸不着考题。
让模型比较少受名气和泄题干扰,常用于基准测试与偏好评审。
Evaluation Harness评测框架可承载匿名分发、打分与结果记录流程。
Third-party AI evaluation第三方评测引入双盲设计,能减少利益关系对结果的影响。
Benchmark contamination隐藏测试内容可减少模型针对公开题目刷分的空间。