AI Rookies

Evaluation harness — 评测脚手架

事实

用于批量运行、记录和比较模型测试的评测工具框架。

人话

评测脚手架是 AI 擂台的裁判:题目、规则、记分一样,真功夫还是花架子,一打便知。

自动跑完测试并留存成绩,便于比版本,也能发现退步。

相关概念

LLMOps
它可嵌入 LLMOps,持续追踪模型上线前后的表现。

Model regression
重复跑同一套测试,能发现模型版本的能力退步。

LLM-as-a-judge
可用 LLM-as-a-judge 为开放式回答自动评分。

Leaderboard
统一运行和评分方式,能为排行榜提供可比成绩。