用于批量运行、记录和比较模型测试的评测工具框架。
评测脚手架是 AI 擂台的裁判:题目、规则、记分一样,真功夫还是花架子,一打便知。
自动跑完测试并留存成绩,便于比版本,也能发现退步。
LLMOps它可嵌入 LLMOps,持续追踪模型上线前后的表现。
Model regression重复跑同一套测试,能发现模型版本的能力退步。
LLM-as-a-judge可用 LLM-as-a-judge 为开放式回答自动评分。
Leaderboard统一运行和评分方式,能为排行榜提供可比成绩。