用游戏任务测试大模型能力的评测基准。
别听它嘴上挺能说,拎去打两把斗地主,记牌、配合、算后手,水平马上见光。
常用来测规划、记忆和操作能力,比纯聊天题更像真干活。
Leaderboard游戏评测分数常被整理进排行榜比较模型强弱。
Agent Harness很多游戏基准要靠评测框架批量运行与复现。
Computer Use游戏任务常要求模型观察界面并执行具体操作。
Benchmark Contamination如果训练见过题目,游戏分数就会被高估。