AI Rookies

LLM Game Benchmark — 大语言模型游戏基准

事实

用游戏任务测试大模型能力的评测基准。

人话

别听它嘴上挺能说,拎去打两把斗地主,记牌、配合、算后手,水平马上见光。

常用来测规划、记忆和操作能力,比纯聊天题更像真干活。

相关概念

Leaderboard
游戏评测分数常被整理进排行榜比较模型强弱。

Agent Harness
很多游戏基准要靠评测框架批量运行与复现。

Computer Use
游戏任务常要求模型观察界面并执行具体操作。

Benchmark Contamination
如果训练见过题目,游戏分数就会被高估。