用少样本网格题测试抽象推理能力的基准。
ARC-AGI 像给 AI 玩密室逃脱:没攻略、没题库,只看它能不能当场破机关。
它测试少样本抽象推理,能识别背题刷分的虚胖。
AGI它试图用小网格题逼近通用智能的核心。
Reasoning-model推理模型若能归纳新规则,通常更占优势。
Benchmark contamination它强调新题与少样本,降低背题刷分空间。