AI Rookies

ARC-AGI Benchmark — 通用人工智能抽象与推理语料基准

事实

用少样本网格题测试抽象推理能力的基准。

人话

ARC-AGI 像给 AI 玩密室逃脱:没攻略、没题库,只看它能不能当场破机关。

它测试少样本抽象推理,能识别背题刷分的虚胖。

相关概念

AGI
它试图用小网格题逼近通用智能的核心。

Reasoning-model
推理模型若能归纳新规则,通常更占优势。

Benchmark contamination
它强调新题与少样本,降低背题刷分空间。