AI Rookies

Agentic Benchmark — 智能体基准测试

事实

用于检验智能体完成多步任务能力的测试基准。

人话

智能体基准测试像驾校路考:会背交规不算本事,得自己起步、变道、停车,还不能撞护栏。

用任务模拟实战,测它能否调用工具并走完多步流程。

相关概念

Agent
它考察智能体在规划、调用工具和完成任务上的表现。

Evaluation Harness
评测框架负责运行任务、收集轨迹并计算结果。

Leaderboard
基准分数可用于比较不同智能体的能力表现。