AI Rookies

Personal AI Benchmark — 个人 AI 基准测试

事实

用个人真实任务评估 AI 实用表现的基准测试。

人话

通用榜单是百米总成绩,你的基准测试却让 AI 拎着待办清单,当面过招。

它用真实任务挑模型,适合比较工作流里的效率与稳定性。

相关概念

Leaderboard
通用排行难反映个人任务表现,它用真实工作清单补足这个盲区。

Evaluation Harness
评测框架可自动运行个人任务,并汇总模型表现。

AI Productivity
它用实际工作结果衡量 AI 是否真能提升个人效率。