AI 在不同任务上能力高低不均的现象。
这像公司偏科王:PPT 能镇住全场,Excel 一复杂就死机;有些题封神,有些常识掉线。
所以,写文做分析都要复核,别把一次惊艳当全能。
LLM大模型常在相邻任务间表现悬殊,呈现能力不均。
AI Model Selection选模型应按具体任务测试,不能只看一次惊艳表现。
Benchmark Validity单项基准高分可能掩盖模型在其他任务上的短板。