一种检验模型长上下文检索能力的测试。
这测试像班主任把考点塞进八十页讲义,翻到最后突然抽问,看你还能不能把那句小字原封不动找出来。
常拿来测长文问答、文档分析、代码排查时,模型会不会越看越失忆。
Context-window它常被用来检验长上下文里找信息的真实能力。
RAG它测模型在长输入里找针,不等于测外部检索能力。
Benchmark contamination若测试样本泄露,成绩可能好看却不可信。