AI Rookies

Needle-in-a-Haystack Test — 大海捞针测试

事实

一种检验模型长上下文检索能力的测试。

人话

这测试像班主任把考点塞进八十页讲义,翻到最后突然抽问,看你还能不能把那句小字原封不动找出来。

常拿来测长文问答、文档分析、代码排查时,模型会不会越看越失忆。

相关概念

Context-window
它常被用来检验长上下文里找信息的真实能力。

RAG
它测模型在长输入里找针,不等于测外部检索能力。

Benchmark contamination
若测试样本泄露,成绩可能好看却不可信。