评估视觉语言模型识别未知类别能力的基准。
VLOSE 把视觉模型拉去菜场突击测验:认得苹果不稀奇,见到释迦敢说“不认识”才算数。
它专考训练外的陌生物体,检验模型会不会不懂装懂。
VLMVLOSE 检验视觉语言模型遇到训练外物体时能否识别未知。
Hallucination它关注模型把陌生对象硬说成熟悉事物的误判。
Model Calibration它也衡量模型能否在不确定时诚实地说“不认识”。