AI Rookies

VLOSE — 视觉语言开放集评测

事实

评估视觉语言模型识别未知类别能力的基准。

人话

VLOSE 把视觉模型拉去菜场突击测验:认得苹果不稀奇,见到释迦敢说“不认识”才算数。

它专考训练外的陌生物体,检验模型会不会不懂装懂。

相关概念

VLM
VLOSE 检验视觉语言模型遇到训练外物体时能否识别未知。

Hallucination
它关注模型把陌生对象硬说成熟悉事物的误判。

Model Calibration
它也衡量模型能否在不确定时诚实地说“不认识”。