一个用于目标检测、分割和图像描述的视觉数据集。
它像驾校路考表:不光要认出前面是人是车,还得标清在哪、边界到哪,顺带说清现场情况。
常拿来训练和评测视觉模型,尤其用于检测、分割和图像描述。
Computer Vision它是计算机视觉里最常用的基准数据集之一。
ImageNet两者都是经典视觉数据集,但它更强调定位与场景。
CNN很多卷积模型曾用它训练或比较检测分割能力。
CLIP它含图文标注,也常被用于图文对齐相关训练。