让机器从图像或视频中理解信息的领域。
计算机视觉不是给机器装摄像头就完事,而是让它像交警一样一眼看懂车、人和路况。
它用于识图、监控分析和自动驾驶,是机器理解画面的基础能力。
CNNCNN 曾是视觉任务里最经典的主力模型之一。
AlexNetAlexNet 在图像竞赛上的突破带火了现代计算机视觉。
ResNetResNet 解决深层网络训练难题,推动视觉模型继续变深。
Multimodal AI计算机视觉常与文本、语音结合,成为多模态能力的一部分。