计算机视觉(Computer Vision,CV)是人工智能的核心领域之一,目标是让计算机能够像人眼一样"看懂"图像和视频——识别物体、理解场景、感知空间关系。它是自动驾驶、人脸识别、医学影像、安防监控、工业质检等技术的基础。
核心任务
- 图像分类:判断图片里是什么(猫/狗)
- 目标检测:找出物体在哪并框出来(行人、车辆)
- 图像分割:逐像素分类(自动驾驶的路面/天空/障碍物)
- 人脸识别:检测、比对、身份确认
- 图像生成:文生图(扩散模型)、图像编辑
技术演进
早期靠人工设计特征 → 2012年 AlexNet 用深度学习全面超越传统方法 → 2015年 ResNet 解决深层网络训练难题 → 2020年后 Transformer(ViT)和扩散模型(Stable Diffusion)登场,视觉与语言大模型融合为多模态AI。
现实应用
手机拍照识别、刷脸支付、自动驾驶感知、医疗影像辅助诊断、工厂缺陷检测、卫星遥感分析。随着多模态大模型(GPT-4V、Gemini)普及,计算机视觉正从独立领域走向"视觉+语言+理解"的通用智能。