卷积神经网络(Convolutional Neural Network,CNN)是一类专为处理网格状数据(主要是图像)设计的深度学习架构。它的核心创新是"卷积操作":用一个小型滤波器(如3×3的矩阵)在图像上滑动扫描,自动提取局部特征,无需人工设计特征。
核心结构
- 卷积层:提取边缘、纹理等局部特征
- 池化层:压缩尺寸、保留主要特征、增强平移不变性
- 全连接层:把特征整合成最终分类结果
关键优势
参数共享(同一滤波器扫全图)+ 局部连接(只看局部区域),使 CNN 比全连接网络参数少得多、更适合图像,且天然具备平移不变性。
发展历程
1998年 LeNet 用于手写数字识别 → 2012年 AlexNet 以巨大优势赢得 ImageNet 竞赛,引爆深度学习浪潮 → 此后 ResNet、EfficientNet 等不断刷新精度。
应用
人脸识别、物体检测、医学影像分析、自动驾驶视觉、OCR 文字识别。虽然 Transformer(ViT)在部分图像任务上已超越 CNN,但 CNN 仍是计算机视觉领域最基础、最高效的架构之一。