感受野:神经元能“看见”多大区域
感受野指一个神经元在原始图像上“看到”的区域大小。网络越深,感受野越大,神经元也从看局部像素进化到看整张图。理解感受野,就理解了 CNN 是如何逐层抽象的。 感受野像一个人的视野:阅历越...
经典 CNN:从 AlexNet 到 ResNet
AlexNet 2012 年在 ImageNet 上以巨大优势夺冠,标志着深度学习时代开启;VGG 展示了简洁架构的力量;ResNet 用残差连接把网络深度推到上百层,至今仍是视觉领域的基石。 这段历史最动人的是它...
MobileNet:让 AI 跑进手机
MobileNet 专为移动设备设计:用深度可分离卷积把计算量降到普通 CNN 的八分之一到九分之一,让手机也能实时跑视觉模型。它是 AI 从云端走向终端的功臣。 MobileNet 证明了一个常被忽视的真相:...
YOLO:实时目标检测的王者
YOLO(You Only Look Once)把目标检测变成单阶段任务:网络只需看一眼图像,就直接输出所有框与类别。它把检测速度提升到实时级别,是自动驾驶、安防、工业检测的核心组件。 YOLO 的成功源于一...
Faster R-CNN:高精度检测的代表
Faster R-CNN 采用两阶段策略:先生成候选区域(RPN),再对每个候选框精细分类与回归。它的精度高于单阶段方法,在对准确率要求极高的医疗、遥感领域仍是首选。 Faster R-CNN 与 YOLO 的对比是...
图像分割全景:语义、实例与全景
图像分割有三个层次:语义分割给每个像素分个类,实例分割还要区分同类个体,全景分割则把所有像素都分到具体实例(连背景都编号)。层级越深,理解越精细。 分割的发展史是“理解粒度不断细化...
SAM:Meta 的通用分割模型
SAM(Segment Anything)是 Meta 发布的通用分割大模型:给个点或框就能分割任意物体,零样本迁移到新场景。它把分割从“为每个场景训模型”变成了“一个模型搞定一切”。 SAM 的意义在于展示了...
关键点检测:读懂人的姿态
关键点检测定位人体的若干特征点(眼、肩、肘、膝…),进而估计姿态与动作。它是健身 App、动作捕捉、康复医疗、安防分析的技术基础。 关键点检测最有趣的应用是运动科学的民主化:过去只有专...
图像处理 vs 计算机视觉:两个不同境界
图像处理是“图到图”的操作:调色、锐化、压缩,输入输出都是图像;计算机视觉是“图到语义”的理解:识别、分割、检测,输出的是对世界的解释。二者常被混为一谈,实则境界不同。 这个区分其...
颜色空间:RGB 之外的广阔世界
RGB 是显示器最常用的颜色空间,但不是唯一。HSV 更贴近人的色彩直觉(色相/饱和度/明度),Lab 空间能表示人眼可见的所有颜色,YCbCr 是视频压缩的主流选择。 颜色空间的丰富性揭示了一个事实...
边缘检测:图像理解的经典起点
边缘检测找出图像中亮度变化剧烈的位置——物体的轮廓往往就在那里。Sobel、Canny 是最经典的算子,虽然简单,至今仍是图像处理与视觉分析的基础工具。 边缘检测是“特征工程”时代的辉煌成就:...
HOG 特征:行人检测的经典武器
HOG(方向梯度直方图)统计局部区域的梯度方向分布,用于捕捉物体形状特征。它曾是非深度学习时代行人检测的最佳方案,也是理解“特征设计”思想的绝佳案例。 HOG 最值得铭记的不是算法本身,而...













