边缘检测:图像理解的经典起点
边缘检测找出图像中亮度变化剧烈的位置——物体的轮廓往往就在那里。Sobel、Canny 是最经典的算子,虽然简单,至今仍是图像处理与视觉分析的基础工具。 边缘检测是“特征工程”时代的辉煌成就:...
HOG 特征:行人检测的经典武器
HOG(方向梯度直方图)统计局部区域的梯度方向分布,用于捕捉物体形状特征。它曾是非深度学习时代行人检测的最佳方案,也是理解“特征设计”思想的绝佳案例。 HOG 最值得铭记的不是算法本身,而...
SIFT 特征:不变性的艺术
SIFT 提取图像的关键点特征,且对缩放、旋转、光照变化保持不变。它是图像匹配、全景拼接、三维重建的经典工具,非深度时代图像特征的巅峰之作。 SIFT 的设计目标——让特征“不以观察条件为转...
图像质量评估:好图的标准可以被计算
图像质量评估用算法给图片打分:清晰度、色彩、构图、美学。它被用于相册精选、内容审核、电商图质量筛分。让机器拥有“审美”这件事,正在变得可行。 图像质量评估触及了一个有趣的问题:美是...
Vision Transformer:挑战 CNN 的新王
Vision Transformer 把 Transformer 架构搬到图像领域:把图片切成小块当 token 输入。它证明注意力机制不只适用于文本,在大数据量下超越了 CNN。 ViT 的成功是对“归纳偏置”价值的重新思考:...
目标检测:AI 如何“框住”世界
目标检测不仅要识别图片里有什么,还要定位它们在哪里——用矩形框标出每个物体并给出类别。它是自动驾驶、安防监控、工业质检的底层能力。 目标检测让 AI 从“这是什么”进化到“这在哪里”。...
语义分割:给图像的每个像素分类
语义分割给图像的每个像素打上类别标签——天空、道路、行人、车辆。如果说目标检测是画框,语义分割就是精细的填色,是场景理解的基础。 语义分割代表着一种极致的精确:不满足于知道“图里有...
实例分割:既分类又区分个体
实例分割结合了目标检测与语义分割:不仅要分出每个像素属于哪类,还要区分同类物体的不同个体。三个人各自有独立的 mask,而不是糊成一团。 实例分割的难点很有意思:机器很容易认出“这是人”...
图像分类:计算机视觉的第一课
图像分类回答最基本的问题:这张图属于哪一类?猫还是狗、正常还是病变。它看似简单,却是整个计算机视觉的起点,无数更复杂的任务都建立在分类能力之上。 图像分类的历史是一部“从认不出猫狗...
人脸识别:从检测到比对的完整链条
人脸识别包含一整套流程:先检测人脸位置,再提取特征向量,最后与数据库比对身份。它已广泛用于解锁、支付、门禁,也引发了严重的隐私讨论。 人脸识别是技术双刃剑的典型案例:一边是秒级完成...
OCR:让机器看懂文字
OCR(光学字符识别)把图片中的文字转成可编辑的文本——从扫描件到街景路牌,从发票到身份证。它是 AI 最实用、普及最广的能力之一。 OCR 的价值在于它是“数字世界与纸质世界的翻译官”。数以...
卷积神经网络(CNN):AI 的眼睛
卷积神经网络是为图像而生的架构:用小窗口(卷积核)在图像上滑动提取局部特征,再逐层组合成高级概念。它让计算机视觉从实验室走向了现实世界。 CNN 的设计充满仿生智慧:人类视觉皮层也是先...













