计算机视觉是什么?
人类用眼睛和大脑看世界,一秒钟就能认出「这是一只猫」。计算机视觉(CV)要做的,就是让机器也学会这套本领——从一张图或一段视频里,认出物体、看懂场景、追踪运动,甚至理解正在发生什么。它是怎么工作的?
图像就是数字对机器来说,一张照片其实是一大堆像素数字,每个像素有红绿蓝三个值。计算机视觉的任务,就是从这些数字里「看出」猫、车、人脸。
从特征到语义
早期的做法是手工设计特征,如今更多靠卷积神经网络(CNN)自动学。网络一层层提炼,从边缘、纹理,再到眼睛、耳朵,最后拼出「猫」这个概念。
它已经用在哪些地方?
自动驾驶摄像头实时识别车道线、行人、车辆和交通标志,帮车「看清」路况。
安防监控
从海量录像里自动发现异常,甚至识别人脸和车牌。
医疗影像
AI 帮医生在 CT、X 光片里找病灶,早发现早治疗。
手机拍照
人像模式、夜景合成、扫码,背后都是计算机视觉。
它难在哪?
对人类「一眼就懂」的事,机器其实很难:遮挡、光照变化、角度不同,都会让它「看走眼」。这也是为什么它需要海量标注数据来训练。一句话记住:计算机视觉,就是给机器装上一双能「看懂」世界的眼睛。
评论