图像识别
给图片一个名字或判断的技术。电脑先看见许多小格子,再一层层看局部。
它是什么
图像识别,是给图片一个判断或标签的技术。它是 人工智能最常见的本领之一。
电脑没有真正的眼睛。它先把图拆成很多小格子,每个格子有颜色。这些小格子叫像素。
像素是材料,不是故事。人看见「一只黄猫在跑」;机器先看见一排排颜色数字。
再从像素里抽出特征,例如颜色、形状、边缘。边缘就是颜色突然改变的地方,轮廓常常藏在这里。最后把特征拿去对照,贴上标签。标签是名字,例如:猫、人脸、口算题、不是人脸。
整条路可以记成:
像素 → 特征 → 标签
对照用的本领,来自很多带名字的图。那些图就是 训练数据。
名字从哪来
很早的计算机只能处理数字和文字。让机器「看图」,是另外一门功课。
研究者先试过用手写规则:遇到这种边就当眼睛,遇到那种颜色就当叶子。规则很快就写不全——世界上的猫、字、人脸,变化太多了。
2009 年前后,斯坦福大学李飞飞等人推动 ImageNet 图像库。里面有上千万张带名字的照片,分成许多类。有了这么大的「看图作业」,机器才有足够粮食。
2012 年,一次叫 ImageNet 的看图比赛里,一个深度网络成绩一下子好了很多。它用的是卷积神经网络(常简称 CNN)。对小学生,可以记成:一层层看局部——先看小块的边和颜色,再拼成更大的形状,最后给出名字。
这次比赛被看成现代计算机「看图」的转折点。后来,人脸解锁、拍题批改、闸机认人,才慢慢走进校园。
怎么工作
日常可以记三步。
- 像素:照片被切成格子,每个格子记下颜色。
- 特征:程序寻找颜色、形状、边缘这些样子。
- 标签:对照学过的例子,给出名字或判断。
那种一层层看局部的方法,把第 2 步做细了:第一层常看很局部的小边;下一层把小边凑成耳朵、轮子、笔画;再下一层才比较像「猫」「车」「口算题」。它不是一次把整张图当故事读完,而是一层层凑出来的。
把画倒过来,它可能写成别的东西。颜色还在,形状和边的方向变了。如果它很少见过倒着的猫,就会迷糊。口罩、逆光、只拍到后脑勺,也会让特征变少;特征变少,标签就不稳。
生活里
校园里:
- 校门口闸机看脸决定开门
- 作业软件拍口算,认出题目并批改
- 图书馆自助机扫描封面找书
家里和城市里:
- 手机用人脸解锁
- 相册自动把「海边」「猫咪」归到一堆
- 车站、机场的证件对照(仍要工作人员把关)
- 医院里辅助看片子(仍要医生把关)
注意:有摄像头,不等于有图像识别。有的镜头只把画面传给人看;当软件开始「认出这是谁、这是什么」,才更像这一条技术。
相近差别
它和 语音识别是一对:一个管看,一个管听。都是先变成电脑能处理的东西,再抽特征,再贴结果。
它和「生成图片」也不一样。识别是给已有的图起名字;生成是凭文字或样本画出新图。把别人的脸贴到另一张图上,可能变成 深度伪造。
它也和 推荐不一样。识别回答「这是什么」;推荐回答「下一步给你什么」。一个拍题 App 可以先识别题目,再推荐练习——那是两样技术接在一起。
人和机器在这里差得很明显。人有 人类智能,倒着仍可能认出同学;闸机却可能卡住。
常见误会
误会 1:电脑看见的是故事。
它先看见格子。故事是人脑补的。
误会 2:像素就是标签。
像素是材料,标签是最后的名字,中间还隔着特征。
误会 3:它能认出人脸,就真正认识这个人。
它在匹配样子。它不会像朋友那样记得你今天难过。
误会 4:认错了一定是镜头坏了。
也可能是光线、角度、训练数据不够多样。数据偏了,还可能出现 偏见。
误会 5:卷积神经网络是一只真的神经网络动物。
它只是一种一层层看局部的计算方法。名字听起来像脑子,并没有真正的眼睛和感情。
想知道更多
- 书:蔡宗翰《写给小学生看的 AI 课》(用拍照、认物讲机器怎样看)。
- 书:《图解 10 岁就懂的 AI 入门》。
- 书:清华大学《人工智能通识(小学版)》。
- 电影:《超能陆战队》里大白会「看见」人需要帮助,那是科幻。真的图像识别只给标签,不会心疼。
- 纪录片:《阿尔法狗》讲棋;《你好,人工智能》里常有人脸、车辆识别的片段。和家长一起看。
未登录时不会保存学习进度