学径 LearnPath

CAICP-E · 人工智能基础 / Wiki

图像识别

给图片一个名字或判断的技术。电脑先看见许多小格子,再一层层看局部。

它是什么

图像识别,是给图片一个判断或标签的技术。它是 人工智能最常见的本领之一。

电脑没有真正的眼睛。它先把图拆成很多小格子,每个格子有颜色。这些小格子叫像素

像素是材料,不是故事。人看见「一只黄猫在跑」;机器先看见一排排颜色数字。

再从像素里抽出特征,例如颜色、形状、边缘。边缘就是颜色突然改变的地方,轮廓常常藏在这里。最后把特征拿去对照,贴上标签。标签是名字,例如:猫、人脸、口算题、不是人脸。

整条路可以记成:

像素 → 特征 → 标签

对照用的本领,来自很多带名字的图。那些图就是 训练数据

名字从哪来

很早的计算机只能处理数字和文字。让机器「看图」,是另外一门功课。

研究者先试过用手写规则:遇到这种边就当眼睛,遇到那种颜色就当叶子。规则很快就写不全——世界上的猫、字、人脸,变化太多了。

2009 年前后,斯坦福大学李飞飞等人推动 ImageNet 图像库。里面有上千万张带名字的照片,分成许多类。有了这么大的「看图作业」,机器才有足够粮食。

2012 年,一次叫 ImageNet 的看图比赛里,一个深度网络成绩一下子好了很多。它用的是卷积神经网络(常简称 CNN)。对小学生,可以记成:一层层看局部——先看小块的边和颜色,再拼成更大的形状,最后给出名字。

这次比赛被看成现代计算机「看图」的转折点。后来,人脸解锁、拍题批改、闸机认人,才慢慢走进校园。

怎么工作

日常可以记三步。

  1. 像素:照片被切成格子,每个格子记下颜色。
  2. 特征:程序寻找颜色、形状、边缘这些样子。
  3. 标签:对照学过的例子,给出名字或判断。

那种一层层看局部的方法,把第 2 步做细了:第一层常看很局部的小边;下一层把小边凑成耳朵、轮子、笔画;再下一层才比较像「猫」「车」「口算题」。它不是一次把整张图当故事读完,而是一层层凑出来的。

把画倒过来,它可能写成别的东西。颜色还在,形状和边的方向变了。如果它很少见过倒着的猫,就会迷糊。口罩、逆光、只拍到后脑勺,也会让特征变少;特征变少,标签就不稳。

生活里

校园里:

  • 校门口闸机看脸决定开门
  • 作业软件拍口算,认出题目并批改
  • 图书馆自助机扫描封面找书

家里和城市里:

  • 手机用人脸解锁
  • 相册自动把「海边」「猫咪」归到一堆
  • 车站、机场的证件对照(仍要工作人员把关)
  • 医院里辅助看片子(仍要医生把关)

注意:有摄像头,不等于有图像识别。有的镜头只把画面传给人看;当软件开始「认出这是谁、这是什么」,才更像这一条技术。

相近差别

它和 语音识别是一对:一个管看,一个管听。都是先变成电脑能处理的东西,再抽特征,再贴结果。

它和「生成图片」也不一样。识别是给已有的图起名字;生成是凭文字或样本画出新图。把别人的脸贴到另一张图上,可能变成 深度伪造

它也和 推荐不一样。识别回答「这是什么」;推荐回答「下一步给你什么」。一个拍题 App 可以先识别题目,再推荐练习——那是两样技术接在一起。

人和机器在这里差得很明显。人有 人类智能,倒着仍可能认出同学;闸机却可能卡住。

常见误会

误会 1:电脑看见的是故事。

它先看见格子。故事是人脑补的。

误会 2:像素就是标签。

像素是材料,标签是最后的名字,中间还隔着特征。

误会 3:它能认出人脸,就真正认识这个人。

它在匹配样子。它不会像朋友那样记得你今天难过。

误会 4:认错了一定是镜头坏了。

也可能是光线、角度、训练数据不够多样。数据偏了,还可能出现 偏见

误会 5:卷积神经网络是一只真的神经网络动物。

它只是一种一层层看局部的计算方法。名字听起来像脑子,并没有真正的眼睛和感情。

想知道更多

  • 书:蔡宗翰《写给小学生看的 AI 课》(用拍照、认物讲机器怎样看)。
  • 书:《图解 10 岁就懂的 AI 入门》。
  • 书:清华大学《人工智能通识(小学版)》。
  • 电影:《超能陆战队》里大白会「看见」人需要帮助,那是科幻。真的图像识别只给标签,不会心疼。
  • 纪录片:《阿尔法狗》讲棋;《你好,人工智能》里常有人脸、车辆识别的片段。和家长一起看。

未登录时不会保存学习进度