训练数据
给人工智能看的大量带名字的例子。没有它们,机器的本领长不大。
它是什么
训练数据,就是给 人工智能看的很多例子。例子可以是:
- 照片,旁边写着「猫」或「不是猫」
- 声音,旁边写着对应的字
- 练习的对错记录
- 点过的书、停留的时间
很多例子还带着标签:人对它起的正确名字。有标签的例子,叫标注数据。机器靠对照这些名字来学。
所以常有一句话:
数据是人工智能的粮食。没有粮食,就没有学习。
粮食少,学得浅;粮食偏,容易歪;粮食乱,更容易认错。
数据和人工智能是互相养活的。有数据,本领才长得出来;有了本领,它才能去认新的声音和图片。
名字从哪来
早期程序主要靠人写规则。规则写得下,就不那么依赖海量例子。可世界太复杂,规则写不全。
后来研究者发现:给机器看大量带名字的例子,它能自己调出有用的对照办法。语音要听很多人读同一个词;图像要看很多张同一种东西的照片。
2009 年前后,一个叫 ImageNet 的大型图像库,把上千万张照片标上类别。2012 年的看图比赛证明:粮食够大、算法够深,图像识别会突然准很多。语音识别在 2010 年代也靠海量录音进步。
「训练」这个词,意思很像练习。不是机器去上体育课,是程序拿例子一遍遍调整,直到对新例子也比较准。
今天,谁的数据更全、标得更对,常常决定谁的工具更稳。同时也带来新问题:别人的脸和声音,不能偷偷拿来当粮食。
怎么工作
可以想成三步。
- 收集:把真实生活里的声音、图片、记录聚到一起。
- 标注:给例子起对的名字。把口算题标成作文,后面就会越学越糊。
- 训练:程序反复对照,调整内部的匹配方式。
用的时候,再拿新例子来试。这叫测试或检验。训练时见过的例子,不能完全代表从没见过的新情况。
检查粮食,可以用三个字:
| 字 | 含义 | 生活例子 |
|---|---|---|
| 多 | 数量够不够 | 班徽照片只有三张,太少 |
| 全 | 样子够不够多样 | 只有晴天正面,没有雨衣、侧脸 |
| 净 | 名字和内容对不对 | 不要标错,也不要偷偷塞进别人的脸 |
「净」还有一层:要得到允许。你交出去的每一张图、每一段音,都可能变成粮食。
质量、数量、偏见,三件事缠在一起。很多但很单一,仍然会偏;少而乱,更学不稳。
生活里
学认班级徽章,要看很多张照片:有正面的,有歪的,有被手挡住的。只看一张,太容易误导。
学听单词,要听很多人读。只听一位同学,换一个人就可能不稳。
学 推荐练习,要看很多人哪一题常错。只看今天一份午餐盘子,不能断定「她从不吃青菜」。一个例子会骗人;多样的例子,才比较像真的生活。
你自己也在「生产」数据。点一条视频、拍一次作业、对着软件读单词,都可能留下记录。所以拍作业要光线够、纸放正;也所以,不能把同学的脸随便喂给陌生软件。
相近差别
训练数据和「普通资料」不一样。一本说明书给人读;训练数据是给程序一遍遍对照用的。它要能被切成例子,并且常常需要标签。
它和模型也不一样。数据是粮食,模型是吃完粮食长出来的本领。没有数据,模型长不大;有了模型,也不等于数据可以乱来。
它和 人类智能用的经验也不完全一样。人看两次班徽往往就会;机器常常要很多张才稳。人还会问「这样拍别人,行不行」;数据自己不会问,人要替它把关。详见 伦理。
常见误会
误会 1:一张特别清晰的照片就够了。
清晰很好,可它只代表一种样子。下雨、侧脸、口罩,仍然没见过。
误会 2:数据越多就一定越好、越公平。
如果很多数据都偏向同一类人、同一种天气,数量多也会偏。
误会 3:没有数据,人工智能也什么都会。
不会。没有例子,本领长不大。
误会 4:标签贴错没关系,反正数据很多。
错的名字会把学习带歪。把口算题标成作文,它会越学越糊。
误会 5:公开在网上的照片,就可以随便拿去训练。
网上能看见,不等于别人同意你拿去训练。人脸和声音更要问过本人。
想知道更多
- 书:蔡宗翰《写给小学生看的 AI 课》(把数据比作粮食,好懂)。
- 书:《图解 10 岁就懂的 AI 入门》。
- 书:清华大学《人工智能通识(小学版)》。
- 纪录片:《阿尔法狗》能看见棋谱怎样变成训练例子;《你好,人工智能》常讲数据从哪里来。和家长一起看。
- 想一想:你愿意把清晰的正脸,交给一个不认识的网站吗?不愿意,就停下。
未登录时不会保存学习进度