语音识别
把人说的话变成文字或指令的技术。
它是什么
语音识别,是把人说的话变成文字或指令的技术。它是 人工智能最常见的本领之一。英文常叫 Automatic Speech Recognition,意思是:自动把语音认成字。
电脑没有真正的耳朵。它走的是一条加工路:
声音 → 采样(变成数字)→ 特征 → 对照 → 文字
麦克风只负责把空气振动接进来,后面全是数字和匹配。
它能把「打开灯」写成字,或当成口令去执行。它不能保证听出你是高兴还是难过。听懂字,和拥有 人类智能里的感受,不是一回事。
名字从哪来
1952 年,美国贝尔实验室做出一台叫 Audrey 的机器。Audrey 是 Automatic Digit Recognizer 的简称,意思是「自动认数字」。它能听出 0 到 9,而且多半只对一个人的声音比较准。那是语音识别很早的公开成果。
1962 年前后,IBM 展出过 Shoebox(鞋盒)演示机。它能听懂十几个英文词,用来做简单计算。词汇仍然很少。
后来几十年,研究者用统计方法猜「这段声音更像哪个词」。2010 年代,深度学习让正确率明显提高,手机和音箱开始真正走进生活。
2011 年,苹果手机上的 Siri 让很多人第一次对着机器说话。中国也有科大讯飞等公司的语音输入、朗读评测产品。它们是产品例子,用来说明技术已经离开实验室,不是广告,也不必记住品牌排名。
怎么工作
可以记成五步小火车。
- 声音:空气振动,麦克风接到。
- 采样:把连续的振动切成很多小点,记成电脑能存的数字。
- 特征:抽出高低、长短、快慢这些「声音的样子」。
- 对照:拿这些样子去对模型里的样例。
- 文字:对上以后写出字,或执行口令。
模型不是一本普通词典。它是用很多 训练数据学来的:不同人、不同速度、不同环境的读音。
操场风大时,它可能写成别的词。那是前面某一步被打乱了,不是它故意开玩笑。
以后你会听到「声学模型」「语言模型」这些词。声学管「这段音像什么」,语言管「这样的字排在一起像不像人话」。现在先把五步排对,就已经抓住基础。
生活里
校园里:
- 英语课对着平板读单词,屏幕跳出对应的字
- 点名音箱听口令,认出是哪位同学
- 口语评测给一句「再大声一点」
家里和城市里:
- 对音箱说「播放课文」
- 手机语音输入发消息
- 车载系统听导航口令
- 电视听「下一集」
这些都是语音识别在工作。有的产品还会接着做 推荐:听完你的问题,再建议下一首或下一课。那是另一种本领,叠在识别后面。
相近差别
它和 图像识别是一对:
| 语音识别 | 图像识别 | |
|---|---|---|
| 材料 | 声音 | 像素 |
| 先变成 | 数字信号 | 小格子的颜色 |
| 再抽出 | 声音的样子 | 颜色、形状、边缘 |
| 最后给出 | 文字或口令 | 标签或判断 |
它和「语音合成」也不一样。识别是听进去、写成字;合成是把字变成假的说话声。把别人的声音拿去合成假通知,属于 深度伪造,是不当使用。
它也不是翻译。识别先把中文说的话写成中文;翻译是把一种语言换成另一种。有的软件两步都做,那是两样技术接在一起。
常见误会
误会 1:电脑长了耳朵。
它有麦克风。麦克风只负责把振动接进来,后面全是数字和对照。
误会 2:它听懂字,就听懂你的心情。
它能写出「我有点难受」。它不会真的着急。
误会 3:听错了就是电脑坏了。
可能太吵,可能说得太快,可能这个词它没学过,也可能麦克风被捂住。口音差得远,对照也会飘。
误会 4:流程是先写出字,再变成数字。
顺序反了。没有采样得到的数字,后面的特征无从谈起。
误会 5:某一种语音助手等于语音识别本身。
Siri、科大讯飞产品都是应用。语音识别是底下那条把声音变成字的技术。
想知道更多
- 书:蔡宗翰《写给小学生看的 AI 课》(有听写、语音助手的生活例子)。
- 书:《图解 10 岁就懂的 AI 入门》。
- 书:清华大学《人工智能通识(小学版)》。
- 电影:《超能陆战队》《机器人总动员》里机器会听话,那是科幻表演,不是实验室说明书。
- 纪录片:《阿尔法狗》主要讲下棋;《你好,人工智能》里常能见到语音助手怎样进家庭。和家长一起看。
未登录时不会保存学习进度