学径 LearnPath

CAICP-E · 人工智能基础 / Wiki

深度伪造

用技术做出很像真人的假脸或假声音。偷拍和假语音是不当使用。

它是什么

深度伪造,指用 人工智能做出「很像某个人」的假声音、假图片或假视频。

它看起来真,听起来也真,可那不是这个人亲口说的,也不是这个人当时的样子。

名字来自英文 deepfake。deep 指深度学习这一类技术,fake 的意思是假的。

伪造的目的,常常是让别人相信假消息。即使声称「只是开玩笑」,也可能让人难堪,也可能扰乱班级秩序。

偷拍别人的脸、拿别人的声音做假语音,都是不当使用。

要能认出来:假声音、假图片,都可能在伤害人。

名字从哪来

换脸、配音,电影工业里早就有。那多半是专业团队、很多设备和许可。

2010 年代,生成模型让「做出很像真人的脸和声音」变得更容易。2017 年,deepfake 这个词开始流传。它被用来称呼:用深度学习把一张脸接到另一段影像上,或合成很像某人的说话声。

对小学生,不必去追这个词最早出现在哪个网站。要记住年份和含义:大约从 2017 年起,普通人更容易做出「很像真的」假材料。

后来出现了更多换脸、变声工具。有的用在电影特效、游戏、教学演示,经过同意,可以是正当用途;有的用来做假通知、恶搞同学、冒充家长。技术是同一类,对不对得起人,完全看使用。详见 伦理

怎么工作

不必会写程序,也能抓住大意。

假脸。 系统先看很多人的脸,学会「五官怎样摆」;再看某一个人的许多张照片,学会「他长什么样」;然后把这张脸接到另一段画面上。于是你看见「他」在做他没做过的动作。

假声音。 系统先把说话切成很小的声音零件;再学习某一个人的音色;然后用新的字,拼出「很像他」的一段话。于是你听见「老师」在说她没说过的话。

材料常常来自清晰的正脸和长段录音。所以陌生软件要你「录十秒钟」「拍一张正脸」,要格外小心——那些都可能成为伪造的材料。训练数据需要允许;你的脸和声音,更需要允许。

因为它很像,所以不能靠「我一看就知道是假的」。要靠当面核实。

生活里

校园里最需要立刻认出的,是假通知和换脸恶搞。

  • 有人传来一段「老师的声音」:今天作业全免
  • 有人把同学的脸贴到别的图片上,做成表情包
  • 有人模仿家长的声音,让人以为「来接孩子了」

这些都会造成伤害。那位同学却从未同意。

电影和游戏里,经过许可的换脸、配音,是另一回事。那是工作,有人签字,有人负责。课间平板上的恶搞,通常没有许可。

收到奇怪的声音或图片,走三步:

  1. 停下:先不转发。
  2. 核实:问本人,问老师,问家长。
  3. 报告:如果已经有人被伤害,或有人在偷拍、在造假,告诉大人。

记住短句:

看起来真,先当它可能是假的。

相近差别

它和 语音识别方向相反。识别是把真的说话写成字;伪造是把字变成假的说话。

它和 图像识别也不一样。识别给已有的图起名字;伪造造出一张「像某人」的新图或新视频。

它和普通修图、变声娱乐有程度差别。把天空修得更蓝,通常不冒充某一个人;深度伪造专门让你以为「就是那个人」。

它和 技术局限里的「说得像真的却可能编」也要分开。聊天程序编错知识,常常不是为了冒充你的老师;深度伪造更常对准某一个人的脸和声音。一个是不稳,一个是冒充。

常见误会

误会 1:假得这么像,所以一定是真的。

越像,越要核实。

误会 2:写了「仅供娱乐」就不算伤害。

被换脸的人可能仍然很难堪。同意不能靠一行小字替别人做主。

误会 3:我分得清,转发也没关系。

别人未必分得清。转发会让伤害变大。

误会 4:只有大人才会遇到伪造。

班级群、课间平板,都可能出现假声音。

误会 5:没问过就拍,只要不上传就没事。

偷拍本身已经拿走别人的样子。上传是第二错,不是第一错的免死金牌。

想知道更多

  • 书:蔡宗翰《写给小学生看的 AI 课》。
  • 书:《图解 10 岁就懂的 AI 入门》。
  • 书:清华大学《人工智能通识(小学版)》。
  • 电影:《超能陆战队》《机器人总动员》不是讲伪造的片子,但可以问:如果大白的声音被人拿去发假通知,该怎么办。
  • 电影:《她》(Her)里的声音很像真人,题材偏大,和家长一起看,并讨论:听见声音,怎样确认是本人。
  • 纪录片:《你好,人工智能》。遇到「换脸」「假语音」新闻,和家长一起辨别,不要点来路不明的链接。
  • 小说:阿西莫夫《我,机器人》(和家长,科幻不是说明书)。故事里的机器规则,管不住现实里的伪造。管住伪造的,是人和法律。

未登录时不会保存学习进度