造假AI又进化!只要一张照片,说话唱歌视频自动生成

作者: 郭一璞 白安妮 2019-06-23 17:30:07

本文经AI新媒体量子位(公众号ID:QbitAI)授权转载,转载请联系出处。

曾造出无数“小视频”、恶搞过多位明星的知名换脸神器Deepfakes,这下被降维打击了。

这个新AI不再是篡改视频了,而是直接把一张静态的照片变成视频。

像这样,一张施瓦辛格:

造假AI又进化!只要一张照片,说话唱歌视频自动生成

开始说话了:

造假AI又进化!只要一张照片,说话唱歌视频自动生成

饶舌歌手Tupac Shakur:

造假AI又进化!只要一张照片,说话唱歌视频自动生成

也能张嘴了:

造假AI又进化!只要一张照片,说话唱歌视频自动生成

只要有一张静态的人脸照片,甭管是谁,在这个新AI的驱动下,任意配上一段语音,就能张嘴说出来。

当然,除了说话之外,唱歌也毫无问题,比如让生活在一百多年前的“俄罗斯妖僧”拉斯普京唱碧昂丝的Halo。

虽然声音和性别不太匹配,但是画面和歌曲组合起来有种莫名的鬼畜感呢。

你也别以为这个AI只能给照片对口型,它还可以让这个说话的人拥有喜怒哀乐各种情绪。

开心的:

造假AI又进化!只要一张照片,说话唱歌视频自动生成

难过的:

造假AI又进化!只要一张照片,说话唱歌视频自动生成

炸毛的:

造假AI又进化!只要一张照片,说话唱歌视频自动生成

这眉眼,这目光,这脸部肌肉,得拯救多少“面瘫”演员啊!

这项研究来自帝国理工学院和三星,研究者们还准备了一套包含24个真假难辨的视频的图灵测试,我们简单测了一下,只能猜对一半左右。

也就是说,这些AI生成的“真假美猴王”,足以蒙骗人类了。

相比此前的斯坦福输入任意文本改变视频人物口型的研究,以及三星的说话换脸,实现难度可以说高了很多。

不少网友闻之色变:

造假AI又进化!只要一张照片,说话唱歌视频自动生成

现在是拉斯普京唱Halo,以后会不会整出川普向墨西哥选战啊,感觉怕怕的。

连科技媒体The Verge都评价说:

造假AI又进化!只要一张照片,说话唱歌视频自动生成

这样的研究总让人们担忧,怕它会被用在谣言和政治宣传上,实在是让美国立法者们伤脑筋。当然,你也可以说这种在政治领域的威胁没那么严重,但deepfakes已经确确实实伤害了一些人,尤其是女性,在未经同意的情况下被用来制造了又难堪又羞辱的色情视频。

也有人觉得,等技术普及之后会给做坏事的人掩盖的理由:

造假AI又进化!只要一张照片,说话唱歌视频自动生成

等这技术成熟了,川普真的干坏事的小视频出来,他就可以轻描淡写的说这是假视频。

呵呵,真棒,以后坏人们被捏到把柄的时候,就都能说“没有的事啦,是假视频。”

多鉴别器结构

如何用一张照片做出连贯视频?研究人员认为,这需要时序生成对抗网络(Temporal GAN)来帮忙。

逻辑上不难理解,如果想让生成的假视频逼真,画面上至少得有两点因素必须满足:

一是人脸图像必须高质量,二是需要配合谈话内容,协调嘴唇、眉毛等面部五官的位置。也不用动用复杂的面部捕捉技术,现在,只用机器学习的方法,就能自动合成人脸。

这中间的秘诀,就在于时序生成对抗网络,也就是Temporal GAN,此前在2018年提出过这个研究。

这是一个端对端的语音驱动的面部动画合成模型,通过静止图像和一个语音生成人脸视频。

在Temporal GAN中有两个鉴别器,一个为帧鉴别器,确保生成的图像清晰详细,另一个是序列鉴别器,负责响应听到的声音并产生对应的面部运动,但效果并不那么优异。

造假AI又进化!只要一张照片,说话唱歌视频自动生成

 Temporal GAN模型示意图

论文End-to-End Speech-Driven Facial Animation with Temporal GANs 地址:

https://arxiv.org/abs/1805.09313

在这项工作,研究人员借用这种时序生成对抗网络,使用两个时间鉴别器,对生成的视频进行视听对应,来生成逼真的面部动作。

同时还鼓励模型进一步自发产生新的面部表情,比如眨眼等动作。

所以,最新版基于语音的人脸合成模型来了。模型由时间生成器3个鉴别器构成,结构如下:

造假AI又进化!只要一张照片,说话唱歌视频自动生成

这是一个井然有序的分工结构,生成器负责接收单个图像和音频信号作为输入,并将其分割为0.2秒的重叠帧,每个音频帧必须以视频帧为中心。

这个生成器由内容编码器(Content Encoder),一个鉴别编码器(Identity Encoder)、一个帧解码器(Frame Decoder)和声音解码器(Noise Generator)组成,不同模块组合成一个可嵌入模块,通过解码网络转换成帧。

造假AI又进化!只要一张照片,说话唱歌视频自动生成

这个系统使用了多个鉴别器来捕捉自然视频的不同方面,各部分各司其职。

帧鉴别器(Frame Discriminator)是一个6层的卷积神经网络,来决定一帧为真还是假,同时实现对说话人面部的高质量视频重建。

序列鉴别器(Sequence Discriminator)确保各个帧能形成一个连贯的视频,显示自然运动。

同步鉴别器(Synchronization Discriminator)加强了对视听同步的要求,决定画面和音频应该如何同步。它使用了两种编码器获取音频和视频的嵌入信息,并基于欧式距离给出判断。

同步鉴别器的结构如下:

造假AI又进化!只要一张照片,说话唱歌视频自动生成

就是这样,无需造价高昂的面部捕捉技术,只需这样一个网络,就能将一张照片+一段音频组合成流畅连贯的视频了。

30多篇CVPR的作者

这项研究共有三位作者,分别为Konstantinos Vougioukas、Stavros Petridis和Maja Pantic,均来自伦敦帝国学院iBUG小组,主攻智能行为理解,其中二作和三作也是英国三星AI中心的员工。

造假AI又进化!只要一张照片,说话唱歌视频自动生成

一作Konstantinos Vougioukas2011年在佩特雷大学获得电气与计算机工程专业的本科学位后,奔赴爱丁堡大学攻读人工智能方向的硕士学位。

造假AI又进化!只要一张照片,说话唱歌视频自动生成

现在,Konstantinos Vougioukas在伦敦帝国学院的Maja Pantic教授(本文三作)的指导下攻读博士,主要研究方向为人类行为合成和面部行为合成。

Maja Pantic教授是iBUG小组的负责人,也是剑桥三星AI中心的研究主任,她在面部表情分析、人体姿态分析、情绪和社会信号是挺分析等方面发表过超过250篇论文,引用次数超过25000次。

造假AI又进化!只要一张照片,说话唱歌视频自动生成

从2005年开始,Maja Pantic带学生发了30多篇CVPR(包含workshop)论文。

Maja Pantic教授主页:

https://ibug.doc.ic.ac.uk/people/mpantic

传送门

论文Realistic Speech-Driven Facial Animation with GANs地址:

https://arxiv.org/abs/1906.06337

项目主页:

https://sites.google.com/view/facial-animation

GitHub:

https://github.com/DinoMan/speech-driven-animation

AI 数据 人工智能
上一篇:聚焦AI应用实践与行业赋能,WOT2019全球人工智能大会圆满收官! 下一篇:5 款不错的开源语音识别/语音文字转换系统
评论
取消
暂无评论,快去成为第一个评论的人吧

更多资讯推荐

大数据与AI如何助力食品饮料行业发展?

数字化几乎颠覆了每一个行业,从金融服务到医疗保健,而食品和饮料行业也不例外。从历史上看,风味特点、潮流和新的食品主要归功于厨师和产品开发人员。而在将一个创意转化成产品并推向市场之前,可能需要花费几个月甚至是几年的时间。

至顶网 ·  15h前
研究公司统计了9大AI领域,分析了世界各国AI法律举措

世界各国政府正在迅速采取行动,以确保现有的法律、法规以及框架,能够在人工智能技术变革中继续起效,应对由新浪潮带来的种种新挑战。

佚名 ·  16h前
护卫中小学生安全,如今已离不开机器人!

近年来,生活水平的提升、二胎政策的放宽都推动了全国儿童人口的增多,但同时也使得遭遇安全事故的儿童比例大幅上升。在此情况下,儿童安全问题不容忽视。

林中易木 ·  23h前
华为全场景 AI 计算框架MindSpore开源!

华为Mindspore AI计算框架正式开源,标志着华为向自己的AI梦想,迈出了新的一步,而深度学习开源领域,又迎来了一位重量级的玩家。

佚名 ·  1天前
人工智能会扮演好医生的角色吗?

人工智能技术的发展日新月异。它不仅在娱乐和通信领域发挥作用,而且在未来的健康和生活领域做出重要贡献。在一些国家,人工智能技术已经融入强大的分析工具,以帮助医院的医生诊断癌症和其他疾病。但是人工智能会取代医生的角色吗?

风车云马 ·  1天前
人工智能辅助下社交媒体营销人员的十大戒律

如果我告诉你,在社交媒体中使用人工智能工具(并正确地使用)能够增强每名用户的消费者旅程,从而留下更多的用户,且留存时间更长,会怎么样呢?

读芯术 ·  1天前
2020~2030:人工智能将占据主导地位的十年

AntWorks预测,在未来十年中,很难找到一个没有利用AI来智能地自动化业务流程的行业。在所有行业中都有无数的AI用例,这是我们对2020年及以后的预测。

CDA数据分析师 ·  2天前
AI人工智能在2020年的7个发展趋势

随着对其他AI应用程序需求的增长,企业将需要投资有助于其加快数据科学流程的技术。然而:实施和优化机器学习模型只是数据科学挑战的一部分。

CDA数据分析师 ·  3天前
Copyright©2005-2020 51CTO.COM 版权所有 未经许可 请勿转载