微软 AI 新技术:让你的头像照片动起来,并有感情地“讲话”

作者: 肖漫 2019-10-10 09:41:54

 本文转自雷锋网,如需转载请至雷锋网官网申请授权。

越来越多的研究表明,只要有足够多的语料库,人类的面部动作和语音行为是能够同步的。两年前,卡内基·梅隆大学的研究人员曾发表了一篇论文,叙述了一种将一个人的面部动作转移至另一个人的方法。

而就在今年六月份的时候,三星的应用科学家就介绍了一种端对端的模型,能够将人头部特写中的眉毛、嘴巴、睫毛和脸颊生成动画。仅仅几周后,Udacity 展示了一个可以从音频旁白中自动生成站立演讲视频的系统。

基于前面的研究和工作,微软研究团队在本周提出了一项技术。他们宣称,这一技术能够提升传声头像动画的逼真度。在此之前,头部动画的生成需要清晰,相对无噪声的音频以及中性的音调。而现在,研究人员表示,他们的技术能够将音频序列分解成语音内容和背景噪声等因素,由此可以使用有噪声和“有感情色彩”的数据样本。

雷锋网注:图片来源于 Microsoft

众所周知,语音是具有差异性的。不同的人在不同的环境下使用同一个词,其持续性、振动幅度、语调等等都各不相同。除了语音内容方面,语音自身还承载着丰富的信息,它能够揭示人的情绪状态,身份(性别、年龄、种族)和个性等。

事实上,微软研究人员提出的技术是基于学习潜在显示的变自编码器(雷锋网(公众号:雷锋网)按:variational autoencode,VAE)。VAE 能够将输入的音频分解成不同的表现形式,包括编码内容、表情以及其它变化的因素,在输入音频的基础上,从分布中采样一些内容表示序列,该序列连同输入的人脸图像一同被馈送到视频生成器进行面部动画处理。

为了训练和测试 VAE,研究人员选取了三个数据集,分别如下:

  • GRID:这是一个视听语料库,每个语料库包含了 34 为说话者的 1000 份录音;

  • CREMA-D:包含了 7442 个影视片段,来自 91 位不同种族演员;

  • LRS3:包含了超过 10 万个 TED 视频中的口语句子的数据库。

研究人员将 GRID 和 CREMA-D 的数据输入到模型中,让其识别语音和情感表征,然后使用一对定量指标——峰值信噪比(PSNR)和结构相似度指数(SSIM)——来评估视频生成的质量。

该研究团队表示,就表现而言,他们的方法和其它清晰的、中性的口语表达方法在所有指标上都是一样的。并且他们注意到,这种方法不仅能够在整个情绪光谱上持续表现,还能够兼容所有目前最先进的传声头像方法。

值得一提的是,其变种特异性的可学先验方法还能够扩展到其它语音因素,例如身份和性别,这些因素能够作为未来工作的一部分探索。通过对噪音和情绪音频样本进行测试,研究人员验证了其模型,表明了在音频变化的情况下,该方法是优于目前已有的技术水平的。

注:本文编译自 KYLE WIGGERS 发表于 venturebeat 上的文章。

AI 数据 人工智能
上一篇:谷歌发布含7种语言的全新数据集:有效提升BERT等多语言模型任务精度高达3倍! 下一篇:人工智能改善教育的32种方式
评论
取消
暂无评论,快去成为第一个评论的人吧

更多资讯推荐

人工智能项目:需要注意的七件事

维度R的一份报告显示,十分之八的AI失败了,而96%的AI则在标注,标明和建立模型置信度方面遇到了问题。以下是人工智能项目失败的7个常见原因。

闻数起舞 ·  19h前
2020年第一季度人工智能的最新进展

人工智能曾经只是科幻小说,是计算世界的遥不可及的梦想,如今已成为现实。 人工智能,简称AI,是用来描述机器模拟人类智能的能力。

闻数起舞 ·  1天前
2020年优秀AI软件开发工具

人工智能对软件工程和科技公司的影响不可否认,而且还在不断增加。 有许多组织正在利用这项革命性的技术来创建开箱即用的功能强大的Web和移动应用程序。 无论大小,企业都可以利用AI来提高投资回报率,提高效率并很大程度地降低运营风险。

闻数起舞 ·  1天前
人工智能可以塑造活动产业的未来吗?

活动组织者可以为活动管理引入AI,以使他们的活动更加成功。现场活动是很好的营销方式,也是增强业务与客户关系的优秀方式。根据一项调查,84%的领导者认为活动是其业务成功的关键因素。技术的使用正在改变活动的计划和组织方式。

佚名 ·  2天前
提升城市气质守护宜居环境 AI打通治理闭环

人工智能被一些研究人员称为“21世纪的电力”,认为其几乎可以为万事万物提供动力。而在城市加速发展的当下,人工智能也渐渐成为了新型智慧城市建设的“推动者”和“守望者”。

今夕何夕 ·  2天前
12个场景应用,百余种算法,AI是如何攻占经济学的?

在虚拟世界中模拟现实经济状况,想法设计更好的制度只是AI和经济学结合方式之一。其实深度强化学习在面临风险参数和不确定性不断增加的现实经济问题时,也可以提供更好的性能和更高的精度。

蒋宝尚 ·  3天前
你在打王者农药,有人却用iPhone来训练神经网络

在 iOS 设备上也可以直接训练 LeNet 卷积神经网络,而且性能一点也不差,iPhone 和 iPad 也能化为实实在在的生产力。

佚名 ·  3天前
未来20年,全自动驾驶和互联汽车会出现吗?

在这篇博文中,重点介绍了汽车技术如何使交通更安全、更智能、更有趣。

Huibert Verhoeven ·  3天前
Copyright©2005-2020 51CTO.COM 版权所有 未经许可 请勿转载