微软 AI 新技术:让你的头像照片动起来,并有感情地“讲话”

作者: 肖漫 2019-10-10 09:41:54

 本文转自雷锋网,如需转载请至雷锋网官网申请授权。

越来越多的研究表明,只要有足够多的语料库,人类的面部动作和语音行为是能够同步的。两年前,卡内基·梅隆大学的研究人员曾发表了一篇论文,叙述了一种将一个人的面部动作转移至另一个人的方法。

而就在今年六月份的时候,三星的应用科学家就介绍了一种端对端的模型,能够将人头部特写中的眉毛、嘴巴、睫毛和脸颊生成动画。仅仅几周后,Udacity 展示了一个可以从音频旁白中自动生成站立演讲视频的系统。

基于前面的研究和工作,微软研究团队在本周提出了一项技术。他们宣称,这一技术能够提升传声头像动画的逼真度。在此之前,头部动画的生成需要清晰,相对无噪声的音频以及中性的音调。而现在,研究人员表示,他们的技术能够将音频序列分解成语音内容和背景噪声等因素,由此可以使用有噪声和“有感情色彩”的数据样本。

雷锋网注:图片来源于 Microsoft

众所周知,语音是具有差异性的。不同的人在不同的环境下使用同一个词,其持续性、振动幅度、语调等等都各不相同。除了语音内容方面,语音自身还承载着丰富的信息,它能够揭示人的情绪状态,身份(性别、年龄、种族)和个性等。

事实上,微软研究人员提出的技术是基于学习潜在显示的变自编码器(雷锋网(公众号:雷锋网)按:variational autoencode,VAE)。VAE 能够将输入的音频分解成不同的表现形式,包括编码内容、表情以及其它变化的因素,在输入音频的基础上,从分布中采样一些内容表示序列,该序列连同输入的人脸图像一同被馈送到视频生成器进行面部动画处理。

为了训练和测试 VAE,研究人员选取了三个数据集,分别如下:

  • GRID:这是一个视听语料库,每个语料库包含了 34 为说话者的 1000 份录音;

  • CREMA-D:包含了 7442 个影视片段,来自 91 位不同种族演员;

  • LRS3:包含了超过 10 万个 TED 视频中的口语句子的数据库。

研究人员将 GRID 和 CREMA-D 的数据输入到模型中,让其识别语音和情感表征,然后使用一对定量指标——峰值信噪比(PSNR)和结构相似度指数(SSIM)——来评估视频生成的质量。

该研究团队表示,就表现而言,他们的方法和其它清晰的、中性的口语表达方法在所有指标上都是一样的。并且他们注意到,这种方法不仅能够在整个情绪光谱上持续表现,还能够兼容所有目前最先进的传声头像方法。

值得一提的是,其变种特异性的可学先验方法还能够扩展到其它语音因素,例如身份和性别,这些因素能够作为未来工作的一部分探索。通过对噪音和情绪音频样本进行测试,研究人员验证了其模型,表明了在音频变化的情况下,该方法是优于目前已有的技术水平的。

注:本文编译自 KYLE WIGGERS 发表于 venturebeat 上的文章。

AI 数据 人工智能
上一篇:谷歌发布含7种语言的全新数据集:有效提升BERT等多语言模型任务精度高达3倍! 下一篇:人工智能改善教育的32种方式
评论
取消
暂无评论,快去成为第一个评论的人吧

更多资讯推荐

绿色机器人如何帮助环境可持续发展

各种各样的机器人已经被开发出来,它们能够以各种方式帮助保护环境,从扑灭野火,帮助管理垃圾,到清洁海洋和其他水体等。以下是绿色机器人帮助环境可持续发展的几种方法。

iothome ·  15h前
疫情当前,才知道AI原来是这么好用

近日,工信部表示,将部署运用新一代信息技术支撑服务疫情防控工作。并且工信部特别强调,要通过运用人工智能、大数据、云计算等服务疫情监测分析、人员流动和社区管理等,对疫情开展科学精准防控。

Witkey ·  22h前
什么是持续智能?对物联网有什么影响?

物联网世界将迎来充满希望的2020年。5G公司一再声称,2020年是5G在公共领域站稳脚跟,并普及的一年。

iothome ·  1天前
AI战“疫”,偶尔小尴尬背后,终极护城河现形

人类与新型冠状病毒的战“疫”仍然在进行中,在这期间,也催生出各类“人工智能+”应用,人工智能技术在此期间迎来大爆发。

张书乐 ·  2天前
DeepMind发布神经网络、强化学习库,网友:推动JAX发展

JAX由谷歌提出,是TensorFlow的简化库。结合了针对线性代数的编译器XLA,和自动区分本地 Python 和 Numpy 代码的库Autograd,在高性能的机器学习研究中使用。

十三 ·  2天前
谷歌透露:正在内部尝试用AI开发计算机芯片

据谷歌人工智能研究负责人Jeff Dean透露,谷歌正在尝试通过人工智能程序推进专用芯片的内部开发,以加速其软件。在旧金山举行的International Solid State Circuits Conference会上Dean表示:“我们内部正在将人工智能技术用于一系列芯片设计项目中。”

佚名 ·  3天前
人工智能带领人类从信息社会迈向智能社会

人工智能(AI)是指在机器上实现类似乃至超越人类的感知、认知、行为等智能的系统。与人类历史上其他技术革命相比,人工智能对人类社会发展的影响可能位居前列。

新华网客户端 ·  3天前
2020年的7个关键RPA趋势:从人工智能启用到更具战略性的扩展

机器人流程自动化(RPA)服务商Blue Prism公司EMEA地区首席技术官Peter Walker对使企业可以体验采用机器人流程自动化(RPA)优秀结果的2020年有望取得的重大发展进行了预测与分析。

Peter Walker ·  4天前
Copyright©2005-2020 51CTO.COM 版权所有 未经许可 请勿转载