Facebook的AI,已经可以用比尔·盖茨的声音说话

来源:快报
责任编辑:鲁晓倩
字体:

机器语音系统一直有点令人失望:即使是最好的文本语音转换系统也摆脱不了机械的特性,缺乏人类说话时的基本语调变化。斯蒂芬·霍金使用的语音系统就是一个很好的例子。

但近年来,机器学习取得了巨大进步,也改善了机器语音系统的一些缺点。

最近,Facebook 人工智能研究中心的 Sean Vasquez 和 Mike Lewis 发现了一种可以克服从文本到语音系统转换限制,完全由机器生成而且音频片段极其逼真的方法。这一系统被称为MelNet,它不仅可以复制人类的语调,而且可以用与真人相同的声音。于是,研究小组开始训练该系统,让它模仿出比尔·盖茨等人的说话。这项工作让人类和电脑之间更真实的互动成为可能,不仅如此,它的逼真程度,很可能引发虚假音频内容骗术的新问题。

图丨比尔·盖茨(来源:麻省理工科技评论)

现实中的文本—语音转换系统进展缓慢并非是因为缺乏尝试。许多团队一直在尝试训练深度学习算法,利用大型音频数据库重现真实的语音模式。

Vasquez 和 Lewis 说,这种方法的问题在于使用的数据类型。到目前为止,大多数工作都集中在音频波形记录上。这些音频波形显示了声音的振幅如何随时间而变化,它每秒记录的音频包含数万个时间步长。

这些波形能在许多不同的尺度上显示出特定模式。例如,在几秒钟的讲话中,波形反映了与单词序列相关的特征模式。但是在微秒级的片段中,波形显示了与声音的音高和音色相关的特征。在其他尺度上,波形反映了说话人的语调、音素结构等。

另一种方法是将波形在一个时间步长和下一个时间步长之间的关联性考虑进来。所以,在给定的时间范围内,一个单词开头的声音与后面的声音是有关联的。

深度学习系统理应善于学习这些类型的关联性,并对它们进行复制。但问题出在不同时间尺度的关联性上,深度学习系统只能在有限的时间尺度上研究这些关联性。这是因为深度学习使用了一种叫做反向传播的学习过程,这种学习过程不断地重新连接网络,根据所看到的示例改进其性能。

重复率限制了系统学习关联性的时间尺度。因此,深度学习网络可以学习长时间或短时间内音频波形的关联性,但不能同时兼顾两者。这就是为什么它们在复制语音方面表现如此糟糕的原因。

Vasquez 和 Lewis 则有不同的方法。他们使用声谱图而不是音频波形来训练他们的深度学习网络。声谱图记录了整个音频频谱及其随时间的变化。所以当波形捕捉到随时间变化的一个参数,例如振幅时,光谱图则捕捉到了不同频率范围内的振幅变化。

这意味着音频信息被更密集地打包到了这种类型的数据中。研究者认为:声谱图的时间轴比波形的时间轴紧凑几个数量级,这意味着在波形中跨越数万个时间步长的依赖关系只跨越声谱图中的数百个时间步长。

这使得深度学习系统更容易获得关联性。他们说:“这使得我们的声谱模型能够在数秒内产生一致的无条件语音和音乐样本。”

图丨声谱图 VS 波形图(来源:Facebook)

最后的结果令人印象深刻。通过使用 TED 演讲中的普通语音训练系统,MelNet 能够在几秒钟内复制 TED 演讲者的声音,或多或少地说出一些内容。Facebook 的研究人员利用比尔·盖茨的 TED 演讲来训练 MelNet,然后用比尔·盖茨的声音说出一系列随机的短语,以此展示了 MelNet 的灵活性。

“We frown when events take a bad turn.”

这是系统说“当事情变得糟糕时,我们会皱眉”的例子。

当然,该方法也有一些限制。普通言语包含了更长时间尺度上的相关性。例如,在几十秒或几分钟的演讲进程中,人们会使用语调的变化来表示主题或情绪的变化。Facebook 的机器系统似乎还无法做到这一点。

因此,尽管 MelNet 可以创造出非常逼真的短语,但团队还不能让机器完成较长的句子、段落或整个故事。这个目标似乎不是很快就能实现。

然而,这项工作可能会对人机交互产生重大影响。人机交互中许多对话只包含简短的短语。电话接线员和服务台尤其可以使用一系列相对简短的短语。因此,这项技术可以用一种比当前系统更接近人类的方式来优化这些交互。

不过,目前 Vasquez 和 Lewis 对潜在的应用前景守口如瓶。

当然,自然发声的机器也存在潜在的问题,尤其是那些能够逼真模仿人类的机器。很容易想象,这种技术可能被用于恶作剧的场景。正因为如此,这是人工智能的又一进步,它提出的伦理问题比它所能回答的问题要更多。

-End-

编辑:李亚山 责编:黄珊

参考:

https://www.technologyreview.com/s/613647/facebooks-ai-system-can-speak-with-bill-gatess-voice/

坐标:北京·国贸

请随简历附上3篇往期作品(实习生除外)

请注意:本文转载自QQ快报,并不代表本网赞同其观点,版权归原作者所有,本网不承担任何责任,特此声明。

根据您访问的内容,您可能还对以下内容感兴趣,希望对您有帮助:

为什么说Facebook创始人 扎克伯格 比尔·盖茨都是学...

答:可以肯定的是读死书的成绩好的学生以后都难成大气,另外你的眼光可以放远一点,他们并不是学习“不好”,也不能说是“坏学生”,至少比尔·盖茨的学习成绩是很不错的。只不过他选择了退学创业而已。 所谓上学是这样的,学校的作用是给你尽量多的知识...

声明:以上内容由用户提供,并不代表本网赞同其观点。如有任何不妥,请与不良与违法信息举报中心联系:513175919@qq.com

www.book1234.com true http://www.book1234.com/q/20190612/20190612A0FPZZ.html report 28164
娱乐时尚
科技资讯
历史文化
真视界
旅游美食
精彩图文
我爱我车
母婴健康
关于本站 | 广告服务 | 手机版 | 商务合作 | 免责申明 | 招聘信息 | 联系我们
Copyright © 2004-2018 book1234.com All Rights Reserved. 布客网 版权所有
京ICP备10044368号-1 京公网安备11010802011102号
12345678910 热门社会娱乐体育军事汽车财经科技育儿历史美食数码心理时尚宠物收藏家居文化三农健康科学游戏动漫教育职场旅游电影教育考试: 学历财经建筑 医药公考资格外语电脑作文招聘中小学留学 文档 移民 文库专栏23问答中心z资讯z资讯1资讯涨资讯涨资讯1资讯问答图书馆知识IT编程数码信息解决方案信息中心IT科技问答新闻中心软件教室设计大全网络相关英语学习开发编程考试中心参考范文管理文库营销中心站长之家IT信息中心商学院数码大全硬件DIY企业服务网吧在线百科硬件知识手机平板汽车游戏家电精彩摄影现代家居IT女人经验健康养生猎奇创业攻略教育学习历史时尚潮流最近更新涨知识