逼近真人的语音，阿里语音技术片面晋级，移动端离线语音辨认及合成效果媲美云端

大佐熊 · 2020-9-18 15:04:55

9月18日，在2020云栖大会上，达摩院公布了语音AI技术的最新打破：端上语音辨认和语音合成才能初次达到媲美云端的程度，这意味着将来个人用户在移动终端即可轻松体验逼近真人的语音技术。据引见，达摩院最新的语音技术已在淘宝直播、钉钉会议、高德导航等场景大规模运用，正片面对外开放。

语音AI的核心是让机器听懂人话、并能启齿说话，语音合成和语音辨认技术是完成这些目的的基础。但由于过去几年业界在语音模型上未能有打破性创新，高精度的语音交互义务长期依赖云端算力，形成了语音指令处理不可避免的延时等成绩。

此次达摩院率先在算法模型上完成创新，推出E2E-ASR端到端语音辨认技术及全新的端上KAN-TTS语音合成技术，初次在移动终端上完成接近云端的语音辨认与合成效果。

据引见，在语音辨认方面，达摩院提出SAN-M网络结构及基于SCAMA的流式端到端语音辨认框架，提升计算效率的同时，还将高难度场景中的语音辨认错误率降低近三成。达摩院研发的语音辨认系统，可纯离线、低成本部署在手机端，原型系统不到40MB，辨认效果媲美超过100GB的达摩院上一代DFSMN-CTC云端系统。

继去年发布仿真率可达97%的自研KAN-TTS语音合成模型后，达摩院此次在移动端完成了对语音模型的"大瘦身"，相比云端，端上模型大小紧缩了101倍，计算量紧缩35倍，经过终端算力即可疾速复现逼近真人的语音。例如，高德地图近期发布了应用达摩院全新语音技术合成的李佳琦、林志玲、小团团等明星导航语音包，语音效果较之前更自然，断网形状下语音导航也不会中缀。

达摩院语音实验室担任人鄢志杰表示，"在终端处理语音义务不断是学术界和工业界的难题，达摩院最新的语音技术有效释放了终端设备的才能，让终端也能轻松处理语音义务，我们置信，在终端算力和云端算力的协同支撑下，将来语音交互将无处不在。"

过去几年，阿里语音AI获得了一系列打破。2019年，阿里语音AI当选《麻省理工回复》"全球十大打破性技术"，是独一上榜的中国科技公司；往年7月IDC发布的《中国AI云服务市场半年度研讨报告》显示，阿里语音AI以44%的市场份额，在云上语音AI市场中位居第一。

小刘的书 · 2020-9-18 20:56:52

不聊了，又该去搬砖了。。。

1无语in · 2020-9-19 15:43:13

支持你哈...................................

我是你野爹 · 2020-9-20 14:57:36

呵呵，低调，低调！

		自动登录	找回密码
密码			立即注册

逼近真人的语音，阿里语音技术片面晋级，移动端离线语音辨认及合成效果媲美云端

本帖子中包含更多资源

大神点评3

最近发表

公社版块

关注我们