业界 | IBM 语音识别新方向:仿生蝙蝠耳能用声纳精准“聆听”

蝙蝠使用生物声呐,为夜晚在丛林中飞行导航。他们的超声波脉冲,可以比人造声呐装置更精确地对声音进行定位。为复制、驾驭这种能力,IBM 学院奖获得者 Rolf Müller 教授协同他在弗吉尼亚理工学院(Virginia Tech)的团队,设计了一种人造蝙蝠耳。

Rolf Müller 的研究引起了 IBM 的注意。IBM 专家韩金萍(音译)的神经计算团队,和 IBM Watson 语音专家崔晓东(音译)和他的同事, 看到了 Müller 教授人造“动态外耳”(dynamic peripheral,蝙蝠可转动的外耳使它们的生物声呐更加准确)的潜力 ,并希望借此提高人类语音理解的能力。他们把 Müller 的博士生 Anupam Gupta 纳入团队,一同他们探索人造蝙蝠仿生耳在语音处理的应用。

他们发现,这些仿生耳不仅是很有效的声呐装置,对语音识别同样能起到作用

模仿菊头蝠的人造耳

研究团队根据蝙蝠改变耳朵形状的能力,仿制了一个动态接收系统。它能提高自动语音识别系统(ASR)的精确度,还能更准确地对谈话者定位。韩金萍将在他们的论文《受菊头蝠启发的接收动力学把动态特点加入语音信号》,及本周美国声学协会第 172 届会议上展示了这一发现。

这些动态系统有潜力发展成让使用者“像蝙蝠那样聆听”的语音接收设备。这会改进现有的助听器和指向性传声器。并可应用于任何需要对声音来源进行定位、理解的场景。

设想你身处一个忙碌、吵闹的集市。听清楚你旁边的人在说什么都可能是一项挑战。有了这项技术,同伴的声音就能被一个可变形的助听器识别,然后翻译成你能听懂的话。它还可以过滤掉闹市的杂音,和其他人嗡嗡的说话声。

仿生蝙蝠耳的生物声呐算法

蝙蝠的超声波具有 10 – 200 kHz 的频率,而人耳只能识别 20 Hz – 20 kHz 的声音。因此对我们来说它声调太高,大多数是听不到的。为了驾驭蝙蝠的生物声呐频率和精度,Gupta 加入韩金萍团队编写能够把语音讯号转化为超声波脉冲的代码——然后再把超声波转化为我们能够听到的正常语言。

这首先需要建立一个数据库。为了尽可能地简化,韩金萍团队使用了卡内基梅隆大学开源数据库中,11 个美式英语朗读者的英语字母和数字的发音。

举例子,以字母“A” 或者数字“1”形式出现的数据,被麦克风接收,然后转化为超声波信号。超声波扬声器播放该信号。随后,具有“动态外耳”的人造蝙蝠耳接收信号。最后,软件把超声波信号转化为原始数据——字母“A” 或者数字“1”。

现实(闹市)中的人造耳朵

虽然只包含字母和数字的声音信号数据库有较大限制,但通过分析它,韩金萍团队表示人造耳用“动态、方向性的的时间频率模型”丰富了语音信号。下一步,研究人员把人造耳处理后的声音与原始语音进行对比,来衡量人造耳的精度。因此,他们把原始语音数据和经人造耳处理的声音数据,放入分类器( classifier )中进行识别。67% 的语音信号能被成功识别出来。而在没有动态外耳的对照组中,只有 35% 的声音数据被识别

有了更多的可用分析数据后,研究员们将着手用行业基准来对该系统进行测试,并开发仿生学习算法。再或者,将来他们可能会开发一个“聆听” app,把智能手机麦克风变成接入物联网的指向性麦克风,来帮助使用者选择现实中他想要听到的声音。IBM 研究人员认为,实现它并不是太遥远。

Via IBM

原文发布于微信公众号 - AI科技评论(aitechtalk)

原文发表时间:2016-11-29

本文参与腾讯云自媒体分享计划,欢迎正在阅读的你也加入,一起分享。

发表于

我来说两句

0 条评论
登录 后参与评论

相关文章

来自专栏数据的力量

让学习体系化,造福一大波上进青年

体系化是学习的正道。学到的东西只有纳入自己的知识体系中,才算是为自己所用。不成体系的零碎知识是没有任何价值的。

542
来自专栏专知

【一周AI热点干货概览】图深度学习/知识图谱构建推理/自注意力框架/自动驾驶/AI冬天论 (附pdf下载)

2466
来自专栏iOSDevLog

不只是游戏

人工智能的围棋水平超越人类,如今已是不争的事实。但更加细思恐极的是,机器能做的绝不只是游戏。很多人的确已经感到了,未来被 AI 支配的恐惧。

802
来自专栏新智元

《西部世界》科学顾问:如果机器人有了情感,人类就完了

1784
来自专栏大数据文摘

人工智能真能统治地球?

2468
来自专栏华章科技

如何真正学好数据科学?

作为一个全新的领域,数据科学的飞速发展让人激动。数据科学在带来巨大经济效益的同时,人们在数据科学技术方面的知识沟也逐渐出现,这意味着更多的人需要试图了解和学习数...

482
来自专栏C语言及其他语言

记:丹尼斯·里奇(Dennis Ritchie)

丹尼斯·里奇被誉为“C语言之父”,他在生前与贝尔实验室的合作伙伴肯·汤普森(Ken Thompson)一起利用这种编程语言开发出了Unix操作系统。在随后的岁月...

2576
来自专栏程序员叨叨叨

3.4 CG VS GLSL VS HLSL

Shader language 目前有 3 种主流语言:基于 OpenGL 的 GLSL(OpenGL Shading Language,也称为 GLslang...

504
来自专栏新智元

【机器学习面试终极通关指南】从打造性感履历到跨越面试三大关卡

来源:Reddit 编译:费欣欣,胡祥杰 【新智元导读】 机器学习工程师薪资水涨船高,在国内,毕业生的平均年薪也达到了30-50万,一些人拿到了上百万的薪...

3736
来自专栏WeaponZhi

我的理解—如何入门 AI

上一篇文章里,有同学留言问我能不能写一篇有关 AI 入门的文章,给新手和想学习 AI 的同学一个宏观的认识,这不,认真的我在周日便写下了这篇文章。 前言 实际上...

3006

扫描关注云+社区