动态 | 百度NLP团队登顶微软MARCO阅读理解测试

AI 科技评论消息,2 月 21 日,百度 NLP 团队提交的 V-Net 模型以 46.15 的 Rouge-L 得分位列微软的 MS MARCO 机器阅读理解测试第一名。目前人类评测 Rouge-L 得分为 47;BLEU-1 得分为 46。

据了解,百度提交的 V-NET 模型使用了一种新的多候选文档联合建模表示方法,通过注意力机制使不同文档产生的答案之间能够产生交换信息,互相印证,从而更好的预测答案。

AI 科技评论了解到,除了百度位列第一外,凭借 Microsoft AI and Research 提交的 S-Net、R-Net、ReasoNet,二、三、四名均由微软摘得。此外,新加坡管理大学与德国人工智能研究中心也紧随其后。

MS MARCO 全称为 Microsoft MAchine Reading Comprehension,即「微软机器阅读理解」,官网资料显示其正式发布于 NIPS 2016。这是一套由 10 万个问答和 20 万篇不重复的文档组成的数据集。

在机器阅读理解领域,想必大家更为熟悉的是斯坦福大学发起的 SQuAD(Stanford Question Answering Dataset),AI 科技评论此前也有过不少相关报道。SQuAD 是行业内公认的机器阅读理解领域的顶级水平测试,它构建了一个包含十万个问题的大规模机器阅读理解数据集,选取超过 500 篇的维基百科文章。在阅读数据集内的文章后,机器需要回答若干与文章内容相关的问题,并通过与标准答案的比对,得到 EM(精确匹配)和 F1(模糊匹配)的结果。讯飞与哈工大联合实验室、微软、阿里巴巴、腾讯等国内外知名研究企业及机构都是 SQuAD 榜单上的常客。

与 SQuAD 不同,MARCO 数据集中的问题全都基于来自微软必应搜索(BING)引擎和微软小娜人工智能助手(Cortana)的已匿名处理的真实查询。此外,相关回答是由真人参考真实网页编写的,并对其准确性进行了验证。可以说,数据集的建立完全是根据用户在 BING 中输入的真实问题模拟搜索引擎中的真实应用场景,其研发团队也曾表示,「MS MARCO 是目前同类型中最有用的数据集,因为它建立在经过匿名处理的真实世界数据基础之上。」

目前搜索引擎只能针对用户的提问回答一些简单问题,可以回答复杂问题的系统仍然处于起步阶段,而普通人日常想获取一些琐碎复杂问题的答案,则需要在搜索引擎提供的结果中再次进行筛选、分析和整理。这些并无明确答案或存在多个可能答案的查询,是微软发布这一数据集希望攻克的阅读理解高堡。

在每一个问题中,MARCO 提供多篇来自搜索结果的网页文档,系统需要根据这些文档来回答给定的问题。就像人类在搜索引擎给定的结果中自行筛选信息一样,这些文档中是否有对应的答案、在哪一篇文章中,都需要系统自行判断,甚至还需要结合多篇文章做出提炼与总结,而这也对机器的阅读理解能力提出了更高的要求。

「此次在 MARCO 的测试中取得第一,只是百度机器阅读理解技术经历的一次小考,」百度自然语言处理首席科学家兼百度技术委员会主席吴华表示,「我们希望能够与领域内的其他同行者一起,推进机器阅读理解技术和应用的研究,使 AI 能够理解人类的语言、用自然语言与人类交流,让 AI 更『懂』人类。」

原文发布于微信公众号 - AI科技评论(aitechtalk)

原文发表时间:2018-02-22

本文参与腾讯云自媒体分享计划,欢迎正在阅读的你也加入,一起分享。

发表于

我来说两句

0 条评论
登录 后参与评论

相关文章

来自专栏大数据文摘

还在看视频读文档学编程?这有7种编程学习方式,哪种最适合你?

1482
来自专栏AI研习社

为什么 GPU 会成为通用计算的宠儿?

编者按:文章来源自 Mapd,作者 Jonathan Symonds,AI 研习社编译。 █ 英伟达在 2016 年的强势崛起,GPGPU (GPU 通用计算)...

4765
来自专栏镁客网

这款DNA机器人,可以帮你分拣身体中的生物垃圾 | 黑科技

1940
来自专栏机器之心

观点 | 人工智能产品化的关键是基础架构和数据,而非算法

选自theregister 作者:Katyanna Quach 机器之心编译 参与:黄小天、微胖 突然你发现,机器学习算法,你所谓的王冠,只是巨大复杂车机上...

3077
来自专栏华章科技

送书 | 别泡枸杞,别晒步数!7招搞懂健康数据,有型有颜等TA来撩

导读:你的日常活动正在产生大量数据!但其中很多数据也正在被你浪费。你以为数据与健康的关系,就是在朋友圈里晒晒步数?其实,并不需要复杂的技术,这些数据就可以帮你完...

562
来自专栏数据科学与人工智能

【应用】信用评分:第10部分 - 更大的图景 - 企业决策管理系统

“这总是能够创造大图景的小碎片。” - 本系列前几篇文章介绍了信用评分工具包的关键要素,包括评分卡模型,评分策略,实施和监控。 通过将这些单件放在一起,我们开始...

1062
来自专栏AI研习社

【头条】国外大神的机器学习算法大汇总;如何用50行PyTorch 代码实现GANs

【AI研习社】关注AI前沿、开发技巧及技术教程等方面的内容。欢迎技术开发类文章、视频教程等内容投稿,邮件发送至:zhangxian@leiphone.com ...

3704
来自专栏CDA数据分析师

Excel商业智能最常用的3大类分析方法,你会几种?

下文为电子表格大会主席李奇在论坛上的分享。 一般我都先讲Power BI,今天被前面老师讲了,我想了半天,该讲什么好呢,最后决定给大家先讲一个我自身的故事,跟大...

4355
来自专栏DT数据侠

搜集了3100款App的数据,我发现了安卓用户的“潜规则”

不久前,苹果刚发布了新一代iPhone,其高昂的售价以及缺乏创新的设计,让不少果粉望而却步,把目光逐渐转向这些年越做越好的谷歌的Android系统手机。数据侠Y...

722
来自专栏专知

【干货】最全知识图谱综述#2: 构建技术与典型应用

【导读】知识图谱技术是人工智能技术的组成部分,其强大的语义处理和互联组织能力,为智能化信息应用提供了基础。我们专知的技术基石之一正是知识图谱-构建AI知识体系-...

8364

扫码关注云+社区

领取腾讯云代金券