前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
工具
TVP
发布
社区首页 >专栏 >【统览整个学术圈】上交大发布知识图谱AceKG,超1亿实体,近100G数据量

【统览整个学术圈】上交大发布知识图谱AceKG,超1亿实体,近100G数据量

作者头像
新智元
发布2018-03-21 17:12:11
2.2K0
发布2018-03-21 17:12:11
举报
文章被收录于专栏:新智元新智元
【新智元导读】由上海交通大学王新兵教授和张伟楠教授指导的Acemap团队知识图谱小组,近日发布了学术知识图谱AceKG,提供了近100G大小的数据集,为每个实体提供了丰富的属性信息,涵盖权威学术知识,旨在为众多学术大数据挖掘项目提供支持。

Acemap学术知识图谱网址:

http://acemap.sjtu.edu.cn/app/AceKG/

知识图谱是知识工程的一个分支,由语义网络发展而来,由于其在搜索与推荐系统中的极大应用前景,近几年在机器学习、自然语言处理等最新技术的推动下迅速发展,受到了业界和学术界的广泛关注。

最新发布的Acemap知识图谱(AceKG)描述了超过1亿个学术实体、22亿条三元组信息,涵盖了全面的学术信息。具体而言,AceKG包含了61,704,089篇paper、52,498,428位学者、50,233个研究领域、19,843个学术研究机构、22,744个学术期刊、1,278个学术会议以及3个学术联盟(如C9联盟)。

同时,AceKG也为每个实体提供了丰富的属性信息,在网络拓扑结构的基础上加上语义信息,旨在为众多学术大数据挖掘项目提供全面支持。

AceKG的结构框架

与现有学术知识图谱相比,AceKG在以下方面具有优势:

  1. AceKG提供了学术异构图谱,包含了多样的学术实体与相应的属性,可以支持多样的学术大数据挖掘课题,例如现阶段异构网络向量化的诸多课题。
  2. AceKG从更高的角度统览整个学术圈,提供了近100G大小的数据集,包括论文、作者、领域、机构、期刊、会议、联盟,支持权威和实用的学术研究。
  3. AceKG以结构化的Turtle文件格式给出(具体格式见下表),致力于减少数据预处理的不便,同时更易于机器处理,支持全部Apache Jena API。

Turtle文件格式示意图:按论文、作者、领域、机构、会议、领域等类别进行存储

在工程架构上,AceKG使用Apache Jena框架进行驱动。Apache Jena(http://jena.apache.org)使用TDB数据库存储三元组数据,并且提供SPARQL引擎支持对三元组数据进行查询。

AceKG具体工程架构

上海交通大学电子信息与电气工程学院副院长、John Hopcroft计算中心执行主任、Acemap学术搜索项目总负责人王新兵教授在接受新智元访谈时表示:“本次发布的AceKG学术知识图谱,其最大的优势就是背后所依靠的整个Acemap学术搜索系统巨大的数据库,我们拥有的约1.15亿名学者信息和1.27亿篇论文信息,为AceKG的构建提供了海量的结构化数据。”

“在保证海量数据的同时,我们也深知紧跟学术领域最前沿的重要性,所以最新发表的ACM、IEEE论文也会及时收录,确保我们系统的前沿性与实用性。”

在谈及本次发布的近100G数据量的AceKG学术知识图谱将如何应用的问题上,王新兵教授风趣地谈到:“本次发布的AceKG是从一个更高的角度对整个学术界进行统览,所以这次发布的数据集很大,不仅有计算机领域,也有医学,通信等领域。”

“打一个比方,本次发布的AceKG好比一整扇的猪肉,对于一个正常人,这一整扇的猪肉不可能全部吃下,医学领域的人可能喜欢吃‘火腿’,计算机领域的人可能喜欢吃‘猪蹄’,就算是对于同一部分肉,你也可以做成鱼香肉丝或者是糖醋排骨等不同的菜。”

在AceKG如何应用这个问题上,团队制定了“三步走”的战略:

第一步是把“整扇的猪肉”切成不同量级的肉。现在的AceKG拥有22亿的三元组,未来可能会推出几万和几十万量级三元组的数据集,并且在这些较小的数据集上评测一些算法,比如“异构网络向量化”的这个话题。现在常用的数据集是FB15k和WN18,但我们在进行学术领域的相关研究时,没有发现较好的学术领域异构网络数据集,我们可能在未来推出的较小的数据集上测试一些如TransE的经典向量化算法。

第二步则是把肉做成具体的如“糖醋排骨”这样具体的菜,类似于QQ或者Facebook这样利用社交网络给你推荐你可能感兴趣的人,比如你刚加了一位好友,你想知道他的婚姻状况,可能这两个社交应用给你推荐的“感兴趣的人”里面,就有这位朋友的妻子。在学术领域,同学们申请出国也好,学者们想进入某一领域也好,都需要类似的学术圈社交网络的新型推荐,这种推荐不仅仅是局限于合作者或者在同一个机构工作,我们的Acemap学术搜索系统在未来将致力于基于AceKG的特色推荐系统研发。

第三步则有点像《红楼梦》刘姥姥进大观园吃的那道茄子菜——这道茄子在烹饪的过程中使用了大量的鸡油、鸡肉等材料,我们最后就想在Acemap学术搜索系统中做成一道这样的“茄子”,最后的交互式可视化应用可以为用户提供更加流畅、舒适的使用体验,而在这道“茄子”背后的鸡油,鸡肉就是我们的AceKG在提供支撑。

新智元了解到,除AceKG之外,Acemap团队近期也发布了学术会议期刊核心(core)学者地图、CS热词近五年热度变化趋势统计及未来热度预测等研究成果,从不同角度对学术信息进行挖掘。详情参考Acemap学术地图式搜索系统:http://acemap.sjtu.edu.cn/

了解更多:

Acemap学术知识图谱网址:http://acemap.sjtu.edu.cn/app/AceKG/

本文参与 腾讯云自媒体分享计划,分享自微信公众号。
原始发表:2018-03-14,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 新智元 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体分享计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
相关产品与服务
大数据
全栈大数据产品,面向海量数据场景,帮助您 “智理无数,心中有数”!
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档