【统览整个学术圈】上交大发布知识图谱AceKG,超1亿实体,近100G数据量

【新智元导读】由上海交通大学王新兵教授和张伟楠教授指导的Acemap团队知识图谱小组,近日发布了学术知识图谱AceKG,提供了近100G大小的数据集,为每个实体提供了丰富的属性信息,涵盖权威学术知识,旨在为众多学术大数据挖掘项目提供支持。

Acemap学术知识图谱网址:

http://acemap.sjtu.edu.cn/app/AceKG/

知识图谱是知识工程的一个分支,由语义网络发展而来,由于其在搜索与推荐系统中的极大应用前景,近几年在机器学习、自然语言处理等最新技术的推动下迅速发展,受到了业界和学术界的广泛关注。

最新发布的Acemap知识图谱(AceKG)描述了超过1亿个学术实体、22亿条三元组信息,涵盖了全面的学术信息。具体而言,AceKG包含了61,704,089篇paper、52,498,428位学者、50,233个研究领域、19,843个学术研究机构、22,744个学术期刊、1,278个学术会议以及3个学术联盟(如C9联盟)。

同时,AceKG也为每个实体提供了丰富的属性信息,在网络拓扑结构的基础上加上语义信息,旨在为众多学术大数据挖掘项目提供全面支持。

AceKG的结构框架

与现有学术知识图谱相比,AceKG在以下方面具有优势:

  1. AceKG提供了学术异构图谱,包含了多样的学术实体与相应的属性,可以支持多样的学术大数据挖掘课题,例如现阶段异构网络向量化的诸多课题。
  2. AceKG从更高的角度统览整个学术圈,提供了近100G大小的数据集,包括论文、作者、领域、机构、期刊、会议、联盟,支持权威和实用的学术研究。
  3. AceKG以结构化的Turtle文件格式给出(具体格式见下表),致力于减少数据预处理的不便,同时更易于机器处理,支持全部Apache Jena API。

Turtle文件格式示意图:按论文、作者、领域、机构、会议、领域等类别进行存储

在工程架构上,AceKG使用Apache Jena框架进行驱动。Apache Jena(http://jena.apache.org)使用TDB数据库存储三元组数据,并且提供SPARQL引擎支持对三元组数据进行查询。

AceKG具体工程架构

上海交通大学电子信息与电气工程学院副院长、John Hopcroft计算中心执行主任、Acemap学术搜索项目总负责人王新兵教授在接受新智元访谈时表示:“本次发布的AceKG学术知识图谱,其最大的优势就是背后所依靠的整个Acemap学术搜索系统巨大的数据库,我们拥有的约1.15亿名学者信息和1.27亿篇论文信息,为AceKG的构建提供了海量的结构化数据。”

“在保证海量数据的同时,我们也深知紧跟学术领域最前沿的重要性,所以最新发表的ACM、IEEE论文也会及时收录,确保我们系统的前沿性与实用性。”

在谈及本次发布的近100G数据量的AceKG学术知识图谱将如何应用的问题上,王新兵教授风趣地谈到:“本次发布的AceKG是从一个更高的角度对整个学术界进行统览,所以这次发布的数据集很大,不仅有计算机领域,也有医学,通信等领域。”

“打一个比方,本次发布的AceKG好比一整扇的猪肉,对于一个正常人,这一整扇的猪肉不可能全部吃下,医学领域的人可能喜欢吃‘火腿’,计算机领域的人可能喜欢吃‘猪蹄’,就算是对于同一部分肉,你也可以做成鱼香肉丝或者是糖醋排骨等不同的菜。”

在AceKG如何应用这个问题上,团队制定了“三步走”的战略:

第一步是把“整扇的猪肉”切成不同量级的肉。现在的AceKG拥有22亿的三元组,未来可能会推出几万和几十万量级三元组的数据集,并且在这些较小的数据集上评测一些算法,比如“异构网络向量化”的这个话题。现在常用的数据集是FB15k和WN18,但我们在进行学术领域的相关研究时,没有发现较好的学术领域异构网络数据集,我们可能在未来推出的较小的数据集上测试一些如TransE的经典向量化算法。

第二步则是把肉做成具体的如“糖醋排骨”这样具体的菜,类似于QQ或者Facebook这样利用社交网络给你推荐你可能感兴趣的人,比如你刚加了一位好友,你想知道他的婚姻状况,可能这两个社交应用给你推荐的“感兴趣的人”里面,就有这位朋友的妻子。在学术领域,同学们申请出国也好,学者们想进入某一领域也好,都需要类似的学术圈社交网络的新型推荐,这种推荐不仅仅是局限于合作者或者在同一个机构工作,我们的Acemap学术搜索系统在未来将致力于基于AceKG的特色推荐系统研发。

第三步则有点像《红楼梦》刘姥姥进大观园吃的那道茄子菜——这道茄子在烹饪的过程中使用了大量的鸡油、鸡肉等材料,我们最后就想在Acemap学术搜索系统中做成一道这样的“茄子”,最后的交互式可视化应用可以为用户提供更加流畅、舒适的使用体验,而在这道“茄子”背后的鸡油,鸡肉就是我们的AceKG在提供支撑。

新智元了解到,除AceKG之外,Acemap团队近期也发布了学术会议期刊核心(core)学者地图、CS热词近五年热度变化趋势统计及未来热度预测等研究成果,从不同角度对学术信息进行挖掘。详情参考Acemap学术地图式搜索系统:http://acemap.sjtu.edu.cn/

了解更多:

Acemap学术知识图谱网址:http://acemap.sjtu.edu.cn/app/AceKG/

原文发布于微信公众号 - 新智元(AI_era)

原文发表时间:2018-03-14

本文参与腾讯云自媒体分享计划,欢迎正在阅读的你也加入,一起分享。

发表于

我来说两句

0 条评论
登录 后参与评论

相关文章

来自专栏非著名程序员

编程王道,唯“慢”不破

? 编程王道,唯“慢”不破 人和人之间编程速度的差异还是很大的,有的程序猿写代码非常快,有的却常常是龟速。Jeffrey Ventrella最近在一篇文章里探...

2168
来自专栏CSDN技术头条

BDTC 2014|IBM李永辉:Watson大数据与分析平台

【CSDN现场报道】2014年12月12-14日,由中国计算机学会(CCF)主办,CCF大数据专家委员会承办,中科院计算所与CSDN共同协办,以推进大数据科研、...

2267
来自专栏大数据文摘

推荐系统绝对不会向你推荐什么

1222
来自专栏AI科技评论

观点 | 来自UCL实验室大佬的学术生涯避雷指南

回顾实验室建立近三年来的种种,Stephen Fleming 感慨良多。他把自己的感受、反思以及对后来者的建议写成了博客。

1052
来自专栏PPV课数据科学社区

【经验分享 】数据产品开发前的必修课

分清指标和维度关系 既然是数据产品,一定离不开数据图表。而要做图表,首先得确定指标和维度。最直观的说:指标就是图表中纵坐标轴;维度就是横坐标轴。 身高,销售量,...

2864
来自专栏ThoughtWorks

TW洞见 | TDD随想录

2014年我一直从事在敏捷实践咨询项目,这也是我颇有收获的一年,特别是咨询项目的每一点改变,不管是代码质量的提高,还是自组织团队的建设,都能让我们感到欣慰。涉及...

3737
来自专栏数据猿

【地产大数据案例】中指讯博:城市地图与投资决策

【数据猿导读】 城市地图这样的互联网地图产品,在业务使用过程中具有很好的便利性,但在实际开发中却存在很大难题,会面临诸多共性问题。最终,这款极大地优化了项目的数...

1762
来自专栏测试开发架构之路

今天聊聊大数据

大数据概念 "大数据"是一个体量特别大,数据类别特别大的数据集,并且这样的数据集无法用传统数据库工具对其内容进行抓取、管理和处理。 大数据的4V特点:Volum...

3618
来自专栏安恒信息

指纹识别也不安全:黑客称可通过照片复制指纹

欧洲最大的黑客联盟“Chaos计算机俱乐部”表示,该组织已经可以通过几张手指照片复制出人们的指纹。 在德国汉堡举行的第31届Chaos计算机俱乐部大会上,网名为...

2978
来自专栏华章科技

你刚被人工智能洗脑,最聪明的钱已转向这16项技术

不久前,信息技术研究公司Gartner发布了2017年度“新兴技术成熟度曲线”(The Hype Cycle),这是用来评估新科技可见度的一种工具, 也是技术企...

1031

扫码关注云+社区

领取腾讯云代金券