现实社会是个逻辑社会,大量的逻辑即逻辑经验存在于我们的脑海中,而这些逻辑经验是无法穷举出来的,靠大量人工的总结,显然不切实际。然而,幸好人类将这种逻辑用文字表达出来了,这为我们利用自然语言处理技术实现这种因果逻辑的抽取提供了可能性。不过,受限于自己的技术水平,目前还无法将深度学习这套高端的打发应用于因果事件抽取当中,而以构造和总结因果模板,结合中文语言特点,构建因果语言知识库的方式代替。
本项目是对因果事件抽取以及因果知识图谱构建的一种尝试。
因果事件图谱技术流程上遵循以下流程:
主要包括以下几个步骤:
1、因果知识库的构建。因果知识库的构建包括因果连词库,结果词库、因果模式库等。
2、文本预处理。这个包括对文本进行噪声移除,非关键信息去除等。
3、因果事件抽取。这个包括基于因果模式库的因果对抽取。
4、事件表示。这是整个因果图谱构建的核心问题,因为事件图谱本质上是联通的,如何选择一种恰当(短语、短句、句子主干)等方式很重要。
5、事件融合。事件融合跟知识图谱中的实体对齐任务很像
6、事件存储。事件存储是最后步骤,基于业务需求,可以用相应的数据库进行存储,比如图数据库等。
经过以上几个流程之后,可以支持各类查询,比如已知原因找结果,已知结果找原因等,这都很有事情,总之,数据库有了,我们可以做的事情有很多,接下来就是我们脑洞的事情了。
接下来以以下几个事件在因果知识库中查询一把:
以上几个图展示了输入既定事件在数据库中相似的事件(一度),相似事件导致的结果(二度节点)。
部分代码展示:
'''1由果溯因配套式'''
def ruler1(self, sentence):
'''
conm2:〈[之]所以,因为〉、〈[之]所以,由于〉、 <[之]所以,缘于〉
conm2_model:<Conj>{Effect},<Conj>{Cause}
'''
datas = list()
word_pairs =[['之?所以', '因为'], ['之?所以', '由于'], ['之?所以', '缘于']]
for word in word_pairs:
pattern = re.compile(r'\s?(%s)/[p|c]+\s(.*)(%s)/[p|c]+\s(.*)' % (word[0], word[1]))
result = pattern.findall(sentence)
data = dict()
if result:
data['tag'] = result[0][0] + '-' + result[0][2]
data['cause'] = result[0][3]
data['effect'] = result[0][1]
datas.append(data)
if datas:
return datas[0]
else:
return {}
'''2由因到果配套式'''
def ruler2(self, sentence):
'''
conm1:〈因为,从而〉、〈因为,为此〉、〈既[然],所以〉、〈因为,为此〉、〈由于,为此〉、〈只有|除非,才〉、〈由于,以至[于]>、〈既[然],却>、
〈如果,那么|则〉、<由于,从而〉、<既[然],就〉、〈既[然],因此〉、〈如果,就〉、〈只要,就〉〈因为,所以〉、 <由于,于是〉、〈因为,因此〉、
<由于,故〉、 〈因为,以致[于]〉、〈因为,因而〉、〈由于,因此〉、<因为,于是〉、〈由于,致使〉、〈因为,致使〉、〈由于,以致[于] >
〈因为,故〉、〈因[为],以至[于]>,〈由于,所以〉、〈因为,故而〉、〈由于,因而〉
conm1_model:<Conj>{Cause}, <Conj>{Effect}
'''
datas = list()
word_pairs =[['因为', '从而'], ['因为', '为此'], ['既然?', '所以'],
['因为', '为此'], ['由于', '为此'], ['除非', '才'],
['只有', '才'], ['由于', '以至于?'], ['既然?', '却'],
['如果', '那么'], ['如果', '则'], ['由于', '从而'],
['既然?', '就'], ['既然?', '因此'], ['如果', '就'],
['只要', '就'], ['因为', '所以'], ['由于', '于是'],
['因为', '因此'], ['由于', '故'], ['因为', '以致于?'],
['因为', '以致'], ['因为', '因而'], ['由于', '因此'],
['因为', '于是'], ['由于', '致使'], ['因为', '致使'],
['由于', '以致于?'], ['因为', '故'], ['因为?', '以至于?'],
['由于', '所以'], ['因为', '故而'], ['由于', '因而']]
for word in word_pairs:
pattern = re.compile(r'\s?(%s)/[p|c]+\s(.*)(%s)/[p|c]+\s(.*)' % (word[0], word[1]))
result = pattern.findall(sentence)
data = dict()
if result:
data['tag'] = result[0][0] + '-' + result[0][2]
data['cause'] = result[0][1]
data['effect'] = result[0][3]
datas.append(data)
if datas:
return datas[0]
else:
return {}
'''3由因到果居中式明确'''
def ruler3(self, sentence):
'''
cons2:于是、所以、故、致使、以致[于]、因此、以至[于]、从而、因而
cons2_model:{Cause},<Conj...>{Effect}
'''
pattern = re.compile(r'(.*)[,,]+.*(于是|所以|故|致使|以致于?|因此|以至于?|从而|因而)/[p|c]+\s(.*)')
result = pattern.findall(sentence)
data = dict()
if result:
data['tag'] = result[0][1]
data['cause'] = result[0][0]
data['effect'] = result[0][2]
return data
'''4由因到果居中式精确'''
def ruler4(self, sentence):
'''
verb1:牵动、导向、使动、导致、勾起、引入、指引、使、予以、产生、促成、造成、引导、造就、促使、酿成、
引发、渗透、促进、引起、诱导、引来、促发、引致、诱发、推进、诱致、推动、招致、影响、致使、滋生、归于、
作用、使得、决定、攸关、令人、引出、浸染、带来、挟带、触发、关系、渗入、诱惑、波及、诱使
verb1_model:{Cause},<Verb|Adverb...>{Effect}
'''
pattern = re.compile(r'(.*)\s+(牵动|已致|导向|使动|导致|勾起|引入|指引|使|予以|产生|促成|造成|引导|造就|促使|酿成|引发|渗透|促进|引起|诱导|引来|促发|引致|诱发|推进|诱致|推动|招致|影响|致使|滋生|归于|作用|使得|决定|攸关|令人|引出|浸染|带来|挟带|触发|关系|渗入|诱惑|波及|诱使)/[d|v]+\s(.*)')
result = pattern.findall(sentence)
data = dict()
if result:
data['tag'] = result[0][1]
data['cause'] = result[0][0]
data['effect'] = result[0][2]
return data
'''5由因到果前端式模糊'''
def ruler5(self, sentence):
'''
prep:为了、依据、为、按照、因[为]、按、依赖、照、比、凭借、由于
prep_model:<Prep...>{Cause},{Effect}
'''
pattern = re.compile(r'\s?(为了|依据|按照|因为|因|按|依赖|凭借|由于)/[p|c]+\s(.*)[,,]+(.*)')
result = pattern.findall(sentence)
data = dict()
if result:
data['tag'] = result[0][0]
data['cause'] = result[0][1]
data['effect'] = result[0][2]
return data
'''6由因到果居中式模糊'''
def ruler6(self, sentence):
'''
adverb:以免、以便、为此、才
adverb_model:{Cause},<Verb|Adverb...>{Effect}
'''
pattern = re.compile(r'(.*)(以免|以便|为此|才)\s(.*)')
result = pattern.findall(sentence)
data = dict()
if result:
data['tag'] = result[0][1]
data['cause'] = result[0][0]
data['effect'] = result[0][2]
return data
'''7由因到果前端式精确'''
def ruler7(self, sentence):
'''
cons1:既[然]、因[为]、如果、由于、只要
cons1_model:<Conj...>{Cause},{Effect}
'''
pattern = re.compile(r'\s?(既然?|因|因为|如果|由于|只要)/[p|c]+\s(.*)[,,]+(.*)')
result = pattern.findall(sentence)
data = dict()
if result:
data['tag'] = result[0][0]
data['cause'] = result[0][1]
data['effect'] = result[0][2]
return data
'''8由果溯因居中式模糊'''
def ruler8(self, sentence):
'''
3
verb2:根源于、取决、来源于、出于、取决于、缘于、在于、出自、起源于、来自、发源于、发自、源于、根源于、立足[于]
verb2_model:{Effect}<Prep...>{Cause}
'''
pattern = re.compile(r'(.*)(根源于|取决|来源于|出于|取决于|缘于|在于|出自|起源于|来自|发源于|发自|源于|根源于|立足|立足于)/[p|c]+\s(.*)')
result = pattern.findall(sentence)
data = dict()
if result:
data['tag'] = result[0][1]
data['cause'] = result[0][2]
data['effect'] = result[0][0]
return data
'''9由果溯因居端式精确'''
def ruler9(self, sentence):
'''
cons3:因为、由于
cons3_model:{Effect}<Conj...>{Cause}
'''
pattern = re.compile(r'(.*)是?\s(因为|由于)/[p|c]+\s(.*)')
result = pattern.findall(sentence)
data = dict()
if result:
data['tag'] = result[0][1]
data['cause'] = result[0][2]
data['effect'] = result[0][0]
return data
1)基于规则这套,很实用,但问题不少,规则维护比较多
2)事件表示这块一定要好好想想啊
3)事件融合这块,利用各种相似度度量进行计算,都有一定缺陷
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。