我目前正在做一个项目,它应该识别地址的每个部分,例如“str.Jack London 121,Corvallis,ARAD,AP.1603,973130”输出应该是这样的: street name:Corvallis; apartment: 1603;
zip code: 973130 问题是,并非所有输入数据的格式都相同,因此某些元素可能会丢失或顺序不同,但可以保证它是一个地址我在互联网上查看了一些资源,但它们中的许多只适用于美国地址-比如Google API Places,问题是我将把它用于另一个国家。
在使用spacy对句子进行标记化时,我希望它不会在/上拆分成标记import en_core_web_lgfor i in nlp("输出:10ctliterwhenour我希望它像Get , 10ct/liter, off, when ....一样
我能够找到如何为spacy添加更多拆分令牌的方法,但无法避免特定的拆分</
我正在使用20次迭代的进行建模。我想知道我是否应该使用交叉验证来获得更准确的样本准确性。如果是,那么交叉验证步骤应该在哪里进行?如果没有,那么我如何拆分/分发我的训练和测试数据,因为我正在使用注释和6个自定义实体,并且很难跟踪每个训练和测试数据中带注释的标签的百分比,因为它是均匀分布的。nlp.create_pipe('ner')
# Ad
为此,我将对完整字符串执行nlp解析,以获得spacy Doc,然后循环遍历doc.sents并使用span.as_doc()将跨文档转换为Docs。"])nlp_test1 = nlp('The quick brown fox jumpsover the lazy dog')
print(list(nlp_
我正在使用spaCy的句子分隔器。from spacy.lang.en import Englishsbd = nlp.create_pipe('sentencizer')doc = nlp(text)
for sent in doc.sents:
sents_list.append(sent.text',