FoolNLTK:可能是目前最准的中文分词工具

FoolNLTK 是一个中文处理工具包,可能不是最快的开源中文分词,但很可能是最准的开源中文分词

授权协议:Apache

开发语言:Python

操作系统:跨平台

软件作者:正_午

特点

可能不是最快的开源中文分词,但很可能是最准的开源中文分词

基于BiLSTM模型训练而成

包含分词,词性标注,实体识别, 都有比较高的准确率

用户自定义词典

安装

pip install foolnltk

使用说明

分词

import fool

text = "一个傻子在北京"

print(fool.cut(text))

# ['一个', '傻子', '在', '北京']

命令行分词

python -m fool [filename]

用户自定义词典

词典格式格式如下,词的权重越高,词的长度越长就越越可能出现, 权重值请大于1

难受香菇 10

什么鬼 10

分词工具 10

北京 10

北京天安门 10

加载词典

import fool

fool.load_userdict(path)

text = "我在北京天安门看你难受香菇"

print(fool.cut(text))

# ['我', '在', '北京天安门', '看', '你', '难受香菇']

删除词典

fool.delete_userdict();

词性标注

import fool

text = "一个傻子在北京"

print(fool.pos_cut(text))

#[('一个', 'm'), ('傻子', 'n'), ('在', 'p'), ('北京', 'ns')]

实体识别

import fool

text = "一个傻子在北京"

words, ners = fool.analysis(text)

print(ners)

#[(5, 8, 'location', '北京')]

注意

暂时只在Python3 Linux 平台测试通过

本文来自企鹅号 - 开源中国媒体

发表于

我来说两句

0 条评论
登录 后参与评论

相关文章

来自专栏云时之间

深度学习与应用:百度AI平台使用浅谈

最近因为对文本情感分析有一些需要,所以去学习使用了一下百度的NLP处理模块,特此记录一下,来和大家一起分享。

1774
来自专栏机器之心

资源 | NASA免费开放软件下载:从机器人系统到数据处理工具

选自NASA 机器之心编译 参与:微胖、吴攀 NASA 刚刚发布了 2017—2018 年软件目录,每个软件都可以在这里免费下载到(https://goo.g...

37817
来自专栏平凡文摘

只有程序员才看得懂的漫画

1333
来自专栏诸葛青云的专栏

使用c语言计算3阶行列式

很多学线性代数的小伙伴在计算3阶行列式的时候总会感到很麻烦,数据量大而且容易看错。我们在知道计算方法后就可以使用c语言写出计算3阶行列式的代码:

1940
来自专栏JackeyGao的博客

2016年Python十大文章

在过去一年, 我们对10000篇Python相关的文章进行了排名, 并选择出排名前十的文章. (0.1%的几率), 可以帮助您在2017年推进你的技术生涯.

771
来自专栏AI科技评论

开发 | 我做了12万条的影评分析,告诉你《战狼Ⅱ》都在说些啥

本文原作者麦艳涛。本文原载于知乎专栏。 截止到8月15日,《战狼Ⅱ》上映的第19天,票房已超45亿人民币。 真正成为唯一一部挺进世界影史票房前100名的亚洲电影...

3178
来自专栏灯塔大数据

深度|从数据仓库到数据湖——浅谈数据架构演进

网管产品需要从数据仓库的角度来看,才能获得完整的视图。数据集成真正从大数据的角度来看,才能明白其中的挑战。一个运行了20多年的数据架构,必然有其合理性。也正是因...

2K7
来自专栏Crossin的编程教室

分享一个强大的英汉词典开源数据库

之前我们通过程序整理过一份 Python 及编程相关的英语高频词汇表:我们用程序整理出了一份Python英语高频词汇表,拿走不谢!(回复 单词 查看代码及单词本...

1K5
来自专栏FreeBuf

定位系统那些事儿

LBS随着移动互联网的火热而在近年成为一个火热的概念,其本义是基于位置的服务(Location Based Service),而如何定位位置成为LBS中的基本。...

2635
来自专栏州的先生

Python快速搭建会学习的微信聊天机器人

2571

扫码关注云+社区

领取腾讯云代金券