前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
工具
TVP
发布
社区首页 >专栏 >中文NLP笔记:6. 如何做中文短文本分类

中文NLP笔记:6. 如何做中文短文本分类

作者头像
杨熹
发布2019-02-20 16:31:07
1.3K0
发布2019-02-20 16:31:07
举报
文章被收录于专栏:杨熹的专栏杨熹的专栏

中文短文本分类

文本分类是一种有监督学习

例如,输入一条数据,能够判断事情的主体是谁


主要步骤 为:

1. 加载数据   2. 数据预处理

  分词

  去停用词

  词形标准化

  3. 文本表示

  抽取词向量特征

    可以尝试 2-gram 和 3-gram

    还可以使用 word2vec 和 doc2vec 等

4. 将数据分成训练集和测试集

  5. 模型

  进行算法建模和模型训练

  评估、计算 AUC 值,进行预测

  模型对比

  这里可以使用的模型有:朴素贝叶斯,SVM,决策树、随机森林、XGBoost、神经网络等


学习资料:

《中文自然语言处理入门实战》

本文参与 腾讯云自媒体分享计划,分享自作者个人站点/博客。
原始发表:2019.02.01 ,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 作者个人站点/博客 前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体分享计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
相关产品与服务
NLP 服务
NLP 服务(Natural Language Process,NLP)深度整合了腾讯内部的 NLP 技术,提供多项智能文本处理和文本生成能力,包括词法分析、相似词召回、词相似度、句子相似度、文本润色、句子纠错、文本补全、句子生成等。满足各行业的文本智能需求。
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档