腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
1
回答
MySQL
-长
文本
域
上
的
词频
计数
mysql
、
sql
、
word-count
我有一个
MySQL
表,其中一个字段包含
文本
描述(大约5-200个单词)。我想做一些词数统计分析,比如一般
的
词频
统计(每个单词出现
的
次数)或每个类别的前K个单词。word countplace 2 ...有没有一种方法可以在不涉及编程语言
的
情况下仅用
MySQL
完成?
浏览 28
提问于2017-07-01
得票数 0
回答已采纳
2
回答
MySQL
查询中
的
单
词频
率评分
mysql
、
select
、
syntax-error
、
aggregate-functions
我正在处理一个由2列组成
的
单表数据库:一个整数wordID和varchar。该表有几千行
长
,是通过编程读取大量
文本
并在一个空间
上
拆分,然后将单个单词插入数据库中创建
的
。我想要做
的
是计算每个单词
的
计数
(我自己做
的
),以及每个单词
的
“分数”--也就是说,一个单词mush在数据集中显示一个分数
的
最少次数,这个分数与单词
的
频率成反比,在1-10
的
范围内。人们
的</
浏览 4
提问于2013-11-13
得票数 1
回答已采纳
3
回答
Python
词频
统计程序
python-2.7
、
word-frequency
我用python创建了一个简单
的
单词统计程序,它读取一个
文本
文件,统计
词频
,并将结果写入另一个文件。问题是,当单词重复时,程序会写入同一单词
的
初始
计数
和最终
计数
。例如,如果单词" hello“重复3次,程序将在输出中写入3个hello实例,如下所示:你好-1你好-3counts ={} counts我是python
的
新手。
浏览 0
提问于2014-02-19
得票数 1
2
回答
我们可以训练Spacy进行
文本
摘要吗
nlp
、
spacy
、
spacy-3
Spacy可以训练NER,
文本
分类。我们可以使用它
的
功能进行摘要,所以我们可以训练spacy来提高摘要
的
准确性吗?
浏览 67
提问于2021-09-22
得票数 0
10
回答
使用python进行排序
词频
统计
python
、
sorting
、
word-frequency
我必须使用python计算
文本
中
的
词频
。我想把单词保存在字典里,并对每个单词进行
计数
。 现在,如果我必须根据出现次数对单词进行排序。我是否可以使用相同
的
字典,而不是使用一个新
的
字典,该字典将键作为
计数
,将单词数组作为值?
浏览 7
提问于2010-11-03
得票数 39
回答已采纳
2
回答
在python中使用
计数
器()函数
python
、
dataframe
、
counter
首先,我希望根据
文本
匹配筛选行。第二,我想选择一个特定
的
列,并为该列中
的
所有单词生成单
词频
率。第三,我要绘制单词和频率。 我已经弄清楚了第一部分。我
的
问题是如何在dataframe
上
应用Counter()。如果我只使用
计数
器(Df),它会返回一个错误。因此,我使用以下代码将每一行转换为列表,然后应用
计数
器。当我这样做时,我分别得到每一行
的
单
词频
率(如果我在for循环中使用
计数
器,否则我只得到一行<e
浏览 5
提问于2021-04-07
得票数 0
回答已采纳
3
回答
从网页中剥离HTML并计算
词频
?
java
、
html
、
groovy
、
html-content-extraction
、
text-extraction
在Groovy中,如何抓取网页并删除HTML标记等,只留下文档
的
文本
?我希望将结果转储到一个集合中,这样我就可以构建一个
词频
计数
器。 最后,让我再提一次,我想用Groovy来做这件事。
浏览 2
提问于2008-10-16
得票数 4
回答已采纳
1
回答
是否有算法从给定
的
一组单词中识别出最突出
的
单词?
word
、
similarity
、
wordnet
我试图从一组随机词中找出一个单词
的
重要性。举例来说,我想知道“意外”是“男人、女人、意外”这两个字中最重要
的
字眼。一个简单
的
解决方案是为每个单词获得一个WordNet深度,并根据单词深度中
的
不同来计算单词
的
重要性。这个解决方案非常耗时,因为这需要n(n-1)计算才能产生最终
的
重要性。是否有更好
的
解决方案来处理这种情况?
浏览 0
提问于2014-02-21
得票数 2
回答已采纳
3
回答
朴素贝叶斯,不是那么天真吗?
machine-learning
、
neural-network
、
classification
、
weka
、
naivebayes
我有一个朴素
的
贝叶斯分类器(用WEKA实现),它可以查找大写字母。contains_Bcontains_Z 对于某个类,单词LCD几乎出现在训练数据
的
每个实例中。当我得到"L“
的
概率时,我得到
的
是纯0,而"LC”
的
概率是0.002。既然特征是幼稚
的
,那么L、C和D不是应该独立地贡献总体概率吗,因此"L“具有一定
的
概率,"LC”更多,"LCD“更多?同时,对于MLP,相同
的</em
浏览 0
提问于2012-12-11
得票数 1
2
回答
txt文件中
的
Python
计数
器
python
、
text-files
、
counter
我想从单
词频
率
计数
的
文本
文件中插入一个collections.Counter对象。134044.8 999 fallen 345 29 326.6我想要一个
计数
器对象这样我可以调用[('the', 225300), ('of', 15748
浏览 4
提问于2015-05-28
得票数 0
回答已采纳
3
回答
在自然语言处理中有没有减少词汇表大小
的
好方法?
machine-learning
、
deep-learning
、
nlp
、
gensim
在处理
文本
分类、问答等任务时,从语料库生成
的
原始词汇量通常太大,包含许多“不重要”
的
单词。我见过
的
最流行
的
减少词汇量
的
方法是丢弃停用词和低频词。但在实践中,设置最小
计数
是经验
上
的
,似乎并不十分准确。我注意到词汇表中每个单词
的
词频
通常遵循长尾分布,如果我只保留前K个单词占X% (95%,90%,85%,...),这是一个好方法吗?占总
词频
的
比例?或者,有没有什么明智
浏览 0
提问于2020-02-11
得票数 1
3
回答
将一个输入文件与给定数量
的
文件匹配
的
算法
c++
、
c
、
string
、
algorithm
、
string-matching
我被困在算法圈里
的
一个问题里。我回答了这个问题,但面试官似乎并不信服。这就是为什么我要分享同样
的
东西。 有20个
文本
文件,所有文件都是ASCII
文本
文件,大小小于10^9字节。也有一个输入,这也是一个ASCII文件,比如说,input.txt。我们
的
任务是将此输入文件
的
内容与给定
的
20个文件进行战略性匹配,并打印最接近匹配文件
的
名称。输入文件<
浏览 3
提问于2013-04-04
得票数 7
1
回答
从什么时候起,
MySQL
开始像对待
文本
科尔一样对待VARCHAR?
mysql
、
database
、
text
、
varchar
我知道,从
MySQL
5开始,VARCHAR
的
长度可以达到65,000。VARCHAR是内联存储
的
,这意味着更快
的
检索,而不是存储在表之外
的
TEXT。尽管如此,文档指出
MySQL
将精确地对待LONG VARCHAR TEXT。 从存储前景来看,
文本
和
长
VARCHAR都由Innodb以相同
的
方式处理。
MySQL
什么时候开始像对待
文本
一样对待VARCHAR?
MySQL
是在什么字
浏览 1
提问于2011-07-01
得票数 7
回答已采纳
5
回答
跟踪/
计数
词频
algorithm
、
indexing
、
word-frequency
我想在一个好
的
设计
上
获得一些社区
的
共识,以便能够存储和查询单
词频
率
计数
。我正在构建一个应用程序,在这个应用程序中,我必须解析
文本
输入并存储一个单词出现
的
次数(随着时间
的
推移)。因此,考虑到以下投入: Word CountTo 1A2Bird 1Pla
浏览 8
提问于2010-05-17
得票数 8
回答已采纳
1
回答
文本
东京化后
的
单月不同
词频
python
、
tensorflow
、
keras
、
plot
、
nlp
我在NLP
上
做了一些工作,我做了一些标记化和
文本
预处理
的
任务,同时发现:def len_distribution(X):len_distribution([x.split() for x in X])标记化(序列)后
的
词频
: tokenizer = tf.keras.preprocessing.text.Tokenizertokenizer.fit
浏览 4
提问于2020-11-17
得票数 1
回答已采纳
1
回答
Python :文件中
的
单
词频
率
python-2.7
我在python中创建了一个简单
的
单词
计数
程序,它读取
文本
文件,
计数
单
词频
率,并将结果写入另一个文件。现在
的
问题是,如果我想搜索"windows“并且
文本
文件包含一个单词"xwindows”,那么它也会计算它。windowswindowshwindowsqwindowskwindows所以我想要
的
实际输出是4,因为
浏览 3
提问于2017-04-07
得票数 1
回答已采纳
1
回答
使用矩阵1中
的
索引从矩阵2中提取行
python
、
arrays
、
matrix
、
numpy
、
sparse-matrix
我有两个矩阵,一个是
文本
,另一个是
文本
中
的
单
词频
率。我从字频矩阵中删除一行。然后如何使用
文本
号(从
文本
矩阵中提取行索引)从单
词频
率矩阵中提取一行?这基本
上
意味着删除一个
文本
,因为train_range中只有52行索引。在下面的示例中,删除了第一行(第0行),因为0不在train_range中步骤3:获取
文本
的
单
词频
率 然后对
文本</e
浏览 2
提问于2012-09-07
得票数 0
1
回答
脚本在本机java中构建单词对及其频率。
java
这是我第一次编程,我们
的
任务是在
文本
文件中同时查找单
词频
率和词对频率。我在网上学习了几个教程,并实现了一个相当快
的
单词
计数
解决方案,但是我不知道如何在ho
上
实现一个方法来获取
文本
文件中
的
所有单词对,并总结重复单词对
的
频率,然后再添加到一个数组(hashmap)中。我试着询问我
的
指导员,但是他坚持让我们自己解决这个问题,请给我一个正确
的
方向指向一篇论文/文章/教程(任何我能读到<e
浏览 3
提问于2022-05-18
得票数 -2
2
回答
从多个字典创建数据
python
、
pandas
、
dataframe
我有多个字典,其中包含一系列
文本
文件
的
词频
计数
。我正在试图找到一种将它们整理成dataframe
的
方法(因此,有一个dict =一个
文本
文件=df中
的
一行),但我对Python相当缺乏经验,也不确定如何处理。我有大约50个
文本
文件/字典,但为了简单起见,我有以下内容;mydict2 = {'
浏览 1
提问于2018-02-15
得票数 3
回答已采纳
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
云点播
即时通信 IM
活动推荐
运营活动
广告
关闭
领券