腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
1
回答
spark
中
的
条件
计数
scala
、
apache-spark
、
apache-spark-sql
我想要统计用户在会话
中
访问
的
页面数量,这里我
的
问题是用户可以在一天内有多个会话,我有user_id,login_status和时间戳,如下所示。请帮助我如何计算页面在单个会话
中
没有访问量。提前谢谢。
浏览 15
提问于2019-06-11
得票数 1
回答已采纳
1
回答
Spark
SQL
中
的
条件
计数
apache-spark
、
apache-spark-sql
我试着有
条件
地计算一列,这是我
的
代码。
spark
.sql( |SELECT | sea, """.stripMargin).createOrReplaceTempView("something") 这会抛出一个奇怪
的
错误感谢您<em
浏览 0
提问于2020-11-16
得票数 0
1
回答
如何从pyspark
中
的
spark
dataframe中提取特定值?
python
、
apache-spark
、
pyspark
我需要使用sql查询从pyspark中提取
计数
。count在
spark
dataframe
中
,我想使用
计数
值在if
条件
中使用,但不能提取该值。如何从
spark
dataframe中提取int值 query = "select count(*) as count from abc where FLAG= 'C' " counter =
浏览 99
提问于2021-08-03
得票数 0
回答已采纳
2
回答
火花数据过滤并选择
scala
、
apache-spark
、
apache-spark-sql
我有一个,需要根据
条件
过滤元素并选择
计数
。count().alias("cnt")我面临
的
错误是值选择不是org.apache.
spark
.sql.Column
的
成员,也因为某些原因,
计数
是DatasetRow,有想法在单行
中
得到
浏览 1
提问于2020-04-24
得票数 1
1
回答
Spark
SQL表
的
基本统计估计
apache-spark
、
apache-spark-sql
我知道我们可以在
Spark
SQL
中
显式地ANALYZE表,这样我们就可以获得一些准确
的
统
计数
据。但是,有没有可能在Catalyst
中
存在一些实用程序,它们不需要显式地扫描整个表,但它可以给我一些粗略
的
统
计数
据。我并不关心表
的
实际大小,我只关心表之间
的
相对大小。因此,在查询编译过程
中
,我可以使用这些信息来决定哪个表比其他表大。Catalyst中有两个实用程序 org.apache.
spark
.sql
浏览 27
提问于2019-11-07
得票数 0
2
回答
将星火DataFrame值存储在scala变量
中
scala
、
apache-spark
、
apache-spark-sql
我需要检查表
中
的
重复文件名,如果文件
计数
为0,则需要使用sparkSql加载表
中
的
文件。我写了下面的代码。val s1=
spark
.sql("select count(filename) from mytable where filename='myfile.csv'") //giving '2's1: org.apache.
spark
.sql.DataFrame = [count(file
浏览 6
提问于2020-04-12
得票数 1
回答已采纳
1
回答
如何在Argo工作流
中
增加
计数
器?
apache-spark
、
kubernetes
、
pyspark
、
argo-workflows
、
argo
我已经编写了一个argo dag来在递归中触发火花作业,直到
条件
满足为止。我有一个
计数
器参数,需要增加1后,成功完成火花工作。但这是不可能
的
。这是我工作流程
的
片段。templates: dag: - name: test-
spark
-job - name: loop-it templa
浏览 12
提问于2022-01-06
得票数 1
1
回答
N个任务
的
序列化结果(x )
的
总大小大于
spark
.driver.maxResultSize。
apache-spark
、
pyspark
、
apache-spark-sql
在火花数据帧上执行简单
计数
操作时,我得到以下错误。
spark
.driver.memory : 4g
spark
.executor.cores : 2我不知道为什么这段简单
的
代码会向驱动程序发送超过1GB
的
数据。如果我将
spark
.driver.maxResultSize增加到更高
的
值,代码可能会工作,但我想了解为什么驱
浏览 0
提问于2020-08-14
得票数 2
2
回答
如何比较PySpark
中
两个数据帧
的
计数
?
python
、
pyspark
、
apache-spark-sql
我使用
的
是PySpark,在这里我从数据帧
中
构建临时视图。作为其中
的
一部分,我想知道如何比较两个数据帧
的
计数
,如果它们不匹配,就抛出一个错误。我
的
代码如下所示: df1 =
spark
.sql ("""SELECT Col1, Col2, Col3, Col4, Col5 FROM Table1""") df1.createOrReplaceTempView=
spark
.sql ("
浏览 8
提问于2020-08-21
得票数 1
回答已采纳
2
回答
如何快速计算火花放电DataFrame上不同
条件
下
的
多个
计数
?
python
、
apache-spark
、
pyspark
比方说,我有这个火花缭乱
的
数据:我需要做100+
计数
,对于一个10行
的
数据集,计算需要几分钟。在有人问之前,这些
计数
的
条件<
浏览 2
提问于2021-10-18
得票数 0
回答已采纳
1
回答
Spark
2.1.1:如何将变量绑定到结构化流查询
apache-spark
、
user-defined-functions
、
spark-structured-streaming
我想使用变量来选择两个变量值范围之间
的
条目。在这个查询
中
,UPPERTIME('1')和LOWERTIME('1')是UDF,它们
的
定义是 return lowerTime.toString(); }, DataTypes.StringType);
s
浏览 1
提问于2017-06-16
得票数 0
1
回答
Spark
HiveContext: HDFS上包含多个文件
的
表
python
、
apache-spark
、
dataframe
、
hdfs
表X在HDFS上
的
位置是/data/hive/X。文件:/data/hive/X/f2如果是,有没有办法指示
Spark
将所有文件加载到一个分区
中
,然后处理数据? 提前谢谢。
浏览 8
提问于2016-09-14
得票数 0
回答已采纳
1
回答
Spark
:为什么带有"NOT IN“
的
subselect比"IN”慢得多?
performance
、
apache-spark
我在Apache
Spark
2.x中有两个表。每个表都有一个公共行"IDNUM“。称它们为表A和表B。这在Apache SparkSQL
中
是很快
的
:这是令人难以置信
的
慢:它
的
速度要慢得多,仅仅是完成它就会更快: total = SELECT C
浏览 0
提问于2019-01-26
得票数 2
2
回答
在Apache
Spark
中计算配置单元统计信息
apache-spark
、
hive
我正在尝试计算Apache
Spark
中
的
配置单元表统
计数
据:我还执行语句来查看收集到
的
内容:sqlCtx.sql('DESC FORMATTED t1') 我可以看到我
的
数据是被收集
的
。但是,当我在HIVE client (Ambari)
中
执行相同
的
staement时,没有显示任何统<em
浏览 2
提问于2018-04-14
得票数 1
1
回答
Spark
/Scala近似分组方式
scala
、
apache-spark
、
apache-spark-sql
在
Spark
中
的
sql数据集上,有没有一种在group by之后近似
计数
的
方法?或者更一般地说,在
Spark
中
计数
分组
的
最快方法是什么?
浏览 28
提问于2020-04-06
得票数 2
回答已采纳
1
回答
批间火花流数据共享
apache-spark
、
spark-streaming
但是我
的
用例需要在间隔之间共享数据。我将如何产生以下字数?单词"hadoop“和”火花“与前一个间隔
计数
的
相对
计数
因此,在处理第二间隔数据时,应该有hadoop和
spark
的
第一间隔字
计数
。 这是一个
浏览 2
提问于2015-05-05
得票数 8
回答已采纳
1
回答
Spark
与Hive
的
差异与ANALYZE TABLE命令-
apache-spark
、
pyspark
、
apache-spark-sql
、
pyspark-sql
从
Spark
对Hive表运行
的
ANALYZE TABLE命令不会提供与从Hive发出
的
相同命令相同
的
性能改进。例如,我将一个数据帧插入到一个空
的
Hive表
中
: output.write.insertInto(“XXXXXXXX”) 然后运行analyze table命令:-
spark
.sql("ANALYZETABLE XXXXXXXX COMPUTE STATISTICS") 当我在Hive
中
做记录
计数
时,它非
浏览 261
提问于2019-01-05
得票数 2
回答已采纳
3
回答
使用火花放电过滤和
计数
星火数据
中
的
负/正值?
apache-spark
、
pyspark
、
apache-spark-sql
我有一个带有10MM+行和50+列
的
星星之火数据,需要计算一个特定列中值等于或小于0
的
时间。 提前谢谢。
浏览 4
提问于2018-09-14
得票数 4
回答已采纳
2
回答
在Scala/
Spark
聚合函数
中
,lit(0)和lit(1)做了什么?
scala
、
apache-spark
data_exploded.amount")==="A",col("data_exploded.positive_amount")).otherwise(lit(0))).as("aggAmount") ) lit(0)是引用位置0
的
索引,还是引用数字0
的
文字值?However, the usage in `count(lit(1)).as("aggDataCount中看到
的
定义对我来说就像是指一列
的
索引位置。谢谢。
浏览 903
提问于2021-09-07
得票数 2
回答已采纳
6
回答
如何计算星火数据表
中
的
列数?
scala
、
apache-spark
、
dataframe
、
apache-spark-sql
我在星火中有这个数据,我想计算其中可用列
的
数量。我知道如何
计数
列
中
的
行数,但我希望
计数
列数。val df1 = Seq( ("
spark
", "scala", "2015-10-15", 11,"abhishek&
浏览 0
提问于2018-07-27
得票数 17
回答已采纳
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
云点播
即时通信 IM
活动推荐
运营活动
广告
关闭
领券