腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
0
回答
groupBy
在
Spark
中
的
应用
python
、
apache-spark
、
pyspark
、
apache-spark-sql
、
spark-dataframe
我目前正在学习python
中
的
spark
。我有一个小问题,
在
SQL这样
的
其他语言中,我们可以简单地按指定
的
列对表进行分组,然后对它们执行进一步
的
操作,如sum、count等。我们如何在
Spark
中
做到这一点?我有这样
的
模式: [name:"DEF&q
浏览 3
提问于2016-07-14
得票数 2
1
回答
Microsoft
Spark
聚合方法
c#
、
.net
、
apache-spark
我正在使用Microsoft.
Spark
Spark
API并将
GroupBy
应用
于DataFrame对象。我想在分组后将Agg
应用
于多个列。
在
pyspark
中
,我会用下面这样
的
东西来表达我想要实现
的
目标 new_df = df.
groupBy
("customer_id") func.mean("a").alias使用.NET
应用
浏览 18
提问于2021-10-01
得票数 0
回答已采纳
1
回答
如何与流窗口操作一起指定
groupby
中
的
多列?
scala
、
apache-spark
、
apache-spark-sql
我无法
在
groupBy
函数中指定列列表以及窗口操作。)这一行
中
的
多个标记:重载
的
方法值String*)org.apache.
spark
.sql.RelationalGroupedDataset:(col1: String,cols: (cols: org.apache.
spark
.sql.Column*)org.apache.
spark
.sql.RelationalGroupedDataset )不能
应用
于(ListStri
浏览 4
提问于2020-10-30
得票数 0
回答已采纳
1
回答
Spark
SQL
中
Group By子句
的
底层实现
apache-spark
、
apache-spark-sql
Spark
SQL
中
Group By子句
的
底层实现是什么?我知道
Spark
支持下面两种类型
的
Group by操作,即GroupByKey和ReduceByKey。ReduceByKey是一种map side reduce,它提供了比GroupByKey更好
的
性能。
在
我们
的
应用
程序代码
中
,我们
在
Spark
Dataframe上使用
Spark
SQL,而不是直接创建R
浏览 0
提问于2019-08-30
得票数 1
1
回答
火花放电
中
的
计数和群值
pandas
、
dataframe
、
pyspark
、
transform
我是
Spark
的
新手,我正在尝试将
groupby
和count
应用
到count属性
的
dataframe df
中
。import pandas as pd (1, "
Spark
is awesome"),2 2
浏览 4
提问于2017-02-07
得票数 1
回答已采纳
5
回答
PySpark
中
的
Panda
的
value_counts()
的
等价物是什么?
dataframe
、
count
、
pyspark
、
pandas-groupby
我有以下python/pandas命令:我在这里获取DataFrameGroupBy对象中所有列
的
值计数。如何在PySpark
中
执行此操作?
浏览 1
提问于2018-06-27
得票数 32
2
回答
为什么隐式类
中
的
函数不可用?
scala
、
scala-implicits
我正在尝试教自己Scala,并使用IntelliJ
的
想法作为我
的
IDE。我已经启动IntelliJ
的
shell,运行console,然后输入以下内容:import org.apache.
spark
.sql(new SparkConf().setMaster("local[*]")).enableHiveSupport().getOrCreate()
浏览 1
提问于2018-05-22
得票数 1
回答已采纳
1
回答
使一个函数成为.agg()
在
groupBy
语句中
的
组件,将生成一个AssertionError
python
、
pandas
、
apache-spark
请注意,只有
在
您已经通过运行以下命令安装
spark
时,您才可以
在
本地运行此命令。否则,
在
Databricks集群上复制该问题,该集群将自动初始化星体上下文。=
spark
.createDataFrame(
spark
_dataframe)我按ID对数据进行分组,并希望将
应用
于函数
中
的
聚合。因为
在
许多不同
的
应用
程序
中
应用
浏览 3
提问于2020-07-01
得票数 1
回答已采纳
2
回答
如何使用Dataset API (如SQL
的
“按1分组”或“按2排序”)使用序数?
apache-spark
、
dataframe
、
apache-spark-sql
我能够
在
Spark
‘文字’查询中使用序数(
在
GROUP BY和ORDER BY之后
的
这些整数):但是对于DataFrames/DataSet,我必须始终使用列名: df.select($"ProfileName").
groupBy
($"ProfileName").count(
浏览 3
提问于2017-07-19
得票数 2
回答已采纳
1
回答
如何避免使用数据访问接口( dataframe )使用
groupBy
来查找星星之列上
的
平均列?
apache-spark
、
pyspark
我有一个具有以下数据和列
的
数据: +- monthly_sales +50.0-低.年.月.日.我正试图将每种销售类型
的
平均值转化为dataframe,其中我
在
最后
的
dataframe
中
只有三行(每种销售类型一行)。sale & average_sale 我使用
groupBy
来实现这个目标。sales_df.
groupBy
(
浏览 3
提问于2021-05-01
得票数 1
1
回答
通过bucketBy实现
Spark
DataFrame / Dataset
groupBy
优化
apache-spark
、
group-by
、
query-optimization
、
parquet
、
bucket
我正在研究一个用例
的
选项,在这种用例
中
,我们将数据集存储为拼图文件,并希望稍后在读取数据时对特定键运行有效
的
groupBy
查询。我读过一些关于
groupBy
优化
的
文章,但是没有找到太多关于它
的
信息(除了RDD级别的reduceByKey)。我所考虑
的
是,如果数据集是由键写成桶
的
,那么它也将在
groupBy
中使用。我脑海中
的
一个想法是通过mapPartitions然后
groupBy
来
浏览 61
提问于2019-05-18
得票数 3
2
回答
Spark
-scala聚合列表
中
的
多个列
scala
、
apache-spark
、
aggregate
我有一个数据帧,其中有几个数值列是不固定
的
(它们
在
每次执行过程中都会发生变化)。假设我有一个带有数字列名称
的
Seq对象。我想对这些列
中
的
每一列
应用
一个聚合函数。(c).as(c) 但它给出了以下错误: scala> var avgTktsPerPeriodo =df.
groupBy
("ID").agg(sum
浏览 2
提问于2018-09-04
得票数 0
2
回答
将cache()和count()
应用
于数据库
中
的
Spark
是非常慢
的
。
python
、
apache-spark
、
pyspark
、
azure-databricks
然而,
在
我尝试这样做
的
过程
中
,我遇到了以下悖论:步骤1:从Azure数据湖存储帐户读取800万行 read_avro_data=
spark
.read.format("avro"我
的
应用
程序有800万行,运行得很好,但我想在大数据环境
中
对我
的
应用
程序进行压力测试。因为800万行不是大数据。因此,我复制了我
的
800万行--
Spark
287次--22亿行。
浏览 0
提问于2020-06-01
得票数 3
回答已采纳
1
回答
用农业火花和scala进行选择
scala
、
apache-spark
、
apache-spark-sql
我用pySpark写
的
df.select('*', date_format('window_start', 'yyyy-MM-dd hh:mm').alias('time_window')) \.agg({'total_score': 'sum'})我想让它在scala语言中运行,我做了这个,我得到了("
浏览 0
提问于2017-02-27
得票数 0
1
回答
将
GroupBy
+aggregate转换为groupByKey
apache-spark
、
pyspark
、
spark-dataframe
我设计了一个如下所示
的
DF:|A |B ||1 |"bar"|A |B ||2 |"bar/foo" |df.
groupby
("A") .ag
浏览 0
提问于2017-08-07
得票数 1
回答已采纳
1
回答
在
databricks错误
中
查找所有列
的
和
scala
、
apache-spark
我是Scala
的
新手,我基本上想在一个数据集上执行一些聚合。是否有可能将它们聚在一起,或者我是否应该将它们分开(和、最小、最大)?这就是我迄今为止尝试过
的
: myDF .sum()它给了我以下错误信息: ( String*)org.apa
浏览 0
提问于2019-05-21
得票数 2
3
回答
在
带约束
的
Apache
Spark
(Scala)数据框中将布尔列转换为数值列?
scala
、
spark-dataframe
= [a: string, b: bigint, c: boolean]上面的代码失败了,因为c是一个布尔变量,而聚合不能
应用
于布尔值。
Spark
中
是否有一个函数可以将
Spark
数据帧
的
整列
的
true值转换为1,并将false转换为0。($"a",$"b")
浏览 2
提问于2017-11-01
得票数 3
回答已采纳
3
回答
如何在
spark
数据流结构中使用非基于时间
的
窗口?
pyspark
、
apache-spark-sql
、
spark-streaming
我正在尝试使用window on structured与
spark
和kafka。我
在
非基于时间
的
数据上使用window,所以我得到了这个错误:下面是我
的
代码:output
浏览 0
提问于2019-04-09
得票数 5
1
回答
使用s3-dist-cp进行星火
应用
程序消费
的
JSON聚合
apache-spark-sql
、
amazon-emr
、
distcp
、
s3distcp
运行在AWS上
的
spark
应用
程序从存储
在
S3
中
的
JSON数组加载数据。然后通过火花引擎处理由此创建
的
Dataframe。 我
的
源JSON数据以多个S3对象
的
形式出现。我需要将它们压缩到JSON数组
中
,以减少
在
我
的
Spark
应用
程序
中
读取
的
S3对象
的
数量。我尝试使用"s3-dist-
浏览 13
提问于2020-04-07
得票数 0
1
回答
PySpark/Delta数据仓库
的
高效执行
apache-spark
、
apache-spark-sql
、
databricks
、
delta-lake
使用Databricks上
的
pyspark/Delta湖泊,我有以下场景:result = sdf.filter(...).
groupBy
(...).agg(...)...).count() # transformation performed here 正如我所理解
的
,由于链式执行,result实际上不是根据声明计算
的
,而是
在
什么时候使用<em
浏览 2
提问于2019-11-01
得票数 1
回答已采纳
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
云点播
实时音视频
活动推荐
运营活动
广告
关闭
领券