腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
1
回答
Pyspark
-
在
循环
内
更新
数据
帧
python
、
apache-spark
、
dataframe
、
pyspark
我写了一些代码来
更新
for
循环
中的dataframe,但我得到了奇怪的结果: def _simulate_walks(self): aprox_sample_rate.selectExpr('LAST_NODE', 'CHOSEN_NODE', 'NEW_PATH as PATH') chosen_path.show(5, False) 但是,当我
在
循环
中添加我知道
在</em
浏览 18
提问于2019-01-24
得票数 2
1
回答
Pyspark
使用窗口函数和我自己的函数
python
、
pandas
、
pyspark
、
window
我希望用
pyspark
和spark dataframe做同样的事情。我知道我必须使用窗口函数,但它比熊猫更难理解,所以我迷路了…… 我有这个,但我不知道如何让它工作。
浏览 29
提问于2020-06-26
得票数 0
回答已采纳
1
回答
如何在
循环
中创建一个
pyspark
DataFrame?
pyspark
、
pyspark-dataframes
如何在
循环
中创建一个
pyspark
DataFrame?在这个
循环
中,
在
每次迭代中,我输出2个值print(a1,a2)。现在,我想将所有这些值存储
在
一个
pyspark
数据
帧
中。
浏览 26
提问于2021-01-12
得票数 0
1
回答
如何在for
循环
中附加
pyspark
数据
帧
?
dataframe
、
apache-spark
、
pyspark
、
pyspark-dataframes
示例:我有一个
pyspark
dataframe: x_data y_data 3.5 8.5 5.5 20.5 41 23 58 30 y_data 如何将每列计算的结果附加到for
循环
内
的相同
p
浏览 13
提问于2021-02-18
得票数 0
回答已采纳
2
回答
我们是否可以动态检索
pyspark
dataframe中
更新
列的前一行的值
python
、
dataframe
、
pyspark
我已经在下面提到了
数据
帧
。所以我的最终
数据
帧
应该是:| START | END || 1 | 5 || 8 | 11 || 17 | 22 |您可以考虑初始
数据
帧
是按其START列排序的当我们使用
循环
时,这是一个简单的问题,但
浏览 19
提问于2020-02-07
得票数 1
1
回答
如何使用
pyspark
合并来自两个不同
数据
帧
的
数据
?
python
、
dataframe
、
apache-spark
、
pyspark
、
amazon-emr
我有两个不同的(非常大的)
数据
帧
(详细信息如下)。我需要合并他们两个人的
数据
。由于这些
数据
帧
非常庞大(第一个
数据
帧
有数百万行,第二个
数据
帧
有数千行),我尝试使用AWS EMR服务。但我不太明白它是如何在那里完成的,我看到的教程大多只显示了一个
数据
帧
的说明。所以,我一直想知道如何使用
pyspark
来处理两个不同的
数据
帧
。以下是详细信息: 第一个<e
浏览 11
提问于2021-06-03
得票数 0
回答已采纳
1
回答
Spark SQL
更新
/删除
apache-spark
、
pyspark
、
apache-spark-sql
、
pyspark-sql
、
pyspark-dataframes
目前,我正在做一个使用
pySpark
的项目,它读取一些Hive表,将它们存储为
数据
帧
,并且我必须对它们执行一些
更新
/过滤。我正在不惜一切代价避免使用Spark语法来创建一个框架,该框架只接受参数文件中的SQL,该参数文件将使用我的
pySpark
框架运行。现在的问题是,我必须在我的最终
数据
帧
上执行
更新
/删除查询,是否有任何可能的工作来
在
我的
数据
帧
上执行这些操作? 非常感谢!
浏览 7
提问于2019-11-15
得票数 1
1
回答
将100k行
pyspark
df转换为pandas df
python
、
pandas
、
pyspark
我有一个100k行的
pyspark
df。我用的是spark df = pandas_df.toPandas() 这需要花费大量时间来执行此语法。有没有其他方法可以
在
几秒钟
内
完成这个操作?另外,要将
pyspark
数据
帧
保存为.csv格式,需要花费大量时间。为甚麽会这样呢?
浏览 32
提问于2020-07-29
得票数 1
1
回答
如何使用
Pyspark
/SQL/DataFrames SPARK RDD来插入/删除DB2源表
数据
?
pyspark
、
apache-spark-sql
、
spark-streaming
、
pyspark-sql
我尝试运行upsert/delete命令来插入/删除DB2
数据
库源表中的一些值,这是DB2上的一个现有表。是否可以使用
Pyspark
/Spark SQL/Dataframes。
浏览 2
提问于2019-05-10
得票数 0
1
回答
在
Databricks中使用
Pyspark
更新
数据
库表
python
、
pandas
、
pyspark
、
databricks
我
在
Azure SQL Server
数据
库中有一个表,该表是从我的Dataframe填充的。我想使用
pyspark
/ pandas基于多条件
数据
库来
更新
这个表。我是
PySpark
/ Databricks / Pandas的新手,有人能告诉我如何
更新
表吗?我已经将
数据
插入到表中-我可以想到的一种解决方案是将表中的
数据
加载到
数据
帧
中,然后将新文件合并到相同的
数据
浏览 2
提问于2020-04-20
得票数 0
2
回答
迭代和计算列的更有效的方法
apache-spark
、
pyspark
我有一个非常宽的
数据
帧
> 10,000列,我需要计算每个列中空值的百分比。
浏览 0
提问于2017-09-24
得票数 1
1
回答
火花驱动程序意外停止,并且正在重新启动。
python
、
apache-spark
、
pyspark
、
databricks
、
azure-databricks
我
在
databricks上使用
pyspark
,并试图使用 over
循环
迭代一个小的dataframe (50行),直到
数据
some计数为0,并在
循环
中执行一些基本操作(筛选、排序、获取第一行和
更新
某些列),然后
在
15次迭代后得到以下错误 火花驱动程序意外停止并正在重新启动.我没有使用toPandas()或collect(),我没有使用很多对象(
循环
中只有3个
数据
,每次迭代都
更新
它们),我运行笔记本,集群上没有运行其
浏览 3
提问于2022-05-11
得票数 2
回答已采纳
2
回答
将
PySpark
数据
帧
转换为
PySpark
.pandas
数据
帧
python-3.x
、
apache-spark
、
pyspark
在
链接中,用户可以
在
Spark3.2中的
PySpark
之上与熊猫合作。是否需要很长时间才能将
PySpark
数据
帧
转换为
PySpark
熊猫
数据
框架?我知道将
PySpark
数据
帧
转换为熊猫
数据
框架需要很长时间。
浏览 9
提问于2022-03-02
得票数 1
回答已采纳
1
回答
如何将Azure Synapse Dataframe转换为JSON on Databricks?
azure
、
pyspark
、
databricks
、
azure-databricks
、
azure-synapse
我是否可以将Azure Synapse Dataframe转换为JSON?因为当我尝试的时候,它得到了一个错误。我使用脚本作为Pandas DataFrame函数df.to_json(),因为我假设Azure Synapse DataFrame与Pandas Dataframe相同。class UtilAzSynapse(UtilAzSynapse): def write_to_synapse(df, table, write_mode, url, tempDir):
浏览 19
提问于2021-05-31
得票数 0
回答已采纳
2
回答
PySpark
列向绑定
pyspark
在
PySpark
中有什么特定的方法可以像我们
在
r中那样绑定两个
数据
帧
吗? 我需要在
PySpark
中同时绑定
数据
帧
和作为一个
数据
帧
。
浏览 1
提问于2017-08-30
得票数 3
1
回答
如何使用
PySpark
更新
hive表中的记录?
hive
、
pyspark-sql
我们正在使用spark来处理大型
数据
,并且最近获得了新的用例,我们需要使用spark
更新
Hive表中的
数据
。下面是一个简单的例子:
数据
驻留在Hive表中,应用程序使用
PySpark
读取
数据
帧
(比如
PySpark
)。例句:
数据
帧
在
列下面。例如:加5 Add 30 32000 应用程序可以通过剥离Action列并附加到表中,将新
数据
读入第二个<e
浏览 1
提问于2019-03-29
得票数 2
1
回答
用map并行化for
循环
,用
pyspark
并行化reduce
python
、
apache-spark
、
pyspark
在
我的应用程序中,我从S3上不同位置的
数据
创建不同的
数据
帧
,然后尝试将这些
数据
帧
合并为单个
数据
帧
。现在,我正在使用一个for
循环
。但我有一种感觉,使用
pyspark
中的map和reduce函数可以更有效地完成这项工作。下面是我的代码:from
pyspark
.sql import SQLCon
浏览 0
提问于2016-08-24
得票数 3
1
回答
Pyspark
'for‘
循环
没有使用.filter()正确过滤
pyspark
-sql
数据
帧
。
python
、
apache-spark
、
for-loop
、
pyspark
、
apache-spark-sql
我正在尝试创建一个for
循环
,首先:过滤一个
pyspark
sql
数据
帧
,然后将过滤后的
数据
帧
转换为pandas,对其应用一个函数,并将结果添加到一个名为results的列表中。我的列表包含一个字符串序列(这将是dataframe中的某种id );我希望for
循环
在
每次迭代中从列表中获取一个字符串,并过滤dataframe中id为该字符串的所有行。aux = df.filter("id='x'") fi
浏览 21
提问于2020-12-16
得票数 1
回答已采纳
2
回答
无法将StructField与
PySpark
一起使用
python
、
apache-spark
、
pyspark
我正在运行
PySpark
外壳,无法创建
数据
帧
。我已经做了from
pyspark
.sql.types import StructField并不断收到错误:未定义` name 'StructField‘奇怪的是,如果我删除for
循环
并这样做
浏览 0
提问于2016-12-30
得票数 3
1
回答
使用
pyspark
基于日期列拆分零件文件
python
、
pyspark
我还想使用
pyspark
根据date列拆分csv文件。我想知道这样做的有效方法,因为csv将包含数百万行。我目前的方法是-将2012年的所有csv文件读取到一个
数据
帧
中-然后
在
365天
内
循环
上述
数据
帧
,然后按日期将内容写入csv。> 1234|2012-01-01|abc|def|455 > 1278|2012-04-05|duuj|dea|4
浏览 0
提问于2018-03-28
得票数 1
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
即时通信 IM
云直播
活动推荐
运营活动
广告
关闭
领券