腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
1
回答
Python
Spark
:
将
RDD
的
某些
列
写入
文本文件
python
、
apache-spark
、
pyspark
、
apache-spark-sql
、
pyspark-sql
我想要将
RDD
的
某些
列
写入
文本文件
。目前,我正在使用熊猫来做这件事。2016_pandas = df_2016.select('id', 'source', 'date', 'title', 'abstract', 'content').toPandas() 然后将该
列
转换为字符串
写入
文本文件
和abstract<em
浏览 12
提问于2017-06-23
得票数 0
2
回答
pyspark.sql到JSON
json
、
pyspark
从pyspark.sql查询中获取有效json文档
的
最佳方式是什么?例如,如果我运行:我看到它返回一个数据帧,我可以在上面调用'toJSON‘来获取一个
RDD
。但我找不到一种好
的
方法将其转换为json文档。我对它调用了'collect()‘,但它没有返回有效
的
json,而且似乎不是
将
dataframe转换为json
的
最有效
的
方法。
浏览 19
提问于2019-08-23
得票数 0
回答已采纳
1
回答
在google云实例上运行
Spark
时出错
out-of-memory
、
apache-spark
、
rdd
、
google-hadoop
我正在使用Apache
Spark
运行一个独立
的
应用程序,当我
将
所有数据作为
文本文件
加载到
RDD
时,我得到了以下错误: at org.apache.
spark
.
rdd
.
RDD
.iterator(
RDD
.scala:230) at org.apache.<em
浏览 10
提问于2015-02-28
得票数 0
1
回答
为什么序列化持久化
RDD
占用
的
内存少于反序列化持久化
RDD
?
apache-spark
、
rdd
我读到,当
RDD
以某种形式
的
序列化(无论是默认
的
Java序列化还是类似于Kryo序列化)
的
方式持久化在内存中时,它占用内存中
的
空间更少。我对序列化
的
理解是,它只是一种
将
内存中
的
Java对象转换为一系列位
的
方法,反序列化实际上是
将
这些位作为对象带入内存
的
进程。因此,我总是把反序列化看作是,将带回内存,作为一系列位
的
服从对象。正因为如此,存储反序列化数据
的
术语让我感到
浏览 3
提问于2015-08-13
得票数 5
回答已采纳
1
回答
如何
将
任何分隔
的
文本文件
转换为parquet/avro -使用
spark
动态地更改
列
号/结构为avro/parquet?
apache-spark
、
apache-spark-sql
、
avro
、
parquet
我们需要每天
将
文本数据转换为parquet/avro,如果输入来自多个源,则具有不同
的
结构,我们希望使用基于
spark
sql
的
scala代码来实现这一点,而不管分隔符和
列
或结构
的
数量如何。
浏览 7
提问于2019-10-02
得票数 0
回答已采纳
1
回答
如何
将
模型
的
结果保存到
文本文件
中?
scala
、
apache-spark
、
apache-spark-mllib
我试图将从模型生成
的
频繁项目集保存到
文本文件
中。代码是
Spark
库中FPGrowth示例
的
一个示例。import org.apache.
spark
.
rdd
.
RDD
val data = sc.textFile("/itemset.ite
浏览 0
提问于2016-03-13
得票数 3
回答已采纳
10
回答
如何打印
RDD
的
内容?
scala
、
apache-spark
我正在尝试
将
集合
的
内容打印到
Spark
控制台。我有一个类型:我使用下面的命令:但这是打印出来
的
: res1: org.apache.
spark
.
rdd
.RDDUnit = M
浏览 490
提问于2014-04-20
得票数 130
回答已采纳
1
回答
使用pyspark时,哪个选项
的
性能最好?使用map
的
UDF或
RDD
处理?
apache-spark
、
pyspark
、
apache-spark-sql
、
rdd
、
spark-structured-streaming
使用pyspark时,哪个选项
的
性能最好?使用map
的
UDF或
RDD
处理?我使用
spark
Structured streaming来使用数据,对于每个微批量,我
将
DF转换为
RDD
,并执行一些
python
graphkit操作,然后再次
将
RDD
转换为DF以
写入
Kafka流。
浏览 23
提问于2020-06-26
得票数 1
1
回答
如何在Pandas数据转换过程中处理时间戳类型?
python
、
datetime
、
numpy
、
apache-spark
、
pyspark
我有一个带有pandas.tslib.Timestamp类型时间戳
列
的
熊猫数据。我看了一下“createDataFrame”()中
的
pyspark源代码,它们似乎
将
数据转换为numpy记录数组,并将其转换为列表:>
spark
.createDataFrame(
rdd
,schema) // w
浏览 2
提问于2017-07-25
得票数 5
1
回答
将
csv.writer(csv.writer())-
Python
更改为PySpark
python
、
pandas
、
apache-spark
、
pyspark
我正在尝试应用一个用
Python
语言编写
的
函数,以便在PySpark上可读。 open()函数在PySpark中不可读。在这种情况下如何更换?我有一个需要排序
的
非结构化列表: import csvmy_list = [ ] # Sorting this l
浏览 29
提问于2021-10-15
得票数 0
4
回答
使用Scala中
的
Dataframes在
Spark
1.30中以文本形式保存
sql
、
scala
、
apache-spark
我正在使用
Spark
1.3.0版本,并在Scala中使用带有SparkSQL
的
数据格式。在1.2.0版本中,有一个名为"saveAsText“
的
方法。在使用dataframes
的
1.3.0版本中,只有一个“保存”方法。默认输出是拼板。val sqlContext = new org.apache.
spark
.sql.SQLContext(sc) //
浏览 3
提问于2015-03-27
得票数 6
1
回答
Spark
scala输入/输出目录
scala
、
maven
、
apache-spark
我是
Spark
/Scala编程
的
新手,我能够使用maven进行设置,并能够运行示例字数统计程序。我这里有两个问题,这两个问题都是在
spark
环境/ Windows本地运行
的
:1. scala程序是如何识别输入
的
。2.如何
将
输出
写入
文本文件
。以下是我
的
代码import org.apache.
spark
.Spark
浏览 0
提问于2016-04-29
得票数 0
3
回答
Pyspark:
将
PythonRDD转换为Dataframe
apache-spark
、
pyspark
根据我
的
理解,读取文件应该创建一个DF,但在我
的
例子中,它已经创建了一个PythonRDD。我发现很难
将
PythonRDD转换为DataFrame。请找到我下面的代码来读取一个标签分开
的
文本文件
:
rdd
2 =
rdd
1.lambda row: unicode(row).lower().strip
浏览 3
提问于2016-07-12
得票数 0
回答已采纳
2
回答
将
随机文件
写入
HDFS - PySpark
python
、
pyspark
我还没有看到任何如何做到这一点
的
例子。我在
Python
3环境中使用PySpark 2.0。我有随机数据,二进制数据,.jpg数据,随机字符串。我只需要将数据放回底层存储。
浏览 3
提问于2017-04-20
得票数 2
1
回答
将
现有函数用作UDF以修改
列
时出错
python
、
numpy
、
flask
、
pyspark
、
spark-dataframe
我有一个包含纯文本
的
字符串类型
列
的
dataframe,我想使用pyspark.sql.functions.udf (或pyspark.sql.functions.UserDefinedFunction?修改这个
列
。 return render_template('index.html',
浏览 10
提问于2016-05-24
得票数 0
回答已采纳
1
回答
将
PySpark DataFrames
写入
MySQL时
的
最佳实践
python
、
mysql
、
pyspark
、
apache-spark-sql
、
airflow
我试图开发几个数据管道使用Apache气流与预定
的
火花作业。df_tsv =
spark
.read.csv(tsv_file, sep=r'\t', header=True) df_tsv.write.jdbc其次,我想知道
将
数据从
Spark
<
浏览 2
提问于2021-10-28
得票数 1
回答已采纳
2
回答
如何使用
Spark
来洗牌大文件?
apache-spark
、
shuffle
我有一个20G
的
文本文件
,我想把它
的
行弄乱。由于本地内存
的
限制,我想在
spark
上实现。有人能告诉我怎么做吗?备注:我考虑过使用密钥对(random.random(), line),所以
spark
会在保存文件时按random.random()排序。我不知道它能不能用。
浏览 2
提问于2017-08-07
得票数 0
2
回答
测量pySpark中两
列
之间
的
均方误差
python
、
apache-spark
、
pyspark
、
apache-spark-sql
、
apache-spark-ml
我是pySpark
的
新手,在处理数据方面有一些问题。df = sc.textFile("data.csv").map(lambda l:) at org.apache.
spark
.api.
python
.PythonRDD.compute(Pytho
浏览 0
提问于2018-07-08
得票数 0
回答已采纳
1
回答
由于阶段失败,作业中止:阶段5.0中
的
任务0失败了1次,最近一次失败:阶段5.0中丢失了任务0.0
java
、
apache-spark
、
hadoop
、
intellij-idea
当我运行我
的
程序时,我得到了下面的错误。:1489) at org.apache.
spark
.
rdd
.
RDD
:112) at org.apache.
spark
.
rdd
.
RDD
.withScope(
RDD
.sc
浏览 62
提问于2019-06-05
得票数 1
2
回答
mkString在PySpark中
的
等价性是什么?
python
、
scala
、
apache-spark
、
pyspark
我正在
将
一个dataframe转换成一个管道分隔
的
值,并将其
写入
shell (scala)中
的
一个文件中。但我在PySpark方面毫无头绪。会很感激你
的
帮助。尤其是我不知道如何用“\”来连接每个
列
scala> val stgDF =
spark
.read.table("tbl") stgDF: org.apache.
spark
.sql.DataFrameres0: Array[String] = Arra
浏览 3
提问于2017-10-30
得票数 4
回答已采纳
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
即时通信 IM
云直播
活动推荐
运营活动
广告
关闭
领券