腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
0
回答
Spark
:
如何
添加
每个
RDD
的
大小
并
写入
新文件
?
scala
、
apache-spark
我将
每个
事件保存在文本文件中,如下所示:我还想保存
每个
事件
的
总
大小
,我正在保存到文本文件。1)
如何
将每条记录
的
总
大小
保存到
新文件
中?
浏览 7
提问于2017-06-20
得票数 0
回答已采纳
2
回答
在火花流上下文中将
RDD
写入
HDFS
scala
、
hadoop
、
apache-spark
、
hdfs
、
spark-streaming
我有一个
spark
1.2.0
的
spark
流媒体环境,我从本地文件夹中检索数据,每次我发现文件夹中
添加
了一个
新文件
时,我都会执行一些转换。因为我真的需要使用数组来操作数据,所以不可能用DStream.saveAsTextFiles("...")将数据保存在HDFS上(这将很好地工作),我必须保存
RDD
,但是有了这个preocedure,我终于有了名为使用arr.foreach(println),我能够看到正确
的
转换结果。 我
的
怀疑是
浏览 1
提问于2015-07-02
得票数 7
回答已采纳
1
回答
我可以使用
Spark
进行自定义计算吗?
apache-spark
、
pyspark
、
databricks
我有一些(200左右)大
的
zip文件(有些大于1 1GB),它们应该被解压
并
使用Python地理和图像处理库进行处理。结果将以
新文件
的
形式
写入
FileStore,稍后将用于Databricks中
的
ML任务。 如果我想利用
Spark
集群
的
处理能力,一般
的
方法是什么?我正在考虑将文件名
添加
到DataFrame中,
并
使用用户定义
的
函数通过Select或类似的方法来处理它们。我相信我应该能
浏览 16
提问于2020-09-30
得票数 1
回答已采纳
1
回答
使用pyspark时,哪个选项
的
性能最好?使用map
的
UDF或
RDD
处理?
apache-spark
、
pyspark
、
apache-spark-sql
、
rdd
、
spark-structured-streaming
使用pyspark时,哪个选项
的
性能最好?使用map
的
UDF或
RDD
处理?我使用
spark
Structured streaming来使用数据,对于
每个
微批量,我将DF转换为
RDD
,
并
执行一些python graphkit操作,然后再次将
RDD
转换为DF以
写入
Kafka流。
浏览 23
提问于2020-06-26
得票数 1
1
回答
添加
到字符串
Spark
列表
java
、
json
、
apache-spark
、
spark-streaming
、
rdd
我有以下Java
Spark
代码: //do some operations
rdd
.foreach(msg -> {//Kafka messages writeJsons(jsonList);/&
浏览 1
提问于2018-07-05
得票数 2
3
回答
Java Apache
Spark
:长
的
转换链导致二次时间
java
、
apache-spark
我有一个使用Apache
Spark
的
Java程序。该程序最有趣
的
部分如下所示: .AnnotatedDocument> ll = annotated.collect();} 因此,实际上,行(**)会生成一个
RDD
我
的</e
浏览 1
提问于2016-03-21
得票数 6
1
回答
尝试通过Java SDK将记录从
Spark
DataFrame
写入
Dynamodb时,任务不可序列化
java
、
amazon-web-services
、
apache-spark
、
apache-spark-sql
、
amazon-dynamodb
(0), row.getString(1))).collect()org.apache.
spark
.SparkException(SparkContext.scala:2094)at org.apache.
spark
.
rdd</
浏览 4
提问于2017-08-01
得票数 1
1
回答
在apache
spark
中,
RDD
缓存逐出
的
LRU策略是
如何
工作
的
?
apache-spark
、
spark-streaming
、
rdd
(1)
Spark
如何
决定为
RDD
驱逐哪些分区? (2) LRU和
RDD
StorageLevel之间
的
关系是什么?(3)如果数据源
大小
很大(大于所有executor内存之和),
spark
如何
加载数据
并
创建
RDD
?它与LRU有关吗?我创建这个问题
的
目的是为了获得一些关于
RDD
LRU驱逐
的
细节,StorageLevel。
浏览 0
提问于2017-09-06
得票数 1
1
回答
为什么
Spark
总是将相同数量
的
文件
写入
HDFS?
apache-spark-sql
、
hdfs
、
spark-streaming
我有一个用Scala编写
的
Spark
流媒体应用程序,在CDH中运行。应用程序从Kafka读取数据并将数据
写入
HDFS。在将数据
写入
HDFS之前,我执行了partitionBy,因此数据是分区
写入
的
。
每个
分区在
写入
时都会得到3个文件。我还使用coalesce来控制数据
的
分区数量。我尝试使用3个执行器和6个执行器运行,但
每个
分区中
的
文件数量仍然是3个。这就是我将数据
写入
HDFS
浏览 0
提问于2018-09-18
得票数 1
1
回答
在Scala中使用索引将
RDD
激发到新
的
MongoDB集合
mongodb
、
scala
、
apache-spark
、
rdd
在火花提交作业(用Scala编写
的
.JAR)中,我需要访问现有的MongoDB,在db中创建一个新
的
集合,
添加
索引,从分布在1,000多个执行者
的
RDD
中
写入
数据到集合中。我找不到一个能做到这一切
的
图书馆。现在,我使用mongo火花连接器从
RDD
写入
,然后使用casbah创建索引。 从
RDD
写入
新集合(使用mongo
浏览 2
提问于2017-10-31
得票数 1
回答已采纳
2
回答
mkString在PySpark中
的
等价性是什么?
python
、
scala
、
apache-spark
、
pyspark
我正在将一个dataframe转换成一个管道分隔
的
值,并将其
写入
shell (scala)中
的
一个文件中。但我在PySpark方面毫无头绪。会很感激你
的
帮助。尤其是我不知道
如何
用“\”来连接
每个
列scala> val stgDF =
spark
.read.table("tbl") stgDF: org.apache.
spark
.sql.DataFrameres0: Array[String] = Arra
浏览 3
提问于2017-10-30
得票数 4
回答已采纳
1
回答
单日志文件
的
火花累积处理
apache-spark
、
spark-streaming
对于使用
spark
streaming
的
日志处理,我使用了socketStream和textFileStream API。通过socketStream,使用特定端口上
的
nc -lk,我们可以读取附加
的
日志文件,通过textFileStream,可以读取目录中
添加
的
任何
新文件
并进行累积处理。我正在寻找
的
是一个单个日志文件,随着时间
的
增长,我
如何
读取相同
的
日志文件: DStream或任何
Spar
浏览 0
提问于2015-12-30
得票数 3
1
回答
如何
增加cassandra磁盘I/O
io
、
cassandra
我注意到,在任何工作/任务所执行
的
火花,卡桑德拉
的
I/O率(从收集石墨到地堑)非常低-磁盘读取操作/Sec和磁盘
写入
操作/Sec
的
最大数量为75。这似乎是一个节流
的
problem...So,我
如何
才能提高卡桑德拉磁盘I/O率?
浏览 2
提问于2016-01-05
得票数 2
回答已采纳
1
回答
GC减慢了
spark
作业
的
执行速度
amazon-s3
、
apache-spark
、
garbage-collection
我正在运行一个非常简单
的
spark
作业,它一个接一个地读取许多s3文件,
并
调用
RDD
上
的
映射/过滤器作业,然后将结果写出到另一个s3。换句话说,首先有一个for循环,在
每个
循环中,有一个sc调用来读取,处理,然后
写入
步骤。尽管与节点
大小
和数量相比,
每个
文件
的
大小
都很小(在8个节点内运行500MB,
每个
节点有10 GB
的
执行器内存),但速度仍然异常缓慢。
浏览 0
提问于2015-10-17
得票数 1
2
回答
Spark
Dataframe/
RDD
无法通过计算另一列
的
内容来创建新列
scala
、
apache-spark
、
apache-spark-sql
我有一个
Spark
RDD
(或Dataframe -转换成两者都不是问题),它有以下列(
每个
结构
的
示例):我想扩展这个
RDD
/DF,增加一个包含列表数组
大小
的
列。因此,输出应该是这样
的
(示例): org.apache.
spark
浏览 27
提问于2017-07-07
得票数 0
回答已采纳
1
回答
关于数据集中
的
kryo和java编码器
的
问题
apache-spark
、
apache-spark-dataset
、
kryo
、
apache-spark-encoders
我使用
的
是
Spark
2.4,指的是public class EmployeeBean implements Serializable { private有用
的
部分-2 LocalTableScan [value
的
大小
不应该小于Java序列化
RDD
,而不是双倍<
浏览 1
提问于2019-01-04
得票数 2
回答已采纳
1
回答
将
rdd
的
每个
元素保存在文本文件hdfs中
apache-spark
、
hdfs
、
rdd
我正在使用
spark
应用程序。在
rdd
的
每个
元素中都包含大量
的
数据。我想将
rdd
的
每个
元素分别保存到多个hdfs文件中。我尝试了
rdd
.saveAsTextFile("foo.txt"),但我将为整个
rdd
创建一个文件。
rdd
大小
是10。我想要10个hdfs格式
的
文件。我
如何
才能做到这一点??
浏览 0
提问于2017-10-11
得票数 1
1
回答
写入
时对数据进行分区
的
自定义文件格式
apache-spark
您好,我想将我
的
spark
数据帧保存到一个具有自定义文件格式
的
文件中,以便它在
写入
文件时将数据分区到不同
的
文件中。此外,我需要为
每个
分区关键字
的
单一部分文件。我已经尝试扩展TextBasedFileFormat和change writer来满足我
的
需求。在没有随机
写入
文件
的
情况下对数据进行分区。但我觉得
每个
rdd
分区都会将数据
写入
不同
的
部分文件
浏览 16
提问于2019-05-29
得票数 0
回答已采纳
1
回答
对少于N个分区
的
N个文件
的
磁盘进行
spark
写入
apache-spark
、
partition
我们可以写数据到100个文件,
每个
文件有10个分区吗? 我知道我们可以使用repartition或coalesce来减少分区数量。但我看到一些hadoop生成
的
avro数据
的
分区数量远远超过了文件数量。
浏览 11
提问于2018-01-08
得票数 8
回答已采纳
1
回答
在pyspark中使用foreachRDD和foreach遍历
rdd
python
、
apache-spark
、
pyspark
OS", "some_other_property": "value", "row_key": 555}(rowkey, [rowkey, column-family, key, value]) 正如您从输入格式中看到
的
,我必须获取原始数据集
并
迭代所
浏览 2
提问于2016-05-28
得票数 1
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
即时通信 IM
云直播
活动推荐
运营活动
广告
关闭
领券