腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(8841)
视频
沙龙
1
回答
如何
从
Spark
Streaming
脚本
写入
HDFS
apache-spark
、
spark-streaming
我正在执行一个
Spark
Streaming
应用程序,我想将一些结果转储到
HDFS
中,这些结果不是RDD形式的,它们是简单的字符串。那么,我
如何
将这些数据转储到
HDFS
,如果有一种方法可以将这些数据附加到文件中,这将非常有帮助。
浏览 20
提问于2017-07-19
得票数 0
2
回答
Spark
连接Hive到
HDFS
vs
Spark
直接连接
HDFS
,Hive在上面吗?
apache-spark
、
hadoop
、
hive
、
hdfs
、
connector
问题摘要:当然,我希望使用配置单元上下文将数据馈送到
HDFS
。我们可以直接将数据
写入
HDFS
,这要归功于
spark
streamin
浏览 0
提问于2019-06-19
得票数 1
4
回答
来自Kafka的
Spark
流,并以Avro格式
写入
HDFS
scala
、
apache-spark
、
hdfs
、
spark-streaming
、
avro
我基本上是想使用Kafka中的数据,并将其
写入
HDFS
。但是发生的情况是,它没有在
hdfs
中
写入
任何文件。它会创建空文件。import org.apache.
spark
.
streaming
.Seconds import org.apache.
spa
浏览 4
提问于2017-10-08
得票数 0
1
回答
将
HDFS
数据流式传输到Storm (也称为
HDFS
spout)
hadoop
、
hdfs
、
apache-storm
我想知道是否有任何spout实现将数据
从
HDFS
流式传输到Storm (类似于
HDFS
的
Spark
streaming
)。我知道有用于将数据
写入
HDFS
(和)的螺栓实现,但反过来我却找不到。
浏览 0
提问于2015-05-14
得票数 3
2
回答
结构化流传输将Parquet文件
写入
Hadoop
apache-spark
、
spark-structured-streaming
我能够将结构化流式传输的结果
写入
到拼图文件中。问题是这些文件在本地文件系统中,现在我想将它们
写入
Hadoop文件系统。有没有办法做到这一点?$.read(StreamMetadata.scala:51)at org.apache.
spark
.sql.
streaming
.StreamingQ
浏览 9
提问于2017-03-01
得票数 1
回答已采纳
2
回答
如何
使用scala使用
spark
streaming
从
HBASE表中获取数据
scala
、
apache-spark
、
hbase
、
spark-streaming
我正在尝试确定一种解决方案,使用火花流
从
HBASE表中读取数据,并将数据
写入
另一个HBASE表。例如,如果我有一个HBASE表'SAMPLE‘,它的列是'name’和'activeStatus‘。
如何
使用
spark
streaming
从
基于activeSta
浏览 0
提问于2018-12-11
得票数 0
1
回答
如何
从
Kafka中读取JSON数据,并使用
Spark
结构流存储到
HDFS
?
apache-spark
、
apache-kafka
、
spark-structured-streaming
我正在尝试
从
Kafka读取JSON消息,并使用
spark
structured将它们存储在
HDFS
中。/path").start(/data")这些行按预期持续
写入
,但以二进制格式
写入
。我有一个小文件
写入
hdfs
,其中有多个空的json行- {} 很快,作业就会失败,但会出现以下
浏览 43
提问于2018-07-25
得票数 1
1
回答
Spark
Streaming
:通过从一个HDFSdir读取到另一个来将数据
写入
到
HDFS
scala
、
apache-spark
、
hadoop
、
hdfs
我正在尝试使用火花流将数据从一个
HDFS
位置读取到另一个
HDFS
位置 下面是我在
spark
-shell上的代码片段 但是我看不到在
HDFS
输出目录上创建的文件,您能否指出
如何
在
HDFS
上加载这些文件scala> sc.stop() scala> import org.apache.
spark
.
streaming
scala&g
浏览 12
提问于2018-12-21
得票数 1
回答已采纳
1
回答
Spark
Streaming
清理RDD检查点目录
apache-spark
、
hdfs
、
spark-streaming
我们有来自kafka的
spark
streaming
在
HDFS
服务器中创建检查点,但它没有得到清理,现在我们在
HDFS
中有数百万个检查点。有没有办法
从
spark
中自动清除它?
Spark
版本1.6
HDFS
2.70
浏览 8
提问于2017-07-19
得票数 3
回答已采纳
1
回答
火花
写入
数据给vertica带来错误
scala
、
apache-spark
、
vertica
、
connector
在加载所需的库之后,dataframe将被
写入
表中。现在,当我试图在Intellij中执行相同的精确代码时,或者没有直接
从
火花外壳编写代码时,它会出现一些错误:val rows: RDD[Row] = sc.parallelize(Array" -> "
hdfs
://localhost:9000/user", "web_
hdfs
_url" -> "webhdfs://localh
浏览 4
提问于2020-04-26
得票数 1
回答已采纳
1
回答
在
spark
streaming
程序中建立线程池
apache-spark
、
streaming
为了避免延迟和加快进程,我在
spark
流中构建了线程池。client, confs))esThread的功能是首先查询elasticsearch,然后得到ES的查询结果,最后将查询结果
写入
到
HDFS
中。但是我们发现
HDFS
中的结果文件缺少很多数据,这就有点留下来了。我想知道我们可以在
spark
streaming
中构建线程池。
spark
streaming
中的线程池是否会导致
浏览 0
提问于2017-11-12
得票数 1
1
回答
删除
spark
-structured-
streaming
写入
的损坏拼接文件时会丢失数据吗?
scala
、
apache-kafka
、
parquet
、
spark-structured-streaming
我使用
spark
-structured-
streaming
作为消费者
从
kafka获取数据,按照指南参考https://
spark
.apache.org/docs/latest/structured-
streaming
-kafka-integration.html然后将数据保存到
hdfs
作为拼图文件。我知道
spark
-structured-
streaming
使用检查点进行恢复,但由于一些数据已经写为拼图,
浏览 20
提问于2019-05-25
得票数 0
1
回答
如何
在
写入
HDFS
- hive时控制
Spark
streaming
中的行数和/或输出文件大小?
scala
、
apache-spark
、
hadoop
、
apache-kafka
、
spark-streaming
使用
spark
streaming
从
Kafka读取和处理消息,并将消息
写入
HDFS
- Hive。
浏览 0
提问于2018-05-08
得票数 1
2
回答
为什么Google Dataproc
HDFS
名称节点在Safemode中?
hdfs
、
google-cloud-storage
、
google-cloud-platform
、
google-cloud-dataproc
我试图通过向Dataproc集群提交一个
Spark
作业来
写入
hdfs
:///home/bryan/test_file/上的
HDFS
目录。org.apache.h
浏览 7
提问于2015-10-01
得票数 3
1
回答
Spark
Streaming
应用应在连续批量失败后停止
apache-spark
、
spark-streaming
我有一个带有
Spark
2.3.1的DStream流媒体应用程序。其中我正在从Kafka读取数据并
写入
Kerberized
HDFS
,但随机地我的批处理开始失败,同时
写入
HDFS
并异常显示kerberos相关的错误,但我的
spark
应用程序继续运行,所以我不知道我的批处理失败例如:
spark
.
streaming
.xyz = 3,则应用程序应在连续3个微批处理失败后停止。
浏览 16
提问于2019-04-12
得票数 0
2
回答
如何
停止
Spark
Structured填充
HDFS
apache-spark
、
hdfs
、
amazon-emr
、
spark-structured-streaming
我有一个在AWS EMR上运行的
Spark
Structured
Streaming
任务,它本质上是在一分钟的时间窗口内连接两个输入流。输入流有1分钟的水印。我不做任何聚合。我想运行很长一段时间,也就是“永远”,但不幸的是,
Spark
慢慢地填满了我集群上的
HDFS
存储,并最终因此而死亡。 似乎有两种类型的数据会累积。登录/var和.delta,在/mnt/tmp/...我试着添加 --conf
spark
.
streaming
.ui.retained
浏览 26
提问于2019-03-13
得票数 0
1
回答
Flume+
Spark
-在
HDFS
中存储DStream
apache-spark
、
spark-streaming
、
flume
我有水槽流,我想把它存储在
HDFS
通过火花。)}[root@sandbox ~]# hadoop fs -cat /user/root/
spark
/flume_Maporg.apache.
spark
.
streaming
.flume.SparkFlumeEvent@f9ed85f!!!!org.apache.
spark
.
streaming
.f
浏览 3
提问于2016-04-01
得票数 2
回答已采纳
1
回答
检查点在
spark
流中不起作用
apache-spark
、
spark-streaming
、
checkpoint
我们将数据文件放在
HDFS
路径中,该路径由
spark
streaming
应用程序监控。以及
spark
streaming
应用程序向kafka topic发送数据。我们正在中间停止流应用程序?,然后再次启动,以便它应该
从
停止的位置开始。但是它正在重新处理整个输入数据文件。所以我猜检查点没有被正确使用。我们使用的是
spark
1.4.1版本,
如何
才能使流媒体应用程序
从
失败/停止的位置启动?
浏览 1
提问于2015-12-23
得票数 0
1
回答
火花错误: I/O错误构建远程块读取器。java.nio.channels.ClosedByInterruptException at java.nio.channels.ClosedByInterruptException
java
、
apache-spark
、
spark-streaming
、
spark-structured-streaming
:48) at org.apache.
spark
.sql.execution.
streaming
.HDFSMetadataLog.(StreamExecution.scala:69) at org.apache.
spark
.sql.execution.
streaming<
浏览 5
提问于2021-11-29
得票数 0
回答已采纳
1
回答
当接收器失败并将WAL存储在s3中时,火花流无法读取预写日志记录中的数据
spark-streaming
、
wal
FileBasedWriteAheadLogSegment(s3n://*****/checkpoint/receivedData/20/log-1439298698600-1439298758600,13678,5069):无法读取预先
写入
日志记录中的数据,org.apache.
spark
.
streaming
.rdd.WriteAheadLogBackedBlockRDD.org$apache$
spark
$
streaming
$rdd$Write
浏览 2
提问于2015-08-12
得票数 1
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
即时通信 IM
云直播
活动推荐
运营活动
广告
关闭
领券