腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(2420)
视频
沙龙
1
回答
spark
流
状态
是否
跨
分区
同步
spark-streaming
mapWithState更新接收到的每个密钥的
状态
。当执行器并行运行时,这是如何工作的?Dstream rdd中的键
是否
只有一个
状态
,或者每个
分区
都有一个
状态
?
浏览 9
提问于2018-08-12
得票数 0
1
回答
如何为结构化查询的不同代码部分指定
分区
数?
apache-spark
、
apache-spark-sql
我有一个
Spark
流
,类似于: .join(anotherDataFrame, columns) .save() 在join步骤中,我希望
spark
.sql.adaptive.enabled是true,因为这将加快连接的速度。在repartition步骤中,我希望
spark
.sql.adaptive.enabled是false,因为如果是真的,它可能会更改
分区
,保存的结果将被格式化为错误的
分区
。如
浏览 0
提问于2019-01-28
得票数 2
2
回答
如何使用RDD在
分区
内排序(并避免
跨
分区
排序)?
apache-spark
Hadoop MapReduce洗牌的默认行为是在
分区
内对混叠键进行排序,而不是
跨
分区
排序(使键
跨
分区
排序的是总顺序)。我会问如何使用
Spark
(
分区
内排序,但不是
跨
分区
排序)实现相同的目标。RDD的sortByKey方法是进行全排序 RDD的repartitionAndSortWithinPartitions是在
分区
内进行排序,而不是
跨
分区
,但不幸的是,它增加了一个额外的步
浏览 3
提问于2017-04-11
得票数 15
回答已采纳
1
回答
我们可以在批处理模式下使用flatMapGroupsWithState吗?
apache-spark
我们一直在使用flatMapGroupsWithState应用程序接口对点击
流
数据进行会话。现在我们计划使用它在批处理模式下运行。有关更多背景信息,请查看在youtube 上发布的视频 我们可以去掉full-outer连接并使用带有checkpoint folder和
Spark
State的mapGroupWithState吗
浏览 1
提问于2021-01-08
得票数 2
1
回答
卡夫卡星火
流
的窗口操作
window
、
apache-kafka
、
spark-streaming
我试图探索从卡夫卡的火花
流
作为来源。根据这个,createDirectStream在kafka
分区
和
Spark
之间具有1:1的并行性。这意味着,如果有一个有3个
分区
的Kafka主题,那么3个火花执行器将并行运行,每个都读取一个
分区
。 假设在读取数据后有一个窗口操作。窗口操作是
跨
分区
还是在一个
分区
内应用窗口,例如,我的批处理间隔为10s,窗口间隔为50。窗口
是否
为
跨
分区
的50多个数据
浏览 3
提问于2017-06-21
得票数 1
1
回答
火花
流
数据
流
执行,有
状态
,
分区
本地groupBy,避免洗牌
dataframe
、
apache-spark
、
spark-streaming
我有一个基于
Spark
2.4.2& Kafka的
流
应用程序,它将聚合(时间窗口‘’ed)
流
写回Kafka:问题是,在没有洗牌的情况下,实现这一目标
浏览 2
提问于2020-03-13
得票数 0
1
回答
理解星火结构
流
并行性
apache-spark
、
apache-spark-sql
、
spark-structured-streaming
当使用由Kafka提供的
Spark
结构化
流
源时,并行性是如何发生的?,数据集的
分区
数是基于
spark
.sql.shuffle.partitions参数的。例如,
spark
.sql.shuffle.partitions=5和Batch1=100行,我们最终会有5个
分区
,每个
分区
有20行吗?考虑到所提供的代码片段,我们
是否
仍然利用由于groupByKey后面跟着一个mapGroups/mapGroupsWithState函数而产生的火花并行?因此
浏览 3
提问于2018-01-13
得票数 8
回答已采纳
1
回答
记录的
Spark
流
比较
apache-spark
、
spark-streaming
、
spark-structured-streaming
如何将接收到的记录与
spark
结构
流
中相同key的前一条记录进行比较。使用groupByKey和mapGroupWithState可以做到这一点吗?groupByKey(user)//
Spark
权威指南中的示例代码当我们执行上面的操作时,还有一个问题,我认为记录的顺序不会被维护,因为接收到记录,它将
跨
工作节点进行
分区
和存储,当我们应用groupBy
浏览 0
提问于2018-05-09
得票数 0
1
回答
火花流在窗口上维护
状态
java
、
apache-spark
、
spark-streaming
对于
spark
streaming,有没有方法可以让我们只维护当前窗口的
状态
?我知道updateStateByKey是工作的,但它会永远保持这种
状态
,除非我们将其清除。
是否
可以存储和重置每个窗口的
状态
?对象%1要么是调用,要么是响应。但是,由于对象的响应可能在单独的批处理中,因此我需要
跨
批处理维护
状态
。 但我只希望保持当前窗口的
状态
。有没
浏览 0
提问于2018-03-01
得票数 0
1
回答
是否
有一种方法可以控制星型
分区
在集群中的节点之间的分布?
apache-spark
、
pyspark
我有一个8节点集群,我从jdbc源加载了两个数据文件,如下所示: url=connStr, numPartitions=128*3, ) varDatesDf =
spark
.read.jdbc但是,我不知道它们是如何
跨
节点分布的。理想情况下,这两个数据文件都是以这样的方式分发的,即连
浏览 2
提问于2016-11-16
得票数 1
2
回答
外部配置单元表刷新表与MSCK修复
apache-spark
、
hive
、
hivecontext
、
hive-partitions
我有一个外部蜂窝表,存储为Parquet,
分区
在一个列上,比如as_of_dt,数据通过
spark
streaming插入。现在,每天都会添加新的
分区
。我正在执行msck repair table,以便配置单元元存储获得新添加的
分区
信息。这是唯一的办法,还是有更好的办法?我担心如果下游用户查询表,msck repair
是否
会导致数据不可用或数据陈旧的问题?我正在浏览HiveContext应用程序接口并查看refreshTable选项。你知道用refreshTable代替它
是否
有意义吗?
浏览 8
提问于2018-08-07
得票数 13
1
回答
Kafka处理器API:源和StateStore的不同密钥?
apache-kafka
、
apache-kafka-streams
我们的第一种方法是创建一个具有连接
状态
存储的处理器,它使用相关ID作为密钥存储每个传入消息。国家密钥
状态
值但现在我们想知道卡夫卡
流
是如何处理不同的钥匙。我们正在使用Microservice方法,并且将有多个运行该服务的实例。存储自动由内部主题支持。源主题和
状态
主题的
分区
浏览 1
提问于2018-04-18
得票数 7
回答已采纳
1
回答
Azure事件中心
同步
机制
.net
、
azure
、
azureservicebus
、
azure-eventhub
根据示例,在Azure Event Hub客户端中有一个
同步
发送事件的"Send“方法,但在接收端
是否
有
同步
的东西。 要实现接收器,我们必须使用事件处理器Host类,但所有寄存器事件都是异步的。如何
同步
触发接收器?
浏览 2
提问于2018-04-15
得票数 1
1
回答
分区
是如何在星火
流
中工作的?
scala
、
apache-spark
、
spark-streaming
、
rdd
、
spark-streaming-kafka
我正在致力于提高火花
流
应用程序的性能。
分区
是如何在
流
环境中工作的。
是否
与将文件加载到
spark
中相同,还是一直以来它只创建一个
分区
,使其只在执行器的一个核心中工作?
浏览 0
提问于2019-09-15
得票数 4
回答已采纳
2
回答
Spark
mapWithState将所有数据混洗到一个节点
scala
、
apache-spark
、
spark-streaming
我正在从事一个Scala (2.11) /
Spark
(1.6.1)
流
项目,并使用mapWithState()来跟踪以前批次中看到的数据。该
状态
被分成20个
分区
,由StateSpec.function(trackStateFunc _).numPartitions(20)创建。我曾希望将
状态
分布在整个集群中,但似乎每个节点都拥有完整的
状态
,并且始终只执行一个节点的执行。 然后,我向Kafka写入,
分区
再次分布在集群中。我似乎找不到为什么mapWithSta
浏览 0
提问于2016-03-22
得票数 6
1
回答
spark
structured Delta streaming情况下的下推过滤器
apache-spark
、
delta-lake
我有一个用例,我们需要将Open Source Delta表流式传输到多个查询中,并对其中一个
分区
列进行过滤。例如,.给定的增量表在年份列上
分区
。Streaming query 1where("year= 2013")
spark
.readStream.format("
浏览 0
提问于2021-02-24
得票数 1
1
回答
从rdbms数据库加载数据的方法应该是什么?
scala
、
apache-spark
、
apache-spark-sql
、
rdbms
我对
Spark
2.4还很陌生,并试图找出将格林梅利/PostgreSQL中的数据带到
Spark
的最佳方法。最好是使用联接查询从RDBMS加载数据,还是使用
分区
按DB列单独加载表,然后使用
spark
联接? .option("url&q
浏览 0
提问于2019-12-06
得票数 0
回答已采纳
2
回答
在Cassandra中查询,它将按特定字段对整个表进行排序。
cassandra
、
cql
、
cqlsh
PRIMARY KEY((category), name)我想要编写一个查询,它将根据名称对整个表进行排序,而不仅仅是每个
分区
我在StackOverflow站点中读到了其他答案,一些例子使用一个id (桶)创建了一个
分区
,这是主键,但我不想这样做,因为我想让数据按类别分布在各个节点上。
浏览 6
提问于2015-12-13
得票数 3
回答已采纳
2
回答
在星火库上列出特定单元表的所有
分区
,并添加一个
分区
apache-spark
、
hive
如果是这样的话,我可以直接使用
spark
sc.textFile("file.orc")增量地更新这些文件。如何向hive表中添加新的
分区
?有什么api的蜂巢亚稳态,我可以使用火花?
spark
正在将所有文件放在$HIVE/my_table下而不是$HIVE/my_table/month/...下,这意味着他没有对数据进行
分区
。我使用
spark
.table("my_table")加载数据,这意味着延迟加载表,这是一个问题,因为我
浏览 2
提问于2016-10-26
得票数 6
回答已采纳
1
回答
为什么RDDs不适合流任务?
apache-spark
、
rdd
我正在广泛地使用
Spark
,
Spark
的核心是RDD,正如RDD论文所示,在
流
应用程序方面也有局限性。这是RDD文件的准确引文。在这些情况下,RDDs可以高效地将每个转换记为谱系图中的一个步骤,并且可以恢复丢失的
分区
,而不必记录大量数据。RDDs不太适合于对共享
状态
进行异步细粒度更新的应用程序,例如web应用程序的存储系统或增量web爬虫。 我不太明白为什么RDD不能有效地管理
状态
。星火
流
如何克服这些限制?
浏览 2
提问于2016-03-06
得票数 2
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
即时通信 IM
云直播
活动推荐
运营活动
广告
关闭
领券