腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
1
回答
如何
跨
分区
运行
聚合
azure-cosmosdb
当我在门户中
运行
这样的查询时,它
运行
得很好。但是当我从python SDK
运行
它时,我得到了“
跨
分区
查询只支持
聚合
的'VALUE‘”。我想在所有
分区
上
运行
它。有什么建议可以从SDK中让它工作吗?
浏览 4
提问于2020-06-04
得票数 0
1
回答
Flink
如何
扩展热
分区
?
join
、
streaming
、
apache-flink
、
flink-streaming
如果我有一个用例,我需要连接两个流或
聚合
来自单个流的某种指标,并且我使用键控流对事件进行
分区
,那么对于数据可能无法放入内存并需要
跨
分区
拆分的热
分区
,Flink
如何
处理这些操作?
浏览 17
提问于2021-02-19
得票数 0
回答已采纳
2
回答
星火中的ReduceByKey和parititionBy
apache-spark
在学习火花书中,他们写: 对于reduceByKey(),首先在每个执行器上使用提供的关联约简函数本地
聚合
相同键的元素,然后最终
跨
执行器
聚合
。那么,为什么一本书会建议预
分区
,如果reduceByKey()将首先
聚合</
浏览 0
提问于2018-09-30
得票数 2
回答已采纳
1
回答
DocumentDb交叉
分区
查询策略
azure-cosmosdb
在这篇文章的基础上,我有一个战略问题: 或我们目前已经实施了"A“,但已经讨论了"B”,因为这篇文章中有这样的引语: 拥有一个具有许多不同值的
分区
键是一种最佳实践我们的CustomerIds不
浏览 3
提问于2017-08-08
得票数 2
1
回答
在Kafka Streams中
聚合
多个
分区
apache-kafka
、
apache-kafka-streams
在某种程度上,这是的后续(Bob,3)在
分区
1上(Bob,2)在
分区
我想要
聚合
所有
分区
上的值(在本例中,只是一个简单的总和),以得到如下所示的KTable:(鲍勃,5岁) 正如我在上面链接的问题的答案中提到的,直接进行这种
跨
分区
聚合
是不可能的。
如何
浏览 41
提问于2018-06-04
得票数 6
回答已采纳
1
回答
Spark Shuffle之所以发生,是因为Spark需要
跨
阶段传输数据
apache-spark
Spark文档:在spark中,数据通常不会
跨
分区
分布到特定操作所需的位置。在计算期间,单个任务将在单个
分区
上操作-因此,要组织单个reduceByKey reduce任务执行的所有数据,Spark需要执行all- to -all操作。它必须从所有
分区
中读取以找到所有键的所有值,然后将
跨
分区
的值
聚合
在一起,以计算每个键的最终结果-这称为无序排列。spark document:“这通常涉及到
跨
执行器和机器复制数据,使混洗成为一项复杂且成本高昂的操作。”
浏览 1
提问于2020-06-04
得票数 0
1
回答
如何
将Kafka
分区
与Spark executors分开并行处理?
apache-spark
、
apache-spark-sql
、
spark-structured-streaming
、
apache-spark-standalone
我使用结构化流媒体从2个Kafka
分区
读取消息。我正在向Spark独立集群提交我的申请,该集群有一个worker和2个executors (每个2个内核)。from OrderRecords group by WINDOW(order_time, "1
浏览 1
提问于2017-06-02
得票数 1
1
回答
跨
分区
键的多个
聚合
仅适用于Web Base Azure数据资源管理器,而不适用于Python客户端库
python-3.x
、
azure
、
azure-cosmosdb
、
azure-cosmosdb-sqlapi
使用基于web的数据浏览器,我能够成功地
运行
跨
多个
分区
具有多个
聚合
的查询。然而,当我试图从我的shell中使用Azure client library for Python (pip install azure-cosmos==4.0.0)
运行
这样的查询时,我得到了一条错误消息我尝试了两种不同的查询,一种包含
分区
键,另一种不包含
分区
键,两种查询都返回相同的错误消息。query1, enable_cross_partition_query=True) 返回错误消息: Co
浏览 0
提问于2020-06-10
得票数 0
1
回答
Cosmos db REST顺序通过
分区
azure
、
azure-cosmosdb
SELECT * FROM requests c ORDER BY c.timestamp “
跨
分区
查询是必需的,但已禁用。请将x documentdb- query -enablecross
分区
设置为true,指定x
浏览 0
提问于2018-05-08
得票数 2
回答已采纳
1
回答
我在理解星火LBFGS treeAggregate变换时遇到了一些问题
scala
、
apache-spark
、
apache-spark-mllib
、
non-linear-regression
最近我尝试在我的项目中使用spark方法,但是当我阅读源代码时,我确实遇到了一个大问题,这是代码:,这是源代码链接: 我的问题是:如果我的输入数据(标签、特征)只包含标签和特征向量,那么treeAggregate seqOp
如何
能够匹配
浏览 1
提问于2017-04-05
得票数 0
回答已采纳
1
回答
通过REST获取Cosmos DB集合的计数
azure
、
azure-cosmosdb
、
azure-cosmosdb-sqlapi
我正在尝试通过REST获取cosmos db集合中的记录数(我们将其用于我们的自动化框架)。对以下方法进行了尝试。获取传入响应的计数--我获取了‘Select’的结果,并试图获取返回集合的计数。但是,返回的最大记录只有1000条,这是默认的。因此,我尝试在标题中将x-ms-最大项计数作为一个很大的值(4000万),但即使db记录计数为2800万,仍然只能获得8k记录。 作为对上述方法的后续,有一个名为“x-ms-延续”的响应头,根据文档,如果有更多的记录要为shown..for,则可以在随后的请求中传递它,例
浏览 6
提问于2022-06-01
得票数 0
1
回答
为什么一个事件不应该与多个
聚合
有关?
event-sourcing
在我的经验中,人们常说在事件来源中“一个事件必须属于一个
聚合
”,而且“
聚合
是您最大的事务边界”。 type: "BoblesSent" from: 1, amount: 420它似乎可以被原子地记录下来,在重构一个
聚合
时高效地查询也可以是异构
聚合
体: type: "ActivityCreated", customer: 1,
浏览 0
提问于2019-05-29
得票数 0
2
回答
如何
在mongodbapi中不指定分片键的情况下执行查询,
如何
跨
分区
进行查询?
azure
、
azure-cosmosdb
、
azure-cosmosdb-mongoapi
如何
在mongodb api中不指定分片键的情况下执行查询,
如何
跨
分区
进行查询?无论我使用的是AsQueryable扩展语法还是
聚合
框架,查询都会不加区别地失败。
浏览 30
提问于2018-07-25
得票数 0
回答已采纳
1
回答
火花
聚合
法中的并发性
java
、
scala
、
concurrency
、
apache-spark
、
mapreduce
我是星火和地图减少的初学者,因为我理解星体
聚合
(ByKey)方法遵循地图减少模式,我希望有人帮助我确认它是否正确。 请纠正我,非常感谢。
浏览 5
提问于2016-01-12
得票数 0
回答已采纳
2
回答
如何
使用RDD在
分区
内排序(并避免
跨
分区
排序)?
apache-spark
Hadoop MapReduce洗牌的默认行为是在
分区
内对混叠键进行排序,而不是
跨
分区
排序(使键
跨
分区
排序的是总顺序)。我会问
如何
使用Spark (
分区
内排序,但不是
跨
分区
排序)实现相同的目标。RDD的sortByKey方法是进行全排序 RDD的repartitionAndSortWithinPartitions是在
分区
内进行排序,而不是
跨
分区
,但不幸的是,它增加了一个额外的步
浏览 3
提问于2017-04-11
得票数 15
回答已采纳
1
回答
如果键被更改,KStreams map()对输出主题
分区
的影响
apache-kafka
、
apache-kafka-streams
我是KStreams的新手,有一个关于在KStreams应用程序中重新
分区
的问题。这个输入主题的关键是假设is null。 我们想要标记是否有任何员工在一个月内请了超过10天的病假。然后,我们将这个KStream
聚合<
浏览 0
提问于2021-02-09
得票数 0
1
回答
Apache中的Keyby数据分发,逻辑还是物理操作符?
apache-flink
、
distributed-computing
、
flink-streaming
、
data-partitioning
根据Apache文档,KeyBy转换在逻辑上将流划分为不相交的
分区
。所有具有相同密钥的记录都分配给同一个
分区
。例如,假设我们从n个节点的Apache集群中获得分布式数据流。
运行
我们的流作业的Apache集群由m个节点组成。当keyBy转换应用于传入数据流时,它
如何
保证逻辑数据
分区
?还
浏览 1
提问于2020-10-05
得票数 4
回答已采纳
1
回答
如何
仅在星火流中的
分区
中“减少”,也许使用combineByKey?
scala
、
apache-spark
、
redis
、
spark-streaming
、
partitioning
我希望避免洗牌,让redis负责
跨
工作节点添加数据。
如何
才能在每个
分区
器上编写一个简单的字数减少,而不触发Scala中具有星火流的洗牌步骤? 注DStream对象缺少一些RDD方法,这些方法只能通过transform方法使用。例如,groupByKey()禁用映射端
聚合
,因为
聚合
函数(附加到列表)不会节省任何空间。更糟糕的是,据我所知,在星火流中没有为DStream RDDs设置
分区
器,所以我不知道
如何
向combineByKey提供一个不会导致数据混乱的
分区</
浏览 3
提问于2016-09-29
得票数 0
2
回答
OLAP多维数据集和
分区
ssas
、
olap
、
cube
、
olap-cube
、
ssas-2008
我已经创建了
分区
,并且处理变得很短--大约每10百万分钟就有4分钟。另外,我已经为所有
分区
创建了一个包含完整处理molap和100%
聚合
的
聚合
(多维数据集不是那么大)。是否有任何理由为每个
分区
创建
聚合
?当用户试图刷新基于olap多维数据集的枢轴表时,它会工作得更快吗? 谢谢。
浏览 6
提问于2015-12-17
得票数 0
回答已采纳
1
回答
无法理解aggregateByKey和combineByKey的工作
apache-spark
、
pyspark
目前,我正在尝试使用Python学习各种
聚合
。 为了给我所面临的问题提供一些背景,我发现很难理解aggregateByKey函数的工作原理,用"status“来计算订单数量。
浏览 1
提问于2016-02-02
得票数 3
回答已采纳
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
即时通信 IM
云直播
活动推荐
运营活动
广告
关闭
领券