有人能用简单的语言解释一下CoGroupedRDD是做什么的吗?下面的代码在两个RDDs之间进行连接。at leftOuterJoin at <console>:66 [] | CoGroupedRDDleftOuterJoin at <console>:58 []
| | MapPartitionsRDD[16] at leftOuterJoin at &
我的星火作业是在一个小的事务数据集和一个大型事件数据集之间进行关联。我想根据时间和ID (事件时间和事务时间、ID和ID)将每个事务与最近的事件匹配。CacheManager.scala:69) at org.apache.spark.rdd.CoGroupedRDD$$anonfun$compute$2.apply(CoGroupedRDD.scala:140)
at org.apache.spark.rdd.<