我想在流应用程序中使用KLL sketch。问题是KLL草图是有状态的计算,因此不是幂等的。这是否可以使用在波束或Flink中实现,最好是在Python中?Apache Datasketch说是Integration efforts have started with Apache Flink and Apache Impala.There is also interest from Apache Beam。主要的困难是什么?大多数草图在内部使用原始类型和数组。
当前的波束管道正在使用FileIO.matchAll().continuously()以流的形式读取文件。这将返回PCollection。我想将这些具有相同名称的文件写回另一个gcs bucket,也就是说,每个PCollection都是一个文件metadata/readableFile,它应该在经过一些处理后写回另一个bucket。当操作一个窗口(即使它有多个元素)时,beam是否保证一个窗口要么被完全处理,要么根本不被处理,换句话说,对于给定的窗口,对GCS or bigquery的写操作是