pyspark是否支持窗口函数(例如first, last, lag, lead)?
例如,如何按一列分组并按另一列排序,然后按SparkSQL或数据框选择每个组的第一行(这就像窗口函数一样)?我发现pyspark.sql.functions类包含聚合函数first和last,但它们不能用于groupBy类。
在groupby之后,如何在数据帧上使用collect_set或collect_list。例如:df.groupby('key').collect_set('values')。我得到一个错误:AttributeError: 'GroupedData' object has no attribute 'collect_set'
我有一个包含事件的(Pyskem2.2.0),每个事件都有一个时间戳。还有一个额外的列包含一系列标记(A、B、C或Null)。我想计算每一行-按事件组,按时间戳排序-计算当前最长的非空标记更改范围的计数(Null应将此计数重置为0)。---> first non Null tag starts the count在Pyspark中,我可以定义如下所示的窗口:
window = Wi