我希望以累积的方式连接数据帧中列中的值。但是,该列将根据另一列中的值进行分区/分组。df['Col_to_cum_Concat']=[y.CUM_CONCAT_TOP.tolist()[:z+1] for x, y in df.groupby('Group_Col')for z in range(len(y))]从最后一排到第一排有更简单
我正在使用pandasUDF将标准的ML python库应用于pysparkDataFrame。在定义了模式并进行了预测之后,我得到了pyspark DF作为输出。现在,我想用这个预测数据帧做一些事情,例如,我尝试对列"weekly_forecast_1“中的所有值进行求和。many indices for array:array is 0-dimensional, but 1 were indexed 每当我尝试将.collect()或.toPandas()方法应用于整个DataFr