我需要调一份如下所示的工作。import pyspark.sql.functions as F
measures = ["m1", "m2", "m3"]Write out summary table
aggregate.write.format("delta").mode("overwrite").save("o
我正在运行一个火花作业,其任务是扫描一个大文件并将其分割成较小的文件。这个文件是Json格式的,我试图用一个特定的列(id)来划分它,并将每个分区作为一个单独的文件保存到S3中。文件大小约为12 GB,但id有大约500000个不同的值。查询所用的时间几乎是15个小时。我能做些什么来提高性能呢?对于这样的任务来说,星火是一个糟糕的选择吗?import sys
from pyspark.context