下一步是使用databricks加载程序将一个avro文件转换为某个(只有python库可以找到)。现在让我解释一下我是如何做到的,这样您就可以看到我可能失败的地方了:我的目标是将json数据从本地目录推送到HDFS,这样我就可以使用pySpark由于json对HDFS的压缩很差,所以我还使用以下flume.conf将每个文件转换为avro:
a
尝试从HDFS目录处理每个JSON文件并写入HDFS目录。这里我使用Scala并行集合par。我正在尝试下面的代码来读取JSON文件。= path of hdfs directory val dataFrame = spark.read.json(readJSON.toSeq.toDS)
dataFrame.coal