从Spark 2.4.0开始,可以在没有外部jars的情况下保存为AVRO。然而,我根本不能让它工作。: 'Failed to find data source: avro.Avro is built-in but external data source module since Spark 2.4.我查看了Apache Avro Data Source Guide (),它给出了以下示例:
df=spark.read.f
我正在尝试读取avro文件,该文件以二进制(Base64)编码,在avro文件上的snappy压缩Hadoop如下所示:binaryFilesRDD: org.apache.spark.rdd.RDD[Array[Byte]] = MapPartitionsRDD[1] at map at def getGenericRecordfrom
`file-path'")val sqlDF = spark.sql("SELECT DISTINCT Source_Product_Classification FROM avro.org.apache.spark.sql.AnalysisException: Failed to find data source: <
我使用的是com.databricks.spark.avro。当我在spark-shell中运行它时,就像这样:spark-shell --jar spark-avro_2.11-4.0.0.jar,我可以通过这样的方式读取文件:java.lang.ClassNotFoundException: Fai
我在谷歌DataProc上有一个集群(图1.4),我想用Spark从谷歌云存储中读取avro文件。我遵循这个指南:Spark read avro。='org.apache.spark:spark-avro_2.12:2.4.1' test.py非常简单,只是 from pyspark.sql import SparkSession
from pyspark.sql$init$(Lorg/apache