我首先使用Glue爬虫抓取数据以创建数据目录。然后,使用该目录,我创建了一个外部模式来引用Glue数据库,这样我就可以访问该目录。现在我可以对根级别的字符串执行select语句了,它的工作方式是Ex:问题是,当我在结构对象上执行select语句时,我得到了这个错误“下面是一个select示例(id是执行元结构中的一个字符串):
select t.actor.name from g
在今天的EMR中,我有由S3中的Parquet支持的Hive外部表,我还有其他视图,比如create view hive_view as select col from external_table wherecol = x
然后在EMR上的Spark中,我可以发布像df = spark.sql("select * from hive_view")这样的语句来引用我的Hive视图。我知道我可以使用Glue目录作为蜂巢转移的替代物,但我正在尝试将火花作
我在EMR上有Spark作业,并且EMR被配置为对Hive和Spark元数据使用Glue目录。我创建了Hive外部表,它们出现在Glue目录中,我的Spark作业可以在Spark SQL中引用它们,比如spark.sql("select * from hive_table ...")现在,当我尝试在Glue作业中运行相同的代码时,它失败了,并出现"table not f