腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
1
回答
Spark
SQL
-
无法
将
所有
记录
写入
配置
单元
表
java
、
apache-spark
、
apache-spark-sql
我是Apache
Spark
框架的新手,我正在使用ApacheSpark通过Hive
将
数据
写入
Hadoop。在下面的代码中,我从
配置
单元
读取table_1并创建数据集,然后将此数据集映射到另一个数据集。在
将
结果数据集保存到另一个table_2之后。<code>A0</code> 两个不同的
表
中的行数应该相同,但是result dataset/table_2中的行数不同。(或者我错过了一些关于
spark
的概念?
浏览 20
提问于2021-03-13
得票数 0
1
回答
在HDFS上
写入
数据需要很长时间
scala
在HDFS上
写入
文件创建多个零件文件(200)并花费很长时间 我正在
将
配置
单元
表
(使用SqlContext.
sql
)加载到数据帧1(6K
记录
)并注册到临时
表
。我
将
临时
表
与另一个
配置
单元
表
(500万条
记录
)连接在一起,并加载到dataframe 2中。我使用左外部连接更新dataframe 1和dataframe 2的值,并尝试
将
浏览 71
提问于2019-05-18
得票数 2
1
回答
将
dynamodb
表
复制到
配置
单元
的pyspark代码问题:不允许操作
hive
、
pyspark
、
amazon-dynamodb
、
amazon-emr
我正在尝试使用pyspark代码从aws emr上的Dynamodb创建一个外部
配置
单元
表
。当我在hive提示符上执行该查询时,它工作得很好,但当我将它作为pyspark作业执行时,它就失败了。代码如下:from pyspark.
sql
import SparkSession
spar
浏览 2
提问于2019-05-10
得票数 2
2
回答
外部
配置
单元
表
刷新
表
与MSCK修复
apache-spark
、
hive
、
hivecontext
、
hive-partitions
我有一个外部蜂窝
表
,存储为Parquet,分区在一个列上,比如as_of_dt,数据通过
spark
streaming插入。现在,每天都会添加新的分区。我正在执行msck repair table,以便
配置
单元
元存储获得新添加的分区信息。这是唯一的办法,还是有更好的办法?我担心如果下游用户查询
表
,msck repair是否会导致数据不可用或数据陈旧的问题?我正在浏览HiveContext应用程序接口并查看refreshTable选项。
浏览 8
提问于2018-08-07
得票数 13
2
回答
通过sparkSQL创建蜂窝
apache-spark
、
hive
、
apache-spark-sql
、
data-processing
我已经创建了一个临时
表
,该
表
在列关键字上存储桶。但是,当我通过另一个
表
手动
将
数据插入到这个
表
中时,我看到了以00000_*为前缀的文件。我不确定
spark
sql
是
浏览 1
提问于2018-08-02
得票数 5
1
回答
如何在
Spark
SQL
中使用快速压缩
将
数据
写入
hive
表
apache-spark
我有一个使用
配置
单元
命令创建的兽人
配置
单元
表
create table orc1(line string) stored as orcfile 我想写一些数据到这个
表
使用
spark
sql
,我使用以下代码._ Seq("Hello
Spark
", "Hello Hadoop").toDF("a").createOrReplaceTempView("tmp&q
浏览 44
提问于2019-03-02
得票数 1
1
回答
无法
在
Spark
SQL
中查看
配置
单元
记录
,但可以在
配置
单元
CLI上查看它们
scala
、
apache-spark
、
hive
、
apache-spark-sql
我
无法
在
Spark
SQL
中查看
配置
单元
记录
,但可以在
配置
单元
CLI上查看它们。在
配置
单元
CLI显示2条
记录
的情况下,使用
配置
单元
上下文的相同查询显示0hive> select ord_id from order;157434411Timetaken: 0.389 seconds, Fetched: 2 row(s)
浏览 2
提问于2018-01-11
得票数 0
1
回答
Spark
SQL
忽略动态分区筛选器值
apache-spark
、
apache-spark-sql
在这个查询中,我试图过滤到某个日期值(这是一个字符串数据类型),而
Spark
最终读取
所有
目录,而不仅仅是结果max(value)。
spark
.
sql
("select mypartitioncolumn, column1, column2 from mydatabase.mytable where mypartitioncolumn
spark
.
sql
("select mypartitioncolumn, column1, column2 from mydatabase.
浏览 29
提问于2019-02-21
得票数 2
3
回答
无法
从
配置
单元
查询`saveAsTable`之后的
Spark
DF -
Spark
SQL
特定格式,与
配置
单元
不兼容
scala
、
apache-spark
、
hadoop
、
hive
、
apache-spark-sql
我正在尝试
将
数据帧保存为外部
表
,该
表
将同时使用
spark
和可能的hive进行查询,但不知何故,我
无法
使用hive查询或查看任何数据。它在
spark
中工作。以下是如何重现该问题的方法:hivesc
浏览 3
提问于2019-08-02
得票数 0
1
回答
将
值插入到Row类型的Pyspark中的
配置
单元
表
python
、
hive
、
pyspark
、
hiveql
、
pyspark-sql
"count": "max"}).collect()[0] (returns Row(max(count)=Decimal('1.0000000000'))) reopen = hc.
sql
浏览 3
提问于2018-10-10
得票数 0
2
回答
当数据存储在对象存储中时,从
Spark
SQL
访问
配置
单元
表
apache-spark
、
hive
、
object-storage
我使用
spark
dataframe编写器
将
数据
写入
IBM Cloud Object Storage中的内部hive
表
,格式为parquet。因此,我的
配置
单元
元存储在HDP集群中,我正在从HDP集群运行
spark
作业。此
spark
作业
将
数据以parquet格式
写入
IBM COS。.config("hive.metastore.uris", "<thrift_url>&quo
浏览 40
提问于2018-12-18
得票数 0
1
回答
如何编写hive格式的结构化查询结果?
scala
、
apache-spark
、
hive
、
spark-structured-streaming
我正在尝试使用hive格式通过DataStreamWriter类
将
数据插入到
配置
单元
表
中。table", "Daily_summary_data") .start() org.apache.
spark
.
sql
.AnalysisException:
配置
单元
数据源只能用于
表
,不能直接
浏览 29
提问于2018-11-29
得票数 1
1
回答
当会话在
写入
过程中被终止时,
Spark
saveAsTable是否会回滚?
apache-spark
、
hive
、
hdfs
当使用saveAsTable附加到
配置
单元
托管
表
时,不完整的saveAsTable所做的工作是否会回滚,或者部分信息是否会保留?
浏览 0
提问于2018-05-24
得票数 3
1
回答
无法
使用pyspark
将
dataframe
写入
配置
单元
分区镶嵌
表
apache-spark-sql
、
pyspark-sql
、
parquet
我正在尝试将我的数据帧
写入
分区的hive
表
中,.Hive
表
的格式是parquet。 但我
无法
将
df写到Hive
表
中。我正在尝试将我的数据帧
写入
分区的hive
表
中,.Hive
表
的格式是parquet。 但我
无法
将
df写到Hive
表
中。
Spark
2.3和分区
配置
单元
表
当我试图
将
finaldf加载
浏览 28
提问于2019-05-27
得票数 0
2
回答
Spark
SQL
saveAsTable返回空结果
hadoop
、
apache-spark
、
hive
、
hdfs
、
apache-spark-sql
我使用以下代码在
Spark
SQL
中创建/插入数据到Hive
表
中: .builder() .master("local/
spark
-warehouse/tablename/下创建地块文件,并使用正确的create table语句在hive中创建
表
。/tablename' 'EXTERN
浏览 3
提问于2017-02-27
得票数 3
2
回答
为事务启用的
配置
单元
存储区
表
apache-spark
、
hive
、
transactional
、
orc
因此,我们尝试使用以下语句创建一个ORC格式的Hive
表
,并为事务设置存储桶并启用该
表
该
表
是在Hive中创建的,并且还反映在Metastore和
Spark
SQL
(我们已
配置
为
浏览 1
提问于2015-11-23
得票数 2
1
回答
将
配置
单元
表
卸载到。使用
Spark
或pyspark或python的dat文件
python
、
pyspark
、
apache-spark-sql
、
hiveql
我目前正在使用hql
将
数据从
配置
单元
表
卸载到文本文件中。因为它花费了太多的时间。我想去
spark
或pyspark.I。我是
spark
/ please的新手。你能帮我解决这个问题吗?
浏览 11
提问于2019-10-04
得票数 0
3
回答
如何在Hive内部
表
中插入
Spark
DataFrame?
scala
、
hive
、
apache-spark-sql
、
spark-dataframe
在附加模式下
将
DF插入到
配置
单元
内部
表
的正确方法是什么?似乎我们可以使用"saveAsTable“方法
将
DF直接
写入
配置
单元
,或者
将
DF存储到临时
表
中,然后使用查询。df.write().mode("append").saveAsTable("tableName")df.registerTempTable("temptable") sqlC
浏览 5
提问于2017-02-14
得票数 9
回答已采纳
1
回答
Spark
与Hive的差异与ANALYZE TABLE命令-
apache-spark
、
pyspark
、
apache-spark-sql
、
pyspark-sql
从
Spark
对Hive
表
运行的ANALYZE TABLE命令不会提供与从Hive发出的相同命令相同的性能改进。例如,我
将
一个数据帧插入到一个空的Hive
表
中: output.write.insertInto(“XXXXXXXX”) 然后运行analyze table命令:-
spark
.
sql
("ANALYZETABLE XXXXXXXX COMPUTE STATISTICS") 当我在Hive中做
记录
计数时,它非常慢: select count(*
浏览 261
提问于2019-01-05
得票数 2
回答已采纳
1
回答
不使用" Hive -site.xml“从
Spark
连接到
配置
单元
java
、
apache-spark
、
hadoop
、
hive
有没有办法不使用" Hive -site.xml“就从
Spark
连接到hive?sl.addAppArgs(appArgs); sl.addFile(evnProps.get(KEY_YARN_CONF_DIR) + "/hive-site.xml"); 我们
将
"
浏览 22
提问于2019-01-15
得票数 0
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
即时通信 IM
云直播
活动推荐
运营活动
广告
关闭
领券