腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
1
回答
在
Spark
SQL
查询
中
计算
派生
表
的
大小
apache-spark
、
apache-spark-sql
是否有可能在
Spark
SQL
查询
中
近似于
派生
表
的
大小
(
在
kb/mb/gb等格式
中
)?我不需要确切
的
大小
,但一个近似值就可以了,这将允许我通过确定
表
是否可以
在
连接中广播,或者
在
连接中使用筛选
的
子
查询
是否比使用整个
表
等来更好地计划
查询
。例如
浏览 34
提问于2020-09-09
得票数 0
2
回答
在
MS上,SparkSQL会比本机
SQL
过程具有更好
的
性能吗?
count
、
apache-spark-sql
、
ssas
、
distinct
、
mdx
这是一个一般性
的
问题。我们有一个基于
SQL
SERVER和SSAS (OLAP)
的
报表应用程序。我们从Store过程
中
运行MDX
查询
,
在
使用SSAS时存在一些明显
的
计数性能问题,目前我们没有“大”数据,需要7~8秒才能得到结果。但是,我们需要对未来进行规划,以避免issue
的
纵向扩展问题。我们不想将重hadoop系统引入到我们
的
应用
中
(可能在将来)。因此,我们正在考虑星火和SparkSQL。我们只需要90天
的
浏览 4
提问于2017-08-07
得票数 2
2
回答
火花结构流和过滤器
spark-streaming
星星之火2.1,结构化流与原始计数(*),和(字段)是工作正常之上
的
地板文件,但过滤不起作用。scala> :pasteuserSchema: org.apache.
spark
.
sql
.types.StructType = StructType(StructField(caseId,St
浏览 0
提问于2017-07-31
得票数 6
回答已采纳
1
回答
在
SparkSQL中加入
表
的
顺序以获得更好
的
性能
sql
、
hive
、
apache-spark-sql
、
sql-optimization
我是
Spark
-
SQL
刚开始阅读Hive
表
的人。我想知道星火如何执行多表 Join。我
在
某个地方读到,建议始终将最大
的
表
保留在联接顺序
的
顶部,以此类推,这有利于提高Join效率。我
在
Join中看到,
Spark
按顺序将第一个
表
(最大
的
)加载到内存
中
,并流另一个有助于Join性能
的
表
。但是,我对这种策略如何提高性能感到困惑,因为最大
的</em
浏览 6
提问于2020-06-20
得票数 4
1
回答
如何使用
Spark
SQL
作为内存数据库?
apache-spark
、
apache-spark-sql
我正在尝试理解
Spark
SQL
的
概念,想知道我是否可以使用
Spark
SQL
作为内存
中
的
数据库,类似于H2/SQLite?一旦我处理了100个文件
中
的
所有记录,我就可以将数据保存为表格格式,并且可以
查询
表
以获得结果,而不是搜索文件。这有什么意义吗?Dataset<Row> results =
spark
.
sql
("SELECT d
浏览 2
提问于2018-04-24
得票数 1
2
回答
Spark
似乎认为一个特定
的
广播变量很大
apache-spark
我正尝试
在
两个
表
上进行广播连接。较小
的
表
的
大小
将根据参数
的
不同而不同,但较大
的
表
的
大小
接近2TB。但是小桌子
的
大小
根本不应该这么大。我将较小
的
表
写到s3文件夹
中
,它只占用12.6MB
的
空间。我
在
较小
的
表
上做了一些操作,因此混洗
大小<
浏览 3
提问于2018-10-16
得票数 0
1
回答
在
查询
优化和总体效率方面,MySQL是否比Apache
spark
更高效
apache-spark
、
apache-spark-sql
我发现在
spark
数据帧上进行相同
的
查询
和相同
的
表
查询
时,Apache
spark
要比MySQL服务器慢得多。使用独立
的
pyspark笔记本
浏览 0
提问于2016-06-19
得票数 0
3
回答
如何在hive或impala中
计算
表
统计数据,以加快
Spark
中
的
查询
?
apache-spark
、
hive
、
apache-spark-sql
、
impala
为了提高性能(例如对于联接),建议首先
计算
表
静力学。
在
蜂巢里我能做到:
在
黑帕拉:我
的
spark
应用程序(从蜂窝
表
中
读取)是否也从预先
计算
的
统计数据
中
受益?我
在
Cloudera 5.5.4上使用
spa
浏览 6
提问于2016-09-22
得票数 11
1
回答
如何在sparkcontext.parallelize(.......).map()内部执行配置单元
查询
?
apache-spark
、
apache-spark-sql
此代码尝试
在
SparkContext runJob()方法中使用SparkSession从配置单元
表
执行配置单元
查询
。(ShuffleExchange.scala:261) at org.apache.
spark
.
sql
.executio
浏览 4
提问于2018-12-17
得票数 1
3
回答
在
Spark
中将多个小
表
与大
表
连接
的
最佳方法
scala
、
apache-spark
、
apache-spark-sql
我正在使用
spark
执行连接倍数表。其中一个
表
非常大,其他
表
很小(10-20个记录)。实际上,我想使用包含一对键值
的
其他
表
来替换最大
表
中
的
值。即大
表
:-------------------------------------- | A1 | B1 |我
的
问题是;,这是加入
表
的
最佳方式。(假设
浏览 1
提问于2018-02-13
得票数 3
1
回答
Spark
与Hive
的
差异与ANALYZE TABLE命令-
apache-spark
、
pyspark
、
apache-spark-sql
、
pyspark-sql
从
Spark
对Hive
表
运行
的
ANALYZE TABLE命令不会提供与从Hive发出
的
相同命令相同
的
性能改进。例如,我将一个数据帧插入到一个空
的
Hive
表
中
: output.write.insertInto(“XXXXXXXX”) 然后运行analyze table命令:-
spark
.
sql
("ANALYZETABLE XXXXXXXX COMPUTE STATISTICS") 当我
在<
浏览 261
提问于2019-01-05
得票数 2
回答已采纳
1
回答
df.SaveAsTable和
spark
.
sql
之间
的
差异(创建
表
.)
scala
、
apache-spark
、
hive
、
pyspark
、
apache-spark-sql
);
spark
.
sql
("create table mytable as select * frommy_temp_table"); 在这种情况下,
表
存储在内存
中
,在这种情况下物理存储
在
磁盘上?而且,根据我
的
理解,createOrReplaceTempView只注册数据(已经在内存中了)才能通过Hive<em
浏览 1
提问于2019-04-15
得票数 10
回答已采纳
1
回答
Spark
从MSSQL读取所有
表
,然后应用
SQL
查询
sql-server
、
apache-spark
、
sql-server-2008
、
apache-spark-sql
我已经安装了
Spark
3集群。我
在
SQL
server中有一些数据,其
大小
约为100 GB。我必须对星团
中
的
数据执行不同
的
查询
。我已经通过JDBC从
Spark
连接到
SQL
服务器,并运行了一个示例
查询
。现在,我不想在
SQL
服务器上执行
查询
,而是
在
将数据移动/复制到
Spark
集群之后运行
查询
(因为<em
浏览 6
提问于2022-01-06
得票数 0
1
回答
与JDBC一起使用SparkSession.
sql
()
mysql
、
scala
、
apache-spark
、
jdbc
此
查询
的
目标是优化工作人员
的
内存分配,因为我不能使用: .format("jdbc")[info] at org.apache.
spark
.
sql
.catalyst.analysis.package(Analyzer.scala:459)
浏览 2
提问于2018-04-20
得票数 0
回答已采纳
2
回答
Apache火花简单连接会导致密码错误。
java
、
apache-spark
、
cassandra
我有两个数据集,可以单独
查询
和显示()。一张有17张唱片,另一张有3张。") .load(); Dataset<Row> joined = attReader.joinattReader.col("key_field").equalTo(surReader.col("key_field")), "inner"); j
浏览 0
提问于2018-10-08
得票数 0
回答已采纳
1
回答
在
Spark
SQL
中
查找
表
大小
( MB/GB)
sql
、
apache-spark-sql
、
query-performance
、
aws-glue
我正在尝试理解
Spark
-
Sql
中
的
各种连接类型和策略,我希望能够了解一种近似
表
大小
(参与连接、聚合等)
的
方法,以便通过了解幕后实际发生
的
事情来估计/调整预期
的
执行时间,以帮助我选择最适合该场景
的
连接策略(
在
Spark
-
SQL
中
通过提示等)。当然,
表
行计数提供了一个很好
的
起点,但我希望能够估计byte
浏览 106
提问于2020-06-10
得票数 2
1
回答
在
不更改
Spark
属性
的
情况下执行连接时未广播数据帧
的
示例
scala
、
apache-spark
、
apache-spark-sql
根据documentation
的
说法,如果这是一个“蜂窝元存储
表
”并且DataFrame
大小
小于10MB,则默认广播一个小
的
DataFrame。如何在本地
spark
-shell
中
创建尚未
计算
统计数据
的
表
?到目前为止,我
在
spark
.read.csv、Seq(("SOF")).toDF("name")和
spark
.range(1000)上尝试了
浏览 8
提问于2019-09-17
得票数 1
1
回答
在
Spark
查询
中
计算
最优混叠分区和减少倾斜
apache-spark-sql
、
spark-ui
现在,
在
设置配置SET
spark
.
sql
.shuffle.partitions=350之后,我仍然看到
查询
很慢。所以我
的
问题是-斜 对于上面提到
的
查询
,我看到12作业是
在
Spark
中
触发<
浏览 8
提问于2022-01-30
得票数 0
5
回答
需要更少
的
拼花面板文件
apache-spark
、
dataframe
、
rdd
、
partition
、
bigdata
我正在进行以下过程然而,
在
每个分区下,有太多
的
拼图文件,而且每个文件
的
大小
都很小,这会使我下面的步骤加载所有的拼图文件变得非常慢。有没有更好
的
方法,
在
每个分区下,创建更少
的
拼图文件,并增加单个拼图文件
的
大小
?
浏览 6
提问于2016-08-31
得票数 2
2
回答
使用
SQL
函数时出现
的
SparkSQL错误
sql
、
scala
、
apache-spark
、
apache-spark-sql
在
Spark
中
,我试图通过读取csv文件并将列转换为正确
的
数据类型,对从数据框架
派生
的
临时
表
执行
SQL
查询
。 具体来说,我所说
的
表
是TPC规范
中
的
LINEITEM
表
。与规范中所述
的
不同,我使用
的
是时间戳而不是日期,因为我已经阅读过
Spark
不支持日期类型。
在
我
的</e
浏览 4
提问于2015-09-23
得票数 3
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
云点播
实时音视频
活动推荐
运营活动
广告
关闭
领券