腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(8740)
视频
沙龙
2
回答
将
Spark
数据
帧
写入
delta
lake
apache-spark
、
pyspark
、
azure-databricks
、
delta
、
delta-lake
我试图使用文档提供的示例代码
将
Spark
数据
帧
转换为
delta
格式,但总是收到这个奇怪的错误。你能帮帮忙或引路吗?df_sdf.write.format("
delta
").save("/mnt/.../
delta
/")org.apache.
spark
.SparkException: Job aborted. -------------------------
浏览 20
提问于2020-02-05
得票数 0
1
回答
Delta
Lake
:性能挑战
pandas
、
delta-lake
方法1:我的输入
数据
是一堆json文件。经过预处理后,输出为pandas
数据
帧
格式,该格式
将
写入
Azure SQL
数据
库表。方法2:我已经实现了
delta
lake
,其中输出pandas
数据
帧
被转换为
Spark
数据
帧
,然后
将
数据
插入到分区的
Delta
Table中。这个过程很简单,而且
将
pan
浏览 8
提问于2020-10-28
得票数 1
1
回答
Delta
Lake
将
多个文件压缩为单个文件
databricks
、
delta-lake
我目前正在探索
delta
,这是由databricks开源的。我正在读取kafka
数据
,并使用
delta
lake
格式将其
写入
为流。
Delta
lake
在从kafka进行流式
写入
的过程中创建了许多文件,我觉得kafka是hdfs文件系统的核心。 我已经尝试过
将
多个文件压缩为单个文件。() val df =
spark
.read.parquet("deltalakefile/data/
浏览 16
提问于2019-10-13
得票数 4
回答已采纳
1
回答
内部部署的
delta
delta-lake
、
data-lake
是否有可能在内部实施
delta
lake
?如果是,需要安装哪些软件/工具? 我正在尝试在本地实现一个增量湖,以分析一些日志文件和
数据
库表。我现在的机器上装了ubuntu,apache
spark
。是否有任何其他工具建议来实施内部
数据
湖概念?
浏览 20
提问于2021-02-10
得票数 2
1
回答
将
数据
写入
Azure databricks中的
Delta
Lake
时出现问题(检测到不兼容的格式)
databricks
、
azure-databricks
、
delta-lake
我需要将
数据
集读取到DataFrame中,然后
将
数据
写入
Delta
Lake
。但我有以下例外: AnalysisException: 'Incompatible format detected.\n\nTo disable this check, SET
spark
.databricks.
delta
.formatCheck.enabled=false\nTo learn more about
Delta
, see https:
浏览 62
提问于2019-07-16
得票数 5
回答已采纳
4
回答
没有Databricks运行时的
Delta
Lake
apache-spark
、
hdfs
、
databricks
、
delta-lake
可以使用
Delta
Lake
而不依赖于Databricks Runtime吗?(我的意思是,是否可以仅在prem上使用带有hdfs和
spark
的
delta
-
lake
?)
浏览 10
提问于2020-03-24
得票数 5
2
回答
AWS Glue能否抓取
Delta
Lake
表
数据
?
apache-spark
、
amazon-s3
、
aws-glue
、
delta-lake
根据Databricks的article,
将
delta
lake
与AWS Glue集成是可能的。然而,我不确定是否有可能在Databricks平台之外也这样做。是不是有人这么做了?另外,是否可以使用Glue爬虫添加与
Delta
Lake
相关的元
数据
?
浏览 16
提问于2019-10-02
得票数 8
2
回答
数据
库错误: AnalysisException:检测到不兼容的格式。与达美
apache-spark
、
pyspark
、
databricks
、
azure-databricks
、
delta-lake
当我试图在Databricks上用
Delta
写入
我的
数据
湖时,我得到了以下错误上面的内容会产生以下错误: AnalysisException: Incompatible f
浏览 11
提问于2022-02-25
得票数 1
回答已采纳
1
回答
到增量表的Simba ODBC连接&使用.Net C#从增量表中读取
数据
c#
、
.net
、
odbc
、
delta-lake
、
simba
我正在尝试通过simba odbc驱动程序使用c#从增量格式表中读取
数据
。增量格式表示例:https://docs.
delta
.io/latest/quick-start.html#-create-a-table&language-python 已经按照https://www.simba.com/products/
Spark
/doc/ODBC_InstallGuide/mac/content/odbc
浏览 28
提问于2021-03-23
得票数 1
1
回答
使用
Spark
结构流对传感器
数据
超时进行分组
spark-streaming
、
databricks
、
spark-structured-streaming
、
azure-databricks
、
spark-streaming-kafka
来自传感器的
数据
被发送到Kafka主题,由
Spark
Structured streaming API使用,并存储到
Delta
Lake
。现在,我们必须确定每个传感器的会话,并将其存储在由device_id和sensor_id分区的不同
Delta
Lake
表中。
浏览 6
提问于2021-02-17
得票数 0
2
回答
错误:当
将
Parquet转换为CSV时,‘str’对象没有属性'write‘
apache-spark
、
pyspark
/RAW/export/") 我已经创建了一个
数据
文件作为'df‘驻留在这个位置,它提供了以下输出:当我试图使用以下任一项
将
parquets
浏览 1
提问于2022-01-01
得票数 -3
回答已采纳
2
回答
具有到增量湖的多个相同密钥的流
写入
apache-spark
、
spark-streaming
、
delta-lake
我正在通过
spark
structured向
delta
写入
数据
流。每个流批次包含key - value (还包含作为一列的时间戳)。
delta
lake
不支持在源(蒸汽批)上使用多个相同的键进行更新,所以我只想用最新的时间戳记录来更新
delta
lake
。我该怎么做呢?
浏览 27
提问于2020-06-19
得票数 2
回答已采纳
1
回答
为什么writeStream不以增量格式编写代码,即使我已经编写了它
apache-spark
、
databricks
、
spark-structured-streaming
、
delta-lake
writeStream正在以“拼接”格式
写入
记录,而不是“增量”格式,尽管我提到了增量格式。
spark
.format("
delta
").option("ignoreDeletes", "true").load("/mnt/
浏览 0
提问于2020-01-10
得票数 0
1
回答
如何在三角洲湖进行createOrReplaceTempView?
apache-spark-sql
、
delta-lake
我会将
数据
从拼图加载到火花
数据
,并使用df.CreateOrReplaceTempView("TableName")创建一个临时表,这样我就可以使用
spark
或% SQL魔术来执行ETL了。但是,如果我不想执行这个saveAsTable操作并
写入
我的
数据
湖,该怎么办?使用SQL执行ETL的最佳方法是什么?我知道我可以通过多种方法
将
Delta
表持久化到Hive中,例如通过df.write.format("
delta
"
浏览 6
提问于2022-09-08
得票数 0
回答已采纳
1
回答
在不能访问internet的服务器上安装
Delta
Lake
库
apache-spark
、
installation
、
pyspark
、
delta-lake
因此,在
spark
会话中正常使用
Delta
lake
是不起作用的。从pyspark.sql导入SparkSession .builder \ .master("...") \ .config("
spark
.sql.extensions", "io.
delta
.sql.DeltaSparkSessionExtensi
浏览 12
提问于2021-03-12
得票数 2
2
回答
无法读取
Delta
格式的
Delta
/ Parquet文件
apache-spark
、
pyspark
、
azure-databricks
、
delta-lake
我试图使用Databricks中的以下代码来读取Databricks中的
delta
/ parquet df3 =
spark
.read.format("
delta
").load('/mnt/
lake
/
浏览 9
提问于2022-08-06
得票数 0
回答已采纳
1
回答
delta
中
spark
.databricks.
delta
.snapshotPartitions配置的用途是什么?
apache-spark
、
delta-lake
我在穿越德尔塔湖的时候遇到了一个配置
spark
.databricks.
delta
.snapshotPartitions,但是我不太确定这是用来做什么的?在
delta
lake
文档中也找不到这一点。在
delta
lake
github中找到以下代码,但不确定此属性如何工作 buildConf("snapshotPartitions")
浏览 18
提问于2020-05-06
得票数 0
回答已采纳
1
回答
如何在德尔塔湖访问金表的网络仪表板和其他?
rest
、
apache-spark
、
delta-lake
我使用的是
delta
lake
oss版本0.8.0。 让我们假设我们使用原始
数据
计算了聚合
数据
和立方体,并使用
delta
将
结果保存在一个金表中。我的问题是,有没有一种众所周知的方法来访问这些金表
数据
并将其传送到web仪表板? 在我看来,您需要一个正在运行的
spark
会话来查询增量表。因此,一种可能的解决方案是编写一个web api,它执行这些
spark
查询。 您也可以
将
gold结果
写入
postgr
浏览 31
提问于2021-02-24
得票数 1
回答已采纳
1
回答
将
数据
流式传输到德尔塔湖,读取过滤结果
java
、
apache-spark
、
kotlin
、
delta-lake
我的目标是不断地
将
传入的拼图文件放入
delta
-
lake
,进行查询,并将结果放入Rest API中。所有文件都在s3存储桶中。//listen for changesdf.writeStream() .form
浏览 5
提问于2020-10-16
得票数 0
2
回答
德尔塔湖独立于阿帕奇火花?
apache-spark
、
delta-lake
我一直在探索data lakehouse和
Delta
Lake
的概念。它的一些功能看起来真的很有趣。就在项目主页上,有一张图表显示了
Delta
在“您现有的
数据
湖”上运行,但没有提到
Spark
。在其他地方,它表明德尔塔湖迪兹运行在
Spark
之上。所以我的问题是,它可以独立于
Spark
运行吗?例如,我可以在不使用
Spark
的架构中,使用S3存储桶来设置
Delta
Lake
,以便以Parquet格式进行存储、模式验证等吗?
浏览 2
提问于2021-04-20
得票数 3
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
云点播
即时通信 IM
活动推荐
运营活动
广告
关闭
领券