腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
1
回答
spark
是否
异步
写入
数据
帧
apache-spark
、
pyspark
我有两个
spark
数据
帧
df1和df2。我尝试将它们写到两个不同的文件路径。有人能告诉我,写操作是同步进行还是
异步
进行?这是因为它们是两个不同的
数据
帧
写入
两个不同的路径,
写入
是同时发生,还是必须等到它完成df1写出后才开始写df2?GlueContext(SparkContext.getOrCreate()) # updated 11/19/19 for error caused in error logging function
浏览 15
提问于2020-02-17
得票数 0
2
回答
Apache Ignite到亚马逊S3的连接
ignite
我想知道如何将
数据
从亚马逊S3加载到Apache Ignite集群?
是否
需要单节点或多节点群集?
浏览 5
提问于2017-05-02
得票数 1
1
回答
如何在使用
Spark
Java向Kafka Producer
写入
Spark
Dataframe时控制记录数
dataframe
、
apache-spark
、
apache-kafka
、
spark-streaming
、
kafka-producer-api
我有一个包含两列的
spark
数据
帧
,'keyCol‘列和'valCol’列。
数据
帧
的大小非常巨大,接近1亿行。我想以小批量的方式向kafka主题
写入
/产生
数据
帧
,即每分钟10000条记录。此
spark
作业将每天运行一次,从而创建此
数据
帧
如何在下面的代码中实现每分钟10000条记录的小批量
写入
,或者请建议
是否
有更好/更有效的
浏览 10
提问于2020-04-27
得票数 1
1
回答
如何在
Spark
中加速大
数据
帧
连接
python
、
scala
、
apache-spark
我在
Spark
2.4中有两个
数据
帧
,它们的大小几乎相同。每个都有大约4000万条记录。一种是通过简单地从S3加载
数据
帧
生成的,另一种是加载一堆
数据
帧
并使用sparkSQL生成大型
数据
帧
。然后我将这两个
数据
帧
多次连接到多个
数据
帧
中,并尝试将它们作为CSV
写入
S3……然而,我看到我的
写入
时间超过了30分钟,我不确定它
是否<
浏览 12
提问于2020-05-14
得票数 0
回答已采纳
3
回答
在
写入
dataframe - pyspark之前从表中删除记录
sql-server
、
pyspark
、
apache-spark-sql
、
pyspark-dataframes
、
aws-glue-spark
在从dataframe向表中
写入
数据
之前,我正在尝试从表中删除记录。这对我不起作用。我做错了什么?query = "(delete from xx_files_tbl)" .option("url", "jdbc:sqlserver
浏览 172
提问于2020-10-14
得票数 1
回答已采纳
2
回答
spark
增量覆盖特定分区
apache-spark
、
delta
所以我有一个
数据
帧
,它有一个列,file_date。对于给定的运行,
数据
帧
只有一个唯一file_date的
数据
。我使用以下代码编写此
数据
.repartition(1) .format("delta") .mode("overwrite,并且必须覆盖特定FILE_DATE _ file_date的
数据
。不幸的是,在上面的代码中,如果我没有
浏览 4
提问于2020-01-22
得票数 4
1
回答
使用
Spark
写入
memsql的最佳实践
apache-spark
、
scalability
、
singlestore
我的用例如下:我们正在使用
Spark
从HDFS读取和转换
数据
。转换后的
数据
应保存在memsql中。长话短说:
Spark</em
浏览 4
提问于2016-01-15
得票数 1
2
回答
Spark
DataFrameWriter ignoreNullFields不工作
apache-spark
、
apache-spark-sql
+----++----+----+----+----++----+----+----+----+但即使我使用
spark</e
浏览 50
提问于2020-02-27
得票数 3
1
回答
我的
spark
程序中有大量的阶段
apache-spark
、
amazon-s3
、
apache-spark-sql
、
spark-streaming
当我的
spark
程序执行时,它创建了1000个阶段。但是,我只看到推荐的是200。最后,我有两个动作将
数据
写入
S3,之后我就得到了未持久化的
数据
帧
。现在,当我的
spark
程序将
数据
写入
S3时,它仍然多运行了近30分钟。为什么会这样呢?是因为我保存了大量的
数据
帧
吗? P.S ->我正在运行的程序只有5个输入记录。
浏览 0
提问于2018-08-17
得票数 1
1
回答
对partitionBy创建的一个输出目录中的
数据
进行排序
scala
、
apache-spark
、
sorting
、
partitioning
我有一个很大的地理空间
数据
集partitionBy qk5的level 5。在每个quadkey级别的目录中,大约有1-50 Gb的
数据
,所以它不适合放在一个文件中。问:有没有一种方法可以在partitionBy批处理中对
数据
进行排序?part30000.parquet part40000.parquet 我想让part1.parquet,part2.parquet,part3.parquite,part4.parquite中的
数据
按列
浏览 19
提问于2021-09-23
得票数 2
回答已采纳
1
回答
使用
spark
-redis加载
数据
集时出现问题
apache-spark
、
pyspark
、
redis
、
apache-spark-sql
我正在尝试使用
spark
-redis加载
数据
集,但操作总是失败。我尝试
写入
的
spark
dataframe有8500万行,但
写入
操作在2500万行之后大致失败。我想知道如何解决这类问题。下面是我在Python脚本中执行的操作:
SPARK
_JARS = ['/home/jovyan/jedis-3.6.0.jar', '/home/jovyan/
spark
-redis_2.
浏览 100
提问于2021-06-11
得票数 2
1
回答
Databricks -将
Spark
dataframe转换为表:它是相同的
数据
源吗?
apache-spark
、
apache-spark-sql
、
sparktable
您将需要执行相当多的计算,从源
数据
帧
,一个
Spark
表,不是吗?或者,dataframe和table都是指向相同
数据
的指针(即,在创建表时,不是在创建重复
数据
)?我猜我想要弄清楚的是,你
是否
可以从一个
Spark
数据
帧
到一个表‘开关开关’,或者这样做的计算量
是否
(非常)昂贵(毕竟这是大
数据
...)
浏览 26
提问于2021-04-26
得票数 0
1
回答
使用JDBC Source和Redis Stream的
Spark
流
oracle
、
scala
、
redis
、
spark-streaming
现在,这两个对象都在
Spark
上运行,但我似乎不能确定为什么流不工作。 也许是redis在
写入
流端时实现它的接收器的方式,也可能是我尝试做这项工作的方式。我在流媒体上找到的几乎所有示例都与
Spark
samples有关,比如文本流媒体或TCP,而我在关系
数据
库上找到的唯一解决方案是基于Kafka connect的,我现在不能使用它,因为该公司没有在kafka我基于
spark
redis的示例构建了我的代码,并使用示例代码尝试实现针对我的情况的解决方案。我每天加载Oracle
数据
,并将其发
浏览 21
提问于2020-08-12
得票数 2
1
回答
读取Hive表并
写入
Cassandra表
apache-spark
、
hive
、
cassandra
、
cloudera
、
spark-cassandra-connector
问:我想将表格
数据
从Hive表格导出/
写入
相应的Cassandra表格。 有没有Hive到Cassandra的连接器?或者我需要在
Spark
中做这件事,如果是的话,怎么做?
浏览 35
提问于2020-06-17
得票数 0
回答已采纳
1
回答
在linux机器上使用s3a对于>100列拼接失败
linux
、
scala
、
parquet
、
spark-shell
、
amazon-s3-access-points
我使用s3a从
数据
库读取
数据
帧
并
写入
.parquet(s3a://bucketname//folder)。它适用于<100列的
数据
帧
,但crashes.exits
spark
-shell适用于>100列的
数据
帧
。如果是列限制/版本问题/内存问题,
是否
找不到任何材料?希望能从经验丰富的社区中找到一些方向。下面的代码可以在我的本地机器上的Eclips
浏览 15
提问于2021-05-20
得票数 1
回答已采纳
1
回答
将
数据
帧
从
spark
集群
写入
cassandra集群:分区和性能调优
scala
、
apache-spark
、
cassandra
、
datastax-java-driver
、
spark-cassandra-connector
Cloudera Hadoop-
Spark
作业在此处运行2.Cloud - Cassandra集群,多个DC<code>A0</code> 在我的多租户
spark
集群中,对于具有20M记录的
spark
批量加载,以及下面的配置,我看到了许多任务失败、
浏览 25
提问于2020-06-08
得票数 1
回答已采纳
1
回答
如何在pyspark中将
数据
帧
的输出
写入
CSV文件
pyspark
、
pyspark-sql
我正在研究使用pyspark的回归分类算法。我想将模型输出保存到CSV文件中。我用过但是它抛出一个错误,声明saveAstextFile属性不在列表中。请参阅以下代码并提出建议:from pyspark import SparkContextfrom pyspark.sql.types import * from pyspark.ml impor
浏览 18
提问于2017-07-05
得票数 0
1
回答
Snowflake : SQL访问控制错误:权限不足,无法对架构进行操作
pyspark
、
aws-glue
、
snowflake-cloud-data-platform
我已经编写了aws glue job,我试图将雪花表作为
spark
数据
帧
读取,并尝试将
spark
数据
帧
写入
snowflake表。在这两种情况下,我的工作都无法显示“操作模式的权限不足”。但是当我在雪花cli上直接写insert语句时,我能够插入
数据
。所以基本上我有插入权限。那么,当我尝试从dataframe中插入
数据
或从snowflake表中读取
数据
作为dataframe时,我的作业为什么会失败呢? 下面是我将<em
浏览 0
提问于2019-02-09
得票数 0
1
回答
是否
有一种方法可以使用
spark
_write_csv在sparklyr中为csv文件设置名称?
r
、
sparklyr
我需要将
数据
帧
写入
单个csv文件,并发现可以使用sdf_coalesce()将该文件转换为单个分区。我想知道
是否
有任何方法可以更改
spark
_write_csv()生成的csv文件的名称 提前谢谢。
浏览 0
提问于2018-04-04
得票数 3
回答已采纳
1
回答
是否
可以将es.batch.write.retry.count设置为零值
apache-spark
、
elasticsearch
、
pyspark
、
apache-spark-sql
我只想停止
spark
作业,如果在向ES
写入
数据
时发生任何异常。有一个配置es.batch.write.retry.count的默认值是3。我们可以设置es.batch.write.retry.count =0,这样如果按照我的要求发生故障,
spark
数据
帧
写入
ES就会停止吗?
浏览 16
提问于2019-11-29
得票数 1
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
即时通信 IM
云直播
活动推荐
运营活动
广告
关闭
领券