腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
1
回答
如何在
Spark
中向数据集添加模式?
apache-spark
我正在尝试
将
一个文件加
载到
spark
中。如果我
将
一个普通的textFile加
载到
Spark
中,如下所示:val pfile =
spark
.read.
json
("hdfs:
浏览 6
提问于2017-07-07
得票数 0
回答已采纳
1
回答
将
JSON
加
载到
Spark
Dataframe
python
、
json
、
apache-spark
、
pyspark
、
apache-spark-sql
如何使用python
将
json
字符串加
载到
Spark
Dataframe
中 示例: sampleJson = [ ('{"user":6, "IP" :["10.0.0.1", "1
浏览 8
提问于2020-03-23
得票数 0
1
回答
如何使用Pyspark
将
.CSV文件转换为.
Json
文件?
python-3.x
、
eclipse
、
pyspark
、
rdd
、
pydev
我有一个问题,在转换.csv文件到多行
json
文件使用pyspark。import
json
df =
spark
.read.format(
浏览 9
提问于2018-12-08
得票数 2
2
回答
在
Spark
Scala中接受所有
json
字段值为字符串的正确方法是什么?
scala
、
apache-spark
、
apache-spark-sql
我是
Spark
的新手,正在尝试一些实际操作。目前,我有一个模式,用来
将
json
数据加
载到
Spark
中。
json
的结构如下: "value1": 345.2}val myJsonschema = StructTypeStructField("value1", StringType) Struct
浏览 4
提问于2018-08-30
得票数 0
4
回答
在Kafka上通过
JSON
消息在
Spark
Streaming中创建
Spark
DataFrame
scala
、
apache-spark
、
dataframe
、
apache-kafka
我正在Scala中实现
Spark
Streaming,我从Kafka主题中提取
JSON
字符串,并希望将它们加
载到
dataframe
中。有没有一种方法可以让
Spark
自己从RDDString中推断出模式
浏览 0
提问于2015-06-26
得票数 9
2
回答
用消防软管从分区文件夹中读取
JSON
apache-spark
、
apache-spark-sql
、
databricks
、
spark-structured-streaming
Kinesis
将
文件的持久性(在本例中为时间序列
JSON
)管理为一个文件夹层次结构,该层次结构由YYYY/MM/DD/HH (直到24小时编号)...great划分。那么我如何使用
Spark
2.0来读取这些嵌套的子文件夹,并从所有的叶
json
文件中创建一个静态的
Dataframe
呢?数据阅读器有“选项”吗?我的下一个目标是成为一个流DF,火龙
将
新文件持久化到s3中,使用
Spark
2.0中的新结构化流自然成为流数据的一部分。ND:我正在使用
浏览 4
提问于2016-10-30
得票数 8
1
回答
从模式中删除标点符号
json
、
pyspark
我有一个
json
文件,我可以通过:
json
是嵌套的,一些嵌套的列名中有标点符号。当我试图创建一个非托管表时,这会产生问题。我希望能够读取
json
文件,通过从列名中删除标点符号来修改文件模式,然后使用新模式保存文件。这有可能吗?下面是一个示例
json
文件: [{"cursor": "eyJfaW", "node": {"person": {"_
浏览 0
提问于2019-09-03
得票数 0
回答已采纳
2
回答
Spark
from_
json
也不例外
json
、
scala
、
apache-spark
我正在使用
Spark
2.1 (scala 2.11)。 我想用定义的模式
将
json
格式的字符串从一个
dataframe
加
载到
另一个
dataframe
。我尝试过一些解决方案,但最便宜的是标准列函数from_
json
。我用这个函数试了一个例子(https://jaceklaskowski.gitbooks.io/mastering-
spark
-sql/
spark
-sql-functions-col
浏览 154
提问于2019-02-06
得票数 4
回答已采纳
1
回答
Spark
-SQL :如何
将
TSV或CSV文件读入
dataframe
并应用自定义模式?
scala
、
apache-spark
、
apache-spark-sql
、
spark-dataframe
我在使用制表符分隔值(TSV)和逗号分隔值(CSV)文件时使用
Spark
2.0。我希望
将
数据加
载到
Spark
-SQL数据帧中,在读取文件时,我希望完全控制模式。我不希望
Spark
从文件中的数据中猜测模式。 如何
将
TSV或CSV文件加
载到
Spark
SQL
Dataframe
中,并对其应用模式?
浏览 2
提问于2017-04-20
得票数 6
2
回答
如果我用
JSON
字符串阅读,SQLContext.createDataframe(RDD,StructType)和SQLContext.createDataframe之间的区别是什么?
json
、
scala
、
apache-spark
和编辑: 我似乎找到了第三种选择:
浏览 1
提问于2016-12-07
得票数 0
回答已采纳
1
回答
Scala:我如何返回拼花文件(在adls中)的Option[
Dataframe
] -而不使用
spark
/sql会话
scala
下面的链接可能是提示,但最好能看到一些这样做的示例代码
浏览 0
提问于2018-09-13
得票数 0
回答已采纳
2
回答
将
拼花文件从S3加
载到
DynamoDB
amazon-web-services
、
amazon-s3
、
amazon-dynamodb
、
amazon-emr
、
parquet
这里有几件事要记住, 文件
将
包含数百万行(比如1000万行),因此需要一个有效的解决方案。我相信boto (即使是批处理写入)可能没有那么有效?
浏览 0
提问于2019-04-23
得票数 1
1
回答
如何使用Scala读取子目录下的多个
Json
文件
json
、
scala
、
hadoop
我正在寻找一个代码片段,以找到使用scala读取hadoop子目录下多个嵌套
JSON
文件的最佳实践。 如果我们能够将上面的
JSON
文件写入hadoop中其他目录中的一个文件中,那就更好了。
浏览 0
提问于2016-09-29
得票数 0
1
回答
Spark
:
将
JSON
加载为
DataFrame
的正确模式
json
、
apache-spark
、
apache-spark-sql
、
schema
我想将它作为
DataFrame
加
载到
Spark
中。我把它加载为,默认情况下,
Spark
使用一个模式加载它,该模式如下所示 |-- 9807: string (nullable = true) |-- 467: string (nullable = t
浏览 0
提问于2018-09-12
得票数 1
1
回答
火花读取
json
数字为字符串
apache-spark
、
apache-spark-sql
、
spark-java
我正在开发
spark
java应用程序,并使用
spark
2.4.7版本。我有一个
json
文件,我正在将它加
载到
dataframe
中问题是,在我的
json
文件中,我有一个值是数字的属性,但是当我对
dataframe</
浏览 11
提问于2022-11-14
得票数 0
回答已采纳
2
回答
火花字典键作为列?
python
、
python-3.x
、
scala
、
apache-spark
、
pyspark
将
任何嵌套字典转换为星火
DataFrame
。
将
dict对象转换为DF "filename": "some_file.csv", "client_id": "some uuidclient_id| some uuid|+---------+----------
浏览 9
提问于2022-05-07
得票数 0
1
回答
JSON
格式星火
DataFrame
列上的隐式模式发现
scala
、
apache-spark
数据被加
载到
一个
DataFrame
中,并包含一个列(假设它被命名为custom),其中包含一个
JSON
格式的字符串(、多层嵌套)。这篇文章()建议,
Spark
2.4中的schema_of_
json
可以从
JSON
格式的列或字符串中推断模式。(
spark
) val jsonSch
浏览 0
提问于2019-02-14
得票数 9
1
回答
将
XML文件读取到
Spark
数据帧
xml
、
apache-spark
22" A3="b3"/> </LEVEL3></LEVEL1> 我需要使用PySpark
将
这个文件加
载到
Spark
dataframe
中,并访问各种节点和属性。我已经尝试使用以下代码
将
XML文件加
浏览 2
提问于2019-07-18
得票数 0
1
回答
将
配置单元分区表加
载到
Spark
Dataframe
hadoop
、
apache-spark
、
hive
、
apache-spark-sql
、
spark-dataframe
我使用的是
Spark
1.4.1版本。我正在尝试
将
一个已分区的配置单元表加
载到
一个
DataFrame
中,其中在配置单元表中按year_week编号进行分区,在这种情况下,我可能有104个分区。但是我可以看到
DataFrame
正在
将
数据加
载到
200个分区中,我知道这是因为
spark
.sql.shuffle.partitions默认设置为200。我想知道是否有什么好方法可以将我的Hive表加
载到
具有104个分区的
Spark</em
浏览 1
提问于2016-03-28
得票数 1
1
回答
是否有可能将数据库直接从HDFS加
载到
spark
中作为
DataFrame
?
mongodb
、
apache-spark
、
hadoop
、
hdfs
我在齐柏林飞艇上运行了我的MongoDB和
Spark
,两者共享相同的HDFS。MongoDB生成存储在同一HDFS中的.wt数据库。我希望将该MongoDB从HDFS生成的数据库集合加
载到
Spark
中。 是否可以
将
数据库从HDFS直接作为
DataFrame
加
载到
spark
中?还是我需要使用MongoDB火花连接器?
浏览 1
提问于2018-06-25
得票数 1
回答已采纳
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
即时通信 IM
云直播
活动推荐
运营活动
广告
关闭
领券