腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
1
回答
spark
外部
连接
与
源
python
、
apache-spark
、
pyspark
、
apache-spark-sql
我对
spark
比较陌生,我想知道是否可以获得用于
外部
连接
的列的源代码DF 1|item1| key||Item1|key1|| t1| key1|| t3| key8|| t5|key10|我想在这3个数据帧上执行完整的外
连接
,并包含一个新的列,用来指示该键的
源
。
浏览 2
提问于2017-12-07
得票数 0
1
回答
如何在数据
源
级执行函数(进而绕过Catalyst)?
apache-spark
、
apache-spark-sql
Apache
Spark
™提供了一种可插拔的机制,以便使用Apache
与
外部
数据
源
集成。这些API允许
Spark
从
外部
数据
源
读取数据,还允许将在
Spark
中分析的数据写回
外部
数据
源
。除此之外,我想知道Apache
spark
是否也为能够本机执行函数(本机或用户定义的)的数据
源
提供了能力(或接口)?我们有一个专有的数据
源
,它可以将结果传递给max()、min()、s
浏览 2
提问于2017-09-18
得票数 1
1
回答
阅读Azure HDI4.0中的Avro
azure
、
apache-spark
、
avro
、
spark-avro
我试图读取一个阿夫罗文件使用木星笔记本在Azure HDInsight 4.0
与
Spark
2.4。我无法正确地提供.jar文件{ "conf": {"
spark
.jars.packages": "com.databricks:
spark
-avro_2.11:4.0.0" }} pyspark.sql.utils.Analy
浏览 3
提问于2019-10-25
得票数 3
回答已采纳
1
回答
Apache
Spark
Streaming :简单的接收器
rest
、
rss
、
rpc
、
spark-streaming
有没有一种简单的方法可以将
spark
streaming
连接
到
外部
源
,如Rest服务器、RSS流、RPC服务器等?
浏览 2
提问于2015-07-03
得票数 1
1
回答
如何使用externalDataSource选项从Databricks写入synapse?
azure
、
pyspark
、
azure-databricks
:预先配置的
外部
数据
源
,用于从Azure Synapse读取数据.
外部
数据
源
只能与PolyBase一起使用,并移除控件权限要求,因为
连接
器不需要创建作用域的凭据和
外部
数据
源
来加载数据。另外,我不知道输入是什么,在文档中写着 .format("com.databricks.
spark
.sqldw") \ .option("url",your-pr
浏览 1
提问于2022-08-18
得票数 0
1
回答
Azure数据库中的ML
Spark
作业
azure
、
azure-hdinsight
、
azure-databricks
目前我们在Azure HDInsight集群中使用ML pyspark作业(版本:HDI3.6)。有没有可能在Azure Databricks中使用相同的pyspark作业而不做太多更改?
浏览 0
提问于2019-02-22
得票数 0
1
回答
Apache Zeppelin 0.7.0-快照不支持
外部
Spark
apache-zeppelin
我正在尝试使用齐柏林飞艇(0.7-0快照编译
与
mvn清理包-Pcassandra-
Spark
-1.6 -Dscala-2.11 -DskipTests)
与
外部
,独立的
Spark
版本1.6.1 我已经尝试通过在/ Zeppelin /conf/zeppelin-env.sh中输入export MASTER=
spark
://mysparkurl:7077来进行设置,并且在%
spark
interpeter设置下到目前为止
浏览 5
提问于2016-08-10
得票数 1
1
回答
如何使用
Spark
在Apache Solr上构建聚合
apache-spark
、
apache-kafka
、
solr
我有一个要求建立聚合的数据,我们收到我们的Apache Kafka… 我有点不知道该走哪条技术路线…… 似乎人们看到的是标准的方式,一群Apache Kafka <-> Apache
Spark
<-Solr Aggregation 但我看到了一些代码片段,它们将数据聚合在
Spark
中,并将其写入到Solr的特殊索引下。此外,可能聚合mit Kafka <-> Kafka Connect Solr <-> Solr仅适用于Kafka中的一个主题,所以如果我必须组合来自2个或更多不同主题和聚合的数据,那么Kafka,<
浏览 34
提问于2021-11-11
得票数 0
1
回答
MongoDB火花
连接
器不工作在Windows上
mongodb
、
apache-spark
我在C:/
Spark
中的C驱动器中安装了
Spark
安装程序。我在c驱动器中使用以下命令克隆了MongoDB火花
连接
器-并在C驱动器中创建mongo-
spark
文件夹。当我在
Spark
文件夹中运行命令时- C:\
spark
\bin>
spark
-shell --conf "
spark
.mongodb.input.uri=mongodb://127.0.0.1/test.CoOrder--
浏览 4
提问于2017-01-19
得票数 1
1
回答
Python:用Pip安装带依赖项的脱机包?
python-3.x
、
installation
、
pip
我已经创建了一个包,我可以安装
与
互联网
连接
,但我需要安装它现在没有互联网
连接
,所以我需要下载所有的
外部
依赖,并从来源安装他们。 如何从需要互联网
连接
的
外部
包
源
安装package?换句话说,如何使pip在安装中查找本地
源
而不是
外部
源
?
浏览 0
提问于2018-08-13
得票数 3
回答已采纳
2
回答
如何将Virtuoso分布式版本链接到Hadoop
apache-spark
、
hadoop
、
sparql
、
rdf
、
virtuoso
换句话说: Virtuoso是一个很好的解决方案,可以在hadoop集群中工作,并且可以使用
SPARK
来执行分布式查询吗?
浏览 0
提问于2019-12-01
得票数 0
回答已采纳
1
回答
Spark
-SQL数据帧
外部
数据
源
效率低
apache-spark
、
apache-spark-sql
当我试图在
Spark
-SQL
外部
数据
源
上做一些测试时,会发生这个问题。为了更清楚地表达这个问题,我编写了一段代码: 在我的
外部
Datasource API基准代码中,它实现了一个假的
外部
数据
源
(实际上是一个RDD[String,Ar
浏览 2
提问于2016-01-09
得票数 1
1
回答
增量核
与
火花-avro之间的火花Maven依赖不兼容
scala
、
maven
、
apache-spark
、
avro
、
delta-lake
我看到的一个奇怪的行为是,它似乎
与
火花阿夫罗冲突。Maven构建成功,但在运行时我会收到错误。如果首先声明了增量表依赖项,则会得到一个运行时错误,该运行时错误没有安装
spark
: 如果先定义
spark
浏览 1
提问于2020-08-17
得票数 1
1
回答
MongoDB &
Spark
: mongo-hadoop和mongo-
spark
的区别
mongodb
、
apache-spark
、
hadoop
、
pymongo
mongo-hadoop和mongo-
spark
连接
器有什么不同,pymongo只能和mango-hadoop一起使用吗? pymongo只
与
mongo-hadoop一起使用吗?
浏览 2
提问于2018-07-10
得票数 0
1
回答
星星之火/ Scala --比较Dataframe中的两列(其中一列为NULL )。
sql
、
scala
、
apache-spark
、
null
、
apache-spark-sql
我使用
Spark
(Scala)将QA数据从一个关系数据库移动到另一个关系数据库。QA过程包括在
源
表和目标表之间执行一个完整的
外部
连接
。
源
表和目标表在键上的数据框架中
连接
:val mismatchedDF = joinedDF.filter(mismatchCol
浏览 0
提问于2017-11-07
得票数 4
回答已采纳
1
回答
databricks-connect,py4j.protocol.Py4JJavaError:调用o342.cache时出错
pyspark
、
databricks-connect
与
数据库的
连接
工作正常,
与
DataFrames的工作也很顺利(
连接
、过滤等操作)。当我在数据帧上调用cache时,问题出现了。Caused by: java.lang.ClassNotFoundException: org.apache.
spark
.rdd.RDD$client53442a94a3$$anonfun$mapPartitions$.classForName(Utils.scala:257) at org.apache.
spark
.sql.util.ProtoSeri
浏览 0
提问于2020-02-04
得票数 1
2
回答
Spark
通过Mesos转到MongoDB
mongodb
、
apache-spark
、
cluster-computing
、
mesos
、
mesosphere
我正在尝试使用Mesos将Apache
Spark
连接
到MongoDB。这是我的架构:现在我只在1个节点上安装了
Spark
。关于这方面的信息并不多。我只想提几个问题: 据我所知,我可以通过mesos将星火
连接
到MongoDB。换句话说,我最终使用MongoDB作为存储层。我真的需要Hadoop吗?是否强制将所有数据放入Hadoop中,以供
Spark
浏览 29
提问于2016-08-17
得票数 0
1
回答
来自SQL
外部
源
的
Spark
自动更新
apache-spark
、
apache-spark-sql
我正在使用
Spark
加载一个大型的
外部
数据
源
options.put("url"schema.tablename"); 我想知道我的
外部
在我需要再次调用load函数的情况下,<em
浏览 2
提问于2016-05-09
得票数 1
1
回答
Apache作为ApacheSpark2.4中内置的数据
源
apache-spark
最近,我阅读了的文章并试用了这个示例,但是当我运行 .load("examples线程“主”org.apache.
spark
.sql.AnalysisException中的异常:未能找到数据
源
: avro。Avro是内置的,但
外部
数据
源
模块,从
Spark
2.4。请按照“”的部署部分在org.apache.
spark
浏览 0
提问于2019-02-09
得票数 8
回答已采纳
2
回答
数据
源
io.pivotal.greenplum.
spark
.GreenplumRelationProvider不支持流写入。
scala
、
apache-kafka
、
spark-streaming
、
greenplum
我使用的是格林梅-火花
连接
器,但我正在获取数据
源
,io.pivotal.greenplum.
spark
.GreenplumRelationProvider不支持流写入。是否格林梅
源
不支持流媒体数据?我曾尝试将数据
源
命名为“绿梅”,并将"io.pivotal.greenplum.
spark
.GreenplumRelationProvider“转换为.format(”数据
源
“)
浏览 0
提问于2019-04-04
得票数 0
回答已采纳
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
云点播
即时通信 IM
活动推荐
运营活动
广告
关闭
领券