腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
1
回答
Pyspark
删除
本地
/
hdfs
文件
/
文件夹
pyspark
org.apache.hadoop.mapred.FileAlreadyExistsException: Output directory file:/D:/code/use_spark/output already exists or
hdfs
://user/output exists 每次我需要手动
删除
已存在的
文件
/
文件夹
时,它都不是很聪明。有没有办法使用
pyspark
API
删除
hdfs</em
浏览 139
提问于2021-02-07
得票数 1
回答已采纳
1
回答
在hadoop中使用cat命令时,没有这样的
文件
或目录
python
、
hadoop
、
command-line
、
terminal
我在一个目录中有两个
文件
,一个名为word_mapper.py,另一个名为README.md。我尝试在hadoop中使用这些
文件
,但是当我运行命令hadoop fs -cat README.md | python3 word_mapper.py时,我从终端得到以下响应: 2021-02-12 14
浏览 1
提问于2021-02-13
得票数 0
1
回答
如何使用python在spark中加载sql
文件
python
、
apache-spark
、
pyspark
我的
pySpark
版本是2.4,python版本是2.7。我有多行sql
文件
,需要在spark中运行。与逐行运行不同的是,是否可以将sql
文件
保存在python (初始化spark)中,并使用submit执行它?我正在尝试用python编写一个通用脚本,以便以后只需要从
hdfs
文件夹
中替换sql
文件
。import sysimport
pyspark
.sql.functions
浏览 8
提问于2022-02-10
得票数 -3
1
回答
Pyspark
检查
hdfs
文件夹
修改日期
pyspark
、
hdfs
我是
pyspark
的新手。想知道
pyspark
有没有什么函数可以获取
HDFS
文件夹
的修改日期?例如在
HDFS
中: 在
pyspark
中: magic() print
浏览 13
提问于2017-12-21
得票数 0
回答已采纳
1
回答
如何在
Pyspark
中创建虚拟(0字节)
HDFS
文件
python
、
python-2.7
、
apache-spark
、
pyspark
我正在寻找一个python实用程序,它可以让我在
HDFS
上动态创建一个虚拟
文件
,而不会接触到
本地
文件
系统。专家们,我有一个简单的要求,我需要用
Pyspark
代码在
HDFS
中创建一个虚拟(0字节)
文件
。基本上,我正在检查
HDFS
上是否存在x.lock (0字节)
文件
,如果存在,这意味着我需要等待其他进程(创建它)完成并
删除
它。如果它不存在,我的作业将创建它并继续执行,最后将其
删除
。
浏览 12
提问于2019-06-25
得票数 1
回答已采纳
1
回答
PySpark
无法将
文件
从
本地
移动到
HDFS
python
、
hadoop
、
hdfs
我正在
本地
8020端口的机器上运行hadoop。我的名字节点存在于path /usr/local/Cellar/hadoop/
hdfs
/tmp/dfs/name下。我已经使用Conda安装了一个
pySpark
项目,并安装了
pyspark
和
hdfs
3依赖项。以下是我的代码:from
hdfs
3 import HDFil
浏览 2
提问于2021-06-25
得票数 1
回答已采纳
4
回答
从
pyspark
读取
hdfs
文件
apache-spark
、
hdfs
、
pyspark
我正在尝试读取
hdfs
中的一个
文件
。这里显示了我的hadoop
文件
结构。supergroup 2685300 2016-03-06 17:31 /inputFiles/CountOfMonteCristo/BookText.txtfrom
pyspark
).setAppName("myFirstApp").setMaster("local") textFile =
浏览 6
提问于2016-03-07
得票数 13
回答已采纳
1
回答
如何将Spark集群上用Pandas编写的
文件
移动到
HDFS
?
apache-spark
、
hadoop
、
pyspark
我正在使用集群模式运行一个星火作业,并使用Pandas编写一些
文件
,我认为它是在临时目录中编写的,现在我想移动这些
文件
或在
HDFS
中编写这些
文件
。
浏览 7
提问于2021-02-16
得票数 0
回答已采纳
1
回答
Pyspark
dataframe在不
删除
/_temporary
文件夹
的情况下写入拼图
pyspark
、
pyspark-sql
df.write.mode("append").parquet(path)我建议将
文件
写入另一个可以授予
删除
权限的
文件夹
,然后将
文件
复制过来。但是Admin仍然希望我将
文件
直接写入目标
文件夹
。有没
浏览 5
提问于2019-12-10
得票数 0
2
回答
如何将外部python库添加到
HDFS
中?
python
、
hadoop
、
apache-spark
、
hdfs
有没有办法,如何将像这样的外部库添加到
hdfs
中?似乎
pyspark
需要外部库才能将它们放在
hdfs
上的共享
文件夹
中。Byt因为我使用的是shellscript,它通过外部库运行
pyspark
脚本,所以无法导入它们。 请参阅关于ImportError的post 。
浏览 11
提问于2017-07-28
得票数 0
1
回答
用
PySpark
读取Cloudera项目中的
文件
json
、
pyspark
、
cloudera
、
cdsw
我的Cloudera项目中有一个
文件
位于"/home/cdsw/npi.json“之下。我尝试使用以下命令从我的“
本地
”CDSW项目中读取
PySpark
,但无法使用以下任何命令。
浏览 2
提问于2018-10-30
得票数 0
回答已采纳
1
回答
用于火花的
HDFS
Config
apache-spark
、
hadoop
、
pyspark
我想用
pyspark
从
HDFS
读取一个
文件
。守则如下:import pandas as pd import json .appName('
PySpark
_Neural_Network') \ .config("spark.hadoop.dfs.
浏览 14
提问于2022-05-04
得票数 0
1
回答
从
Pyspark
访问
HDFS
失败
ubuntu
、
hadoop
、
apache-spark
、
pyspark
、
hdfs
Hadoop和
Pyspark
似乎都能独立正常工作。然而,我没有设法在
Pyspark
中从
HDFS
中获取
文件
。当我尝试从
HDFS
获取
文件
时,我得到以下错误: 如果我
删除
了环境变量,一切都会像以前一样工作。
浏览 1
提问于2017-09-21
得票数 1
1
回答
pyspark
脚本中的
HDFS
命令
apache-spark
、
hadoop
、
pyspark
、
hdfs
我正在编写一个简单的
pyspark
脚本来将
hdfs
文件
和
文件夹
从一个位置复制到另一个位置。我已经浏览了许多在线文档和答案,但是我找不到一种方法来使用
pyspark
复制
文件夹
和
文件
,或者使用
pyspark
执行
hdfs
命令(特别是复制
文件夹
和
文件
)。hadoop = sc.
浏览 1
提问于2022-05-10
得票数 0
2
回答
将CSV
文件
导入Hadoop
csv
、
hadoop2
我是Hadoop的新手,我有一个
文件
可以通过命令行导入到hadoop (我通过SSH访问机器) 如何在hadoop中导入
文件
?我该如何检查(命令)?
浏览 3
提问于2015-12-14
得票数 11
1
回答
HDFS
+在
HDFS
文件夹
与
本地
文件
系统
文件夹
之间创建简单链接
linux
、
hadoop
、
hdfs
我在谷歌搜索但没有找到,示例su
hdfs
Linux
本地
<em
浏览 0
提问于2019-02-26
得票数 0
5
回答
打开
HDFS
中存储的
文件
,以便在VI中编辑
ubuntu
、
hadoop
、
hdfs
、
vi
我想使用VI直接在
HDFS
中编辑一个文本
文件
,而不必将它复制到
本地
,编辑它,然后从
本地
复制它。这个是可能的吗? 编辑:在Cloudera的Hue UI中,这曾经是可能的,但现在不再是这样了。
浏览 22
提问于2014-11-07
得票数 11
回答已采纳
2
回答
如何从
hdfs
读取
文件
python
、
hadoop
、
hdfs
在/project1目录下的hadoop
文件
系统中,我有一个名为mr.txt的文本
文件
。我需要编写python代码来读取文本
文件
的第一行,而无需将mr.txt
文件
下载到
本地
。但是我无法从
hdfs
打开mr.txt
文件
。我试过了: open('
hdfs
:///project1/mr.txt','r')
浏览 4
提问于2017-02-25
得票数 3
回答已采纳
1
回答
如何从S3存储桶中读取csv
文件
并在
pyspark
中创建数据帧?
python-3.x
、
dataframe
、
pyspark
、
apache-spark-sql
我试图从s3读取csv
文件
并创建数据帧,但没有得到结果。你能教我怎么做吗?Accesskey和Secret key我不会放在这里。我导入了所有的库并创建了spark connection。call last): File "/usr/local/spark-2.0.0-bin-hadoop2.7/python/
pyspark
src.zip/py4j/java
浏览 0
提问于2020-12-01
得票数 0
1
回答
Python+
PySpark
文件
本地
连接到远程
HDFS
/Spark/纱线集群
apache-spark
、
pyspark
、
hadoop-yarn
我一直在玩
HDFS
和Spark。我已经在我的网络上设置了一个五个节点集群,运行
HDFS
、Spark,并由Yarn管理。工作人员正在以客户端模式运行。从主节点,我可以很好地启动
PySpark
外壳。对于是否以及如何在这个集群上运行python/
Pyspark
文件
,我有几个问题。如果我在其他地方有一个带有
PySpark
调用的python
文件
,比如在我的
本地
dev笔记本电脑上或者在某个地方的码头容器上,那么有什么方法可以在
本地
运行或
浏览 45
提问于2022-10-11
得票数 0
回答已采纳
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
即时通信 IM
云直播
活动推荐
运营活动
广告
关闭
领券