腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
2
回答
在
PySpark
中提取几个正则
匹配
python
、
regex
、
apache-spark
、
pyspark
、
pyspark-dataframes
我目前正在编写一个regex,我想在
PySpark
Dataframe
的
专栏中运行它。 此正则表达式仅
用于
捕获一个组,但可以返回几个
匹配
的
。我遇到
的
问题是,
PySpark
本机regex
的
函数
(regexp_extract和regexp_replace)似乎只允许组操作(通过$ operand)。有没有一种方法(
PySpark
函数
,而不是python
的
re.findall-基于udf
浏览 4
提问于2019-11-19
得票数 5
回答已采纳
1
回答
用于
匹配
字符串
的
Pyspark
函数
apache-spark
、
pyspark
、
apache-spark-sql
、
string-matching
:| | Natwest | Euro Account to Natwest | | AMEX | AMEX payment | 所需
的
表为但我有30多个类别,而且随着时间
的
推移,这个列表还会增加。所以我希望有一个使用
pyspark
的
函数
可以很好地做到这一点。 干杯!
浏览 19
提问于2020-12-26
得票数 0
1
回答
使用字符位置向后搜索以查找子串
的
位置
mysql
、
pyspark-sql
你好,我是新来
的
派斯帕克。我正在尝试用
Pyspark
做类似的事情。Oracle:INSTR('Corporate Floor','or', -3, 2)结果:2但是继续得到
浏览 1
提问于2019-04-15
得票数 1
1
回答
如何将电火花列(
pyspark
.sql.column.Column)转换为火花放电数据?
apache-spark
、
pyspark
、
apache-spark-sql
我有一个用例来映射基于条件
的
pyspark
列
的
元素。通过这个文档,我找不到一个
函数
来执行映射
函数
。因此,尝试使用
pyspark
映射
函数
,但无法将
pyspark
列转换为dataFrame带有时间戳
字符串
的
pyspark
列 我想要
的
浏览 4
提问于2021-11-19
得票数 0
回答已采纳
1
回答
使regex只
匹配
捕获组。
regex
、
split
、
pyspark
由于我目前正在使用
的
技术(
PySpark
API),我需要调整正则表达式,以便完全
匹配
对应于捕获组。此
函数
根据
匹配
的
子
字符串
(而不是捕获组)拆分输入
字符串
。因此,我需要
匹配
\s+字符(目前只捕获这些字符)。我试图扩展积极
的
展望,将\d+\s+可能存在
的
浏览 2
提问于2019-12-03
得票数 1
回答已采纳
1
回答
将不带返回值
的
Python Lambda
函数
转换为
Pyspark
python
、
google-cloud-platform
、
pyspark
、
user-defined-functions
、
google-cloud-dataproc
我在Python语言中有一个有效
的
lambda
函数
,它可以计算dataset1中
的
每个
字符串
与dataset2中
的
字符串
之间
的
最高相似度。在迭代期间,它将
字符串
、最佳
匹配
和相似度以及其他一些信息写入bigquery。没有返回值,因为该
函数
的
目的是向bigquery数据集中插入一行。这个过程需要相当长
的
时间,这就是为什么我想使用
Pyspark
和Dataproc来加速
浏览 16
提问于2019-07-19
得票数 2
回答已采纳
1
回答
如何使用
PySpark
的
RegexTokenizer从
字符串
中删除数字?
python
、
apache-spark
、
pyspark
我想使用
PySpark
的
RegexTokenizer从DataFrame列中删除5位或更多位
的
数字。我可以使用下面的代码提取这些数字,但有人知道我如何删除它们吗?我
的
代码:如果
字符串
是"123
浏览 0
提问于2019-02-13
得票数 0
4
回答
如何使用
PySpark
在另一列中查找子
字符串
列
的
位置?
apache-spark
、
pyspark
、
apache-spark-sql
如果我有一个有两个列
的
PySpark
DataFrame,text和subtext,其中subtext肯定会出现在text
的
某个地方。如何计算subtext在text列中
的
位置?------------------------+---------+----------+ 注意:我可以使用静态text/regex来完成这一任务,而不需要发布问题,我无法找到任何资源来使用特定于行
的
text
浏览 3
提问于2021-01-21
得票数 2
回答已采纳
2
回答
根据第一个字符
的
外观分隔
字符串
列
python
、
regex
、
apache-spark
、
pyspark
我希望根据字符
的
第一次外观将星火DataFrame
的
列划分为两个不同
的
列,在本例中是下划线("_")。,根据第一个下划线从左到右
的
位置,在两个不同
的
列中分隔列城市。最终想要
的
表格应该是这样
的
:1 1.8 newyork 3434_north 4(、等),而是用
字符串
上
的
所有特定字符进行拆分;或者根据<em
浏览 0
提问于2018-07-26
得票数 3
回答已采纳
1
回答
字符串
中
的
Pyspark
双字符替换避免未映射到pandas或rdd
的
特定单词
python
、
pandas
、
apache-spark
、
pyspark
、
apache-spark-sql
我继承了一个修改
pyspark
dataframe中一些
字符串
的
程序。其中一个步骤涉及从
字符串
中
的
一些单词中删除双/三/等字母,以及一个额外
的
例外列表,即使它们有重复
的
字母也会保持不变。目前,这是通过将dataframe转换为具有udf
的
pandas,然后在读回
pyspark
之前对生成
的
pandas dataframe中
的
字符串
应用自定义
函数
来
浏览 7
提问于2021-03-15
得票数 0
回答已采纳
1
回答
如何删除火花放电数据栏中
的
引号“”
apache-spark
、
pyspark
、
apache-spark-sql
+-------+-----+|"asasa"| 8888||"wewwe"|99999|我想要
的
是
浏览 1
提问于2019-11-08
得票数 2
1
回答
PySpark
DataFrame上
的
求和运算当类型良好时给出TypeError
python
、
apache-spark
、
dataframe
、
pyspark
我在
PySpark
中有这样
的
PySpark
(这是采取(3)
的
结果,数据格式非常大):df = [Row(owner=u'u1', a_d=0.1), Row(owner=u'u2', a_d=0.0), Row(owner=u'u1', a_d=0.3)]b = df.groupBy
浏览 4
提问于2016-04-19
得票数 25
回答已采纳
1
回答
使用parser.parse将任何类型转换为日期时间
python
、
pyspark
、
python-datetime
我使用以下
函数
解析
PySpark
中
的
字符串
我
的
约会格式是:date"22-Jan-2021 00:00""10-Feb-2020 14:00" 当我将func应用到dat
浏览 4
提问于2022-01-06
得票数 1
回答已采纳
1
回答
将
函数
应
用于
PySpark
dataframe中
的
列
dataframe
、
pyspark
我是新来
的
火花,
PySpark
说得更具体一点。col_2 | col_3banana | yellow | 2011-01-14 10:26:33.231 我有一个
函数
convert(),它将像2016-01-28 00:56:55这样
的
日期时间
字符串
(可能有毫秒也可能没有毫秒)转换为表示datetime
的
浮点数,比如1453971415。将这个
函数
应
用于
我
的</e
浏览 4
提问于2020-10-01
得票数 0
回答已采纳
1
回答
检索Azure数据库中“-”符号之前
的
字符
databricks
、
azure-databricks
我想从“-”符号之前
的
列中提取数据。我可以很容易地使用the来完成这个任务,但是当我在中做同样
的
操作时,我会遇到错误。如果有这样
的
符号,我也希望能够检查列,如果不存在,我不想提取数据。[DimEmployee] 请问如何在Databricks中得到相同
的
结果?
浏览 6
提问于2022-03-07
得票数 0
回答已采纳
1
回答
创建一个新列,详细说明一个
PySpark
数据row中
的
行是否与另一列中
的
一个行
匹配
。
python
、
dataframe
、
apache-spark
、
pyspark
我想要创建一个
函数
,该
函数
从
PySpark
中
的
左联接创建一个新列,详细说明一个列中
的
值是否
匹配
或不
匹配
另一个dataframe逐行
的
列。例如,我们有一个
PySpark
dataframe (d1)具有列ID和名称,另一个
PySpark
dataframe (d2)具有相同
的
列- ID和Name。我试图创建一个连接这两个表
的
函数
,并创建一个新列,如果两个数据文件中存
浏览 3
提问于2021-12-11
得票数 0
1
回答
如何在
pyspark
中筛选出RDD的确切单词?
apache-spark
、
pyspark
、
rdd
我是Apache Spark
的
新手,正在运行一个单词计数示例。在我得到了我
的
单词列表和它们
的
单词计数后,我现在想要过滤出4个特定
的
单词。我写了下面的代码: output_result = list_RDD.filter(lambda x: "can" in x[0]) 当我运行它
的
时候,我得到了所有包含"can“
的
单词,比如"canada有没有办法让它遍历我要查找
的
单词列表? 例如,我想搜索
的
单词是'c
浏览 39
提问于2021-10-06
得票数 2
回答已采纳
1
回答
AWS Glue -如何排除
字符串
不
匹配
日期格式
的
行
apache-spark
、
pyspark
、
aws-glue
我有一个数据列
的
数据集。该列通常为'dd/MM/yy‘格式,但有时它有垃圾文本。我希望最终将列转换为日期,并将垃圾文本作为空值。 我一直试图使用resolveChoice,但是它导致了所有的空值。
浏览 0
提问于2019-05-23
得票数 0
1
回答
阵列如何使用
python
、
pyspark
我想从一个列中提取一些
字符串
,它
的
类型是Array of strings。我使用了regexp_extract
函数
,但是它返回了一个错误,因为regexp_extract只接受一个
字符串
。我开始这样做,但它不起作用,因为标题是一个
字符串
数组。
浏览 1
提问于2019-10-14
得票数 4
回答已采纳
1
回答
在火花中某个特定位置之后获取子
字符串
的
位置
python
、
apache-spark
、
pyspark
、
apache-spark-sql
我有一张这样
的
桌子:| id | word |+-----+-----------------------+ 只有当子
字符串
(is)发生在第三个位置之后时,我才想获得它在word列中
的
位置。
浏览 4
提问于2021-03-01
得票数 1
回答已采纳
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
即时通信 IM
云直播
活动推荐
运营活动
广告
关闭
领券