在 PySpark 中,所有的数据计算都是基于 RDD(弹性分布式数据集)对象进行的。RDD 提供了丰富的成员方法(算子)来执行各种数据处理操作。....collect())输出结果:10,20,30,40,50【分析】rdd.map(func) 创建一个新的RDD对象rdd2,其中每个元素都会通过map算子应用函数 func。...(5) 产生 50结果是新的RD 对象rdd2 ,包含的元素为 10, 20, 30, 40, 50。...RDDrdd=sc.parallelize([('小明',99),('小红',88),('小城',99),('小李',66)])# 使用 sortBy 方法将 RDD 按照分数(元组中的第二个元素)进行降序排序...', 99), ('小城', 99), ('小红', 88), ('小李', 66)【注意】如果多个元素具有相同的键(如这里的 99),sortBy算子会保持这些元素在原始 RDD 中的相对顺序(稳定排序