在R中,我有一个类似于这样的数据集:
address = c("882 4N Road River NY, NY 12345", "882 - River Road NY, ZIP 12345", "123,很明显前两行是相同的,后两行是相同的。但是,如果您试图直接删除重复项,标准函数(例如"distinct()")将声明此<em
我有一个通过运行拼图文件的sqlContext.read创建的DataFrame。
DataFrame由300M行组成。我需要使用这些行作为另一个函数的输入,但我希望以较小的批处理来防止OOM错误。目前,我正在使用df.head(1000000)读取前1M行,但我找不到读取后续行的方法。我尝试了df.collect(),但它给出了一个Java O