我正在尝试设置一个PandasDataframe来处理Databricks中的数据。我的数据是从本地计算机上的文件导入的,如下所示:Snip of the data # Import packagesimport numpy as np
ownr= spark.read.format("csv").load("dbfs:/FileStore/shared_uploads/directory/carsownr.
我有一千万的记录数据。我的要求是,我需要对熊猫的这些数据做一些操作,而且我对所有1000万条记录都没有记忆。所以我希望能够对每个块进行分块并使用toPandas#do chunking to take X records at a timep_df = chunked_df.toPandas()如何通过记录计数将我的数据分割成相等的x-部分或部分,比如一次一百万。这两种解决方案都是