Перевод pyspark.sql.dataframe.Dataframe в Pandas Dataframe

Всем привет.

В jupyter поднял spark, считал табличку из БД и положил в variable (тип variable pyspark.sql.dataframe.Dataframe). Далее пытаюсь осуществить перевод в Pandas Dataframe путём new_variable = variable.toPandas(), но получаю ошибку:

Py4JJavaError: An error occurred while calling o64.collectToPython. : org.apache.spark.SparkException: Job aborted due to stage failure: Task 1 in stage 1.0 failed 4 times, most recent failure: Lost task 1.3 in stage 1.0 (T*****u, executor 2): org.apache.spark.SparkException: Kryo serialization failed: Buffer overflow. Available: 0, required: 2214939. To avoid this, increase spark.kryoserializer.buffer.max value

Как можно решить эту проблему?


Ответы (0 шт):