Чтение 1 csv файла 20 минут
подскажите пожалуйста что происходит. Пытаюсь прочитать csv он весит 5Гб. Работаю через jupyter. Всегда грузил очень быстро. Пару дней назад стал сильно тормозить, обычно мне нужно прочитать несколько таких файлов, всегда работало без нареканий. Сейчас компьютер начинает зависать когда читаю большие файлы. Несколько раз приходилось перезагружать комп. Пробовал сделать gc.collect() не помогло. Все равно очень медленно грузит.
Ответы (1 шт):
Открыл для себя библиотеку Dask. Быстро читает файлы, после обработки данных можно вернуть в pd.dataframe
import dask.dataframe as dd
df = dd.read_csv('/Users/log/*-*-*.csv', sample=25000000)
Этот код читает сразу всю папку у меня, и не нужно делать разные циклы. Также неплохо объединять с pandas.DataFrame.to_parquet https://pandas.pydata.org/pandas-docs/stable/reference/api/pandas.DataFrame.to_parquet.html Что бы быстрее выводить информацию
