Обработка огромного dataframe через pandas
У меня есть dataframe которые весят по 25 ГБ каждый. Это выгрузка за 1 день. Pandas очень сильно тормозит когда я их загружаю. Но мне не нужен весь dataframe мне нужны из него некоторые строки. Как можно не читаю dataframe полностью отсеять его колонкам? Например, мне нужно прочитать 5 dataframe и из каждого из них достать только нужные столбцы.
что бы получилось вот так.
Сложность в том что pandas делает это очень медленно, а мне нужно достать информацию из 150 ГБ
Ответы (1 шт):
Вообще-то загрузка 25ГБ это никак не быстрый процесс.
Общего рецепта проблемы скорее всего нет. Но если бы такая проблема встала передо мной, я бы попробовал файл читать как текстовый и "на лету" вырезал бы только ту часть информации, которая в дальнейшем пригодится. Не знаю, окажется-ли это быстрее, но Pandas тратит много времени на "угадывание" типа читаемых данных, их трансформацию и пр. Вы можете придумать более простую и удобную структуру и писать в нее. Правда и прелести "Pandas" тогда вам не будут доступны.
Кроме того, вопрос про 150ГБ и "Все данные на компьютере" Это действительно так?