Загрузить данные из Excel нестандартной структуры
Всем привет! Нужно загрузить данные из екселя используя pandas.read_excel. Сам ексель файл представляет собой следующую структуру:
Первые несколько строчек ненужная информация , потом названия столбцов в строке, потом опять ненужная , ниже в столбце индексы, а напротив в строках данные. (Схематическое изображение на рисунке: trash - ненужные данные которые нужно пропустить)
У меня получилось написать функцию, которая может читать ексель такого типа, но препод сказал, что файл нужно именно парсить и можно использовать магические команды, а я использую константы (например в skiprows). Я прочитала всю документацию по функции pandas.read_excel , но не нашла ничего про эти команды. Что можно сделать, чтобы читать используя магические команды и парсить? (даже если не пандас библиотека). Спасибо
Ответы (1 шт):
Алгоритм действий:
- создаём функцию
is_trash(cell_vall), которая определяет является ли значение ячейки "мусором" и возвращает True для таких значений. - парсим Excel файл, используя
pd.read_excel(). - заменяем значения тех ячеек, для которых функция
is_trash(cell_vall)вернетTrueнаNaN. - используем магическую функцию DataFrame.dropna() для удаления ячеек с мусором.
Если в будущем вы захотите получить ответ с проверенным примером кода (реализации), то воспользуйтесь следующим алгоритмом:
- Ознакомьтесь с тем как задать хороший вопрос на SO и как создать минимальный, самодостаточный и воспроизводимый пример.
- Откройте новый SO вопрос согласно рекомендациям описанным по ссылкам выше.
- Приведите в теле вопроса воспроизводимый пример входных данных (в виде текста / CSV / Python кода или ссылки на файл) и то что вы ожидаете получить на выходе.
