Загрузить данные из Excel нестандартной структуры

введите сюда описание изображенияВсем привет! Нужно загрузить данные из екселя используя pandas.read_excel. Сам ексель файл представляет собой следующую структуру: Первые несколько строчек ненужная информация , потом названия столбцов в строке, потом опять ненужная , ниже в столбце индексы, а напротив в строках данные. (Схематическое изображение на рисунке: trash - ненужные данные которые нужно пропустить) У меня получилось написать функцию, которая может читать ексель такого типа, но препод сказал, что файл нужно именно парсить и можно использовать магические команды, а я использую константы (например в skiprows). Я прочитала всю документацию по функции pandas.read_excel , но не нашла ничего про эти команды. Что можно сделать, чтобы читать используя магические команды и парсить? (даже если не пандас библиотека). Спасибо

введите сюда описание изображения


Ответы (1 шт):

Автор решения: MaxU

Алгоритм действий:

  1. создаём функцию is_trash(cell_vall), которая определяет является ли значение ячейки "мусором" и возвращает True для таких значений.
  2. парсим Excel файл, используя pd.read_excel().
  3. заменяем значения тех ячеек, для которых функция is_trash(cell_vall) вернет True на NaN.
  4. используем магическую функцию DataFrame.dropna() для удаления ячеек с мусором.

Если в будущем вы захотите получить ответ с проверенным примером кода (реализации), то воспользуйтесь следующим алгоритмом:

  1. Ознакомьтесь с тем как задать хороший вопрос на SO и как создать минимальный, самодостаточный и воспроизводимый пример.
  2. Откройте новый SO вопрос согласно рекомендациям описанным по ссылкам выше.
  3. Приведите в теле вопроса воспроизводимый пример входных данных (в виде текста / CSV / Python кода или ссылки на файл) и то что вы ожидаете получить на выходе.
→ Ссылка