Парсинг табличного PDF файла

Пишу бота на Node JS, для своей группы, с сайта получаю PDF файл с расписанием:введите сюда описание изображения

Столкнулся с проблемой, использовал сначала tabula-js, конвертировал в CSV, а после искал по столбцу свою группу, но вдруг, после каникул, в этот раз парсинг изменился и теперь всё вообще не на своих местах, т.е. что-то слиплось, а что-то переместилось. Понятно дело, решение не очень гибкое. Прошу помощи у тех, кто уже парсил PDF файлы.

Нужно найти заголовочную строку с названием группы, а после спускаться вниз и собирать всё, пока не появится строчка с словом "курс", что будет означать, что все предметы собраны.

Т.е. на выходе должен быть результат для группы А-01:

  1. Математика Белянина
  2. Род. Литература Разумовская
  3. Физика Морданова

Прошу помощи, так как уже у самого нет идей, все библиотеки кажутся не подходящими для этого, ибо не получается вытащить нужное для меня и отсеять от другого. Может кто-то знает способ? Видел конвертеры в HTML, но там просто блоки, а не таблица, вытаскивать там только можно по классам, но всё же хотел бы убедиться, есть ли другие способы?


Ответы (0 шт):