Парсинг табличного PDF файла
Пишу бота на Node JS, для своей группы, с сайта получаю PDF файл с расписанием:
Столкнулся с проблемой, использовал сначала tabula-js, конвертировал в CSV, а после искал по столбцу свою группу, но вдруг, после каникул, в этот раз парсинг изменился и теперь всё вообще не на своих местах, т.е. что-то слиплось, а что-то переместилось. Понятно дело, решение не очень гибкое. Прошу помощи у тех, кто уже парсил PDF файлы.
Нужно найти заголовочную строку с названием группы, а после спускаться вниз и собирать всё, пока не появится строчка с словом "курс", что будет означать, что все предметы собраны.
Т.е. на выходе должен быть результат для группы А-01:
- Математика Белянина
- Род. Литература Разумовская
- Физика Морданова
Прошу помощи, так как уже у самого нет идей, все библиотеки кажутся не подходящими для этого, ибо не получается вытащить нужное для меня и отсеять от другого. Может кто-то знает способ? Видел конвертеры в HTML, но там просто блоки, а не таблица, вытаскивать там только можно по классам, но всё же хотел бы убедиться, есть ли другие способы?