Получение текста в PDF из определенных областей
Необходимо получить текст из определенных областей PDF документа.
Мой алгоритм такой:
- Сконвертировать PDF документ в изображение (pdf.js)
- Нарезать изображение на отдельные области (canvas)
- Получить текст из каждой области (tesseract.js)
С первыми двумя пунктами все ок, но с получением текста не все гладко, Tesseract часто допускает ошибки в распознавании текста.
Имеется ли другой алгоритм? Или другие методы для распознавании текста?