Получение текста в PDF из определенных областей

Необходимо получить текст из определенных областей PDF документа.

Мой алгоритм такой:

  1. Сконвертировать PDF документ в изображение (pdf.js)
  2. Нарезать изображение на отдельные области (canvas)
  3. Получить текст из каждой области (tesseract.js)

С первыми двумя пунктами все ок, но с получением текста не все гладко, Tesseract часто допускает ошибки в распознавании текста.

Имеется ли другой алгоритм? Или другие методы для распознавании текста?


Ответы (0 шт):