Парсинг PDF Python. Сканнированные страницы

подскажите, есть ли разница между парсингом пдф конвертированного из ворда и парсингом пдф сделанного из сканнов страниц(даже хороших сканов). Я читал что разницы нет, так как все переводиться в рисунки, но я в этом не уверенн. И если есть разница, то можно ли получить внятный текст с помощью OpenCV(например) и ему подобных или вся надежда на ABBYY?


Ответы (1 шт):

Автор решения: Argo7

Если в PDF есть текст, то работают достаточно простые (а, главное, быстрые) конвертеры. Поищите по словам pdf to text(pdf2text). На неизвестном PDF просто проверьте, можно ли скопировать текст в буфер. Если же там картинка - надо использовать бесплатный tesseract, или платный abbyy. Да, для извлечения текста есть и питоновский модуль, но есть и засада, мне попадались PDF, в которых тест был кривоватый, хотя визуально они смотрелись нормально

Комментарий Alex Titov

→ Ссылка