Получение текста из pdf файлов через pdf.js

Проблемы с извлечением кириллицы с pdf файлов.

В одном случае все извлекается как надо - согласовано так и получается согласовано.

В другом случае согласовано превращается в corJiacobaho, то есть русские буквы заменяются на похожие по написанию английские. Нигде в документации не нашел установки распознавания языка.

Куда копать? Кто нибудь с таким сталкивался? Единственное отличие (с виду) - в разных стилях, в одном случае Helvetica, в другом Times.

Приложение на node js, библиотека pdf.js, функция извлечения getTextContent() из буфера.


Ответы (0 шт):