Парсинг картинки из PDF

мне нужно получить информацию с такого PDF файла: введите сюда описание изображения Получить текст задач и перевернутый ответ на неё я смог легко: (Использовал библиотеку PyMuPDF)

import fitz

pdf_document = "grav.pdf"
doc = fitz.open(pdf_document)
print("number of pages: %i" % doc.pageCount)

print(doc.metadata)
page1 = doc.loadPage(2)
page1text = page1.getText("text")
# page1text = page1
print(page1text)

Получил такой результат работы:

Задача 1. (МФТИ, 1987) С какой скоростью должен был бы лететь самолёт вдоль эквато-
ра, чтобы сила давления сидящих пассажиров на кресла самолёта уменьшилась на четверть
по сравнению силой давления перед взлётом? Радиус Земли принять равным R = 6400 км.
Собственным вращением Земли и высотой полёта по сравнению с радиусом Земли пренебречь.
v = 1
2
√gR ≈ 4 км/с
Задача 2. («Физтех», 2016, 9) На какой высоте, считая от поверхности Земли, ускорение
свободного падения на 19% меньше, чем на поверхности Земли? Радиус Земли равен R.
h = R/9

Но у этого есть такая проблема: введите сюда описание изображения Если рядом с задачей есть картинка у меня не получается её привезать к задаче. Так - же если конвертировать в XML то текст переводится побуквенно, а если HTML , то адекватно вытянуть картинки тоже не полчается(.

Так же интересует возможность адекватного вытягивания формул: вместо √gR ≈ 4 км/с вот это \sqrt{gR} \approx 4 км


Ответы (0 шт):