Как обучить сеть распознавать одинаковый текст(участки) на scroll изобр(часть текста на 1 изобр, есть и на 2 изобр)?
подскажите пожалуйста как обучить сеть следующему:
имеется несколько изображений окон Ворд на которых которых расположен текст. На каждом изображении текст проскроллен (есть пересечения текста на изображениях). Как обучить сеть распознавать части (участки) текста на изображениях (хотелось бы чтобы исходные изображения просто обрезались и были без повторяющегося текста), так чтобы полученные изображения передать в Тессеракт и получить один .тхт файл со всем текстом(без повтора пересекающегося текста). (Для определения частей (участков) Тессеракт нельзя использовать)
Возможно для решения данной проблемы можно использовать перцептивный хэш.Спасибо за любую помощь.