Распознавание речи с таймингами отдельных букв
Необходимо распознать речь из аудио файла и выделить время начала и время конца произношения каждой буквы.
С помощью каких библиотек возможно такое реализовать, или возможно есть готовый функционал в гугловских/яндексовских api?
Задаю вопрос, так как не смог найти ничего приблизительно похожего на то, что мне нужно.