Построение преобразования голос в голос с помощью нейронной сети

Хочу построить нейронную сеть для преобразования голос в голос.

Используя pyworld я могу получить характеристики голоса в виде массивов для целевого и преобразуемого голоса. Голосовые данные - прочитанные фрагменты текста в несколько секунд. Прочитаны с одинаковой интонацией и данные одинакового размера. С помощью pyworld я могу обратно по характеристикам восстановить звуковой файл.

Кто может подсказать что то полезное для этой задачи? Может кто то уже имел опыт с подобной задачей?


Ответы (0 шт):