Построение преобразования голос в голос с помощью нейронной сети
Хочу построить нейронную сеть для преобразования голос в голос.
Используя pyworld я могу получить характеристики голоса в виде массивов для целевого и преобразуемого голоса. Голосовые данные - прочитанные фрагменты текста в несколько секунд. Прочитаны с одинаковой интонацией и данные одинакового размера. С помощью pyworld я могу обратно по характеристикам восстановить звуковой файл.
Кто может подсказать что то полезное для этой задачи? Может кто то уже имел опыт с подобной задачей?