Использование записанных аудио-семплов для распознавния ограниченного количества слов

Мне нужно в режиме прослушки микрофона определять что сказал пользователь. Всего будет, допустим, 4 слова которые программа может распознать: мама, папа, сестра и брат. Имеется по 3 записанных семпла каждого из этих слов, сказанных пользователем в разных интонациях. Возможно ли распознать в режиме реального времени что из этих слов было сказано, если использовать fingerprint каждого из этих этих семплов? Или как лучше это сделать?


Ответы (0 шт):