Python, Word2Vec. Правильно ли я выполняю поставленную задачу?(сравнение фильмов по характеристикам героев)
Я только начинаю разбираться в Word2Vec и вроде его смысл стал ясен, но возникают определенные вопросы. Моя задача это сравнивать фильмы на похожесть путем того что бы находить слова которые характеризуют главных героев( по сути похожие слова). У меня есть корпус из 700 описаний фильмов. То что я делаю:
- Достаю имена героев и помещаю их в словарь.
- Токенизирую текст по словам.
- Убираю стоп-слова и пунктуацию. Перевожу все в ловер. После чего использую gensim.Word2Vec , для обучения модели. Вот только возникают вопросы: я в нашу модель отправляю только 1 текст(описание фильма) , и на сколько я понимаю нам и не нужно вкидывать весь корпус ибо это не имеет смысла, ведь главные герои появятся только в одном тексте. То есть я вкидываю в модель 1 текст и потом используя функцию most_similar пытаюсь найти похожие слова к нашему персонажу, например Джон. Вот только результат совсем не очень. Ближайшие слова совсем далеки от смысла. То что я думаю, так это то что текст маленький, в словаре модели получается всего 256 уникальных слов, из-за этого нормально модель не обучиться. Но как тогда выполнить данную задачу? Как для такого текста найти слова которые описывали бы нашего персонажа? Может нужно настроить модель Word2Vec( параметры size, window ...) Не могли бы подсказать? Очень запутался.