MemoryError при обучении большого набора данных с использованием наивного байесовского классификатора
Я пытаюсь обучить наивный байесовский классификатор, используя набор ключевых слов для разных категорий. Данные хранятся в данном виде:
type(train)
pandas.core.series.Series
Всего у меня около 22 тысяч категорий(соответственно, такая размерность), при обучении которых возникает ошибка memoryerror:
from sklearn.feature_extraction.text import TfidfVectorizer
from sklearn.naive_bayes import MultinomialNB
from sklearn.pipeline import make_pipeline
model = make_pipeline(TfidfVectorizer(), MultinomialNB())
model.fit(train.astype('U'), categories.astype('U'))
Как можно решить данную проблему? Как можно сократить кол-во затрачиваемой памяти?
При меньшем кол-ве данных, модель обучается
