Построение гистограммы частоты повторения слов
Нужно построить гистограмму частоты повторения слов в тексте. Я определил частоту встречаемости каждого слова. Но вот при построение гистограммы столкнулся со следующей проблемой:
AttributeError: 'Line2D' object has no property 'kind'
Вот код, написанный код:
data = pd.read_csv('reutersNLTK.csv')
test = data['text']
test = list(test)
test_string = ' '.join(test)
test_string = test_string.lower()
spec_chars = '\n,.;><`)('
spec_chars
import nltk
nltk.download('punkt')
text_tokens = word_tokenize(test_string)
text = nltk.Text(text_tokens)
text[:10]
test_string = " ".join([ch for ch in text if ch not in spec_chars])
fdist = FreqDist(text)
print(fdist.most_common(5))
fdist.plot(100, cumulative=False, kind = 'hist')
Датафрейм собой представляет 3 столбика. В первом содержиться айди статьи, во втором тема статьи, и в третьем сама статья. Для данной задачи первые два столбика использовать не нужно.
Пример данных из датафрейма:
ids categories text
0 test/14826 ['trade'] ASIAN EXPORTERS FEAR DAMAGE FROM U.S.-JAPAN RI...
1 test/14828 ['grain'] CHINA DAILY SAYS VERMIN EAT 7-12 PCT GRAIN STO...
Пример данных с которыми я работаю, после извлечения из датафрейма и обработки на ненужные симбволы:
asian exporters fear damage from u.s.-japan rift mounting trade friction
between the u.s. and japan has raised fears among many of asia 's exporting
nations that the row could inflict far-reaching economic damage businessmen
and officials said they told reuter correspondents in asian capitals a u.s.
move against japan might boost protectionist sentiment in the u.s. and lead
to curbs on american imports