Подсчитать количество каждого слова, использованного в столбце датафрейма
Мне как-то нужно объединить все слова в столбце "tokenized_review" и посчитать количество каждого использованного слова.
Ответы (1 шт):
Автор решения: Farid
→ Ссылка
Если кому-то интересно, нашел ответ: Сперва переобразуем все данные в столбце в string:
new_list = shipping['tokenized_review'].astype(str).tolist()
Далее используем следующее:
import collections, re
bagsofwords = [ collections.Counter(re.findall(r'\w+', txt))
for txt in new_list]
sumbags = sum(bagsofwords, collections.Counter())
sumbags