Как удалить ненужные символы из документа?
Я использую данные для обучения и мне нужно избавиться от ненужной информации, а конкретно от XX/XX/XXXX или от XXXX XXXX XXXXX. Я использовал регулярные выражения, которые удаляют числа и другие объекты, которые не являются буквенными, также использовал функцию "стоп слов". Как мне лучше всего избавиться от X-ов?
def tokenLemmat(text):
tokens = [word for sent in nltk.sent_tokenize(text) for word in nltk.word_tokenize(sent)] #Исправить
filtered_tokens = []
for token in tokens:
if re.search('[a-zA-Z]', token):
filtered_tokens.append(token)
lem = [lemmatizer.lemmatize(t) for t in filtered_tokens]
return lem
stopwords = nltk.corpus.stopwords.words('english')
