Как удалить ненужные символы из документа?

введите сюда описание изображения

Я использую данные для обучения и мне нужно избавиться от ненужной информации, а конкретно от XX/XX/XXXX или от XXXX XXXX XXXXX. Я использовал регулярные выражения, которые удаляют числа и другие объекты, которые не являются буквенными, также использовал функцию "стоп слов". Как мне лучше всего избавиться от X-ов?

def tokenLemmat(text):
    tokens = [word for sent in nltk.sent_tokenize(text) for word in nltk.word_tokenize(sent)] #Исправить
    filtered_tokens = []
    for token in tokens:
        if re.search('[a-zA-Z]', token):
            filtered_tokens.append(token)
    lem = [lemmatizer.lemmatize(t) for t in filtered_tokens]
    return lem

stopwords = nltk.corpus.stopwords.words('english')

Ответы (0 шт):