BS4: парсятся ненужные символы вместе с нужными

Почему парсит кучу ненужных символов вместе с нужным текстом? Обычные способы не помогают

Взял для примера нетрудный для парса сайт auto.ru. Выбрав модель, пасрю каждую карточку по ее характеристикам. И все бы хорошо, но кодировка неправильная. Причем utf-8 не помогает, как обычно. Причем в куче ненужных символов есть нужные, но как оставить только нужные без огромного количества .replace()? Вкратце код (дабы не загромождать, убрал код, который точно правильно выбран, не в нем ошибка)

url_html = requests.Session.get(url=str(url))
soup = bs4.BeautifulSoup(url_html, 'lxml')
container = # выбрать все блоки с карточками

    for block in container:
        self.found.append(Found_row_result(
            title=block.select_one('# первая характеристика').get_text(strip=True),
            summary_cell=block.select_one('# вторая').get_text(strip=True),
            type=block.select_one('# третья').get_text(strip=True),
            price=block.select_one('# четвертая').get_text(strip=True),
            year=block.select_one('# пятая').get_text(strip=True),
            km=block.select_one('# шестая').get_text(strip=True)
        ))
    print(found)

Хедеры использую, такие как user-agent и language. Сам парсер на остальных сайтах отлично работает, но на этом не может справится с кодировкой. Возможно как-то решить? Или есть сайты, которые спарсить все же невозможно в силу этого обстоятельства? Мне это все еще в эксель бы для удоства вывести. Я делаю вывод в .csv файл с кодировкой UTF-8 (переменные file_name и format отдельно задаю). Только толку нет - символы все равно есть.

    with open(file_name + format, 'w', encoding='UTF-8', newline='') as file:
        writer = csv.writer(file, dialect='excel', delimiter=';')
        HEADERS_CSV = {'title', 'summary_cell', 'type', 'price', 'credit', 'year', 'km'}
        writer.writerow(HEADERS_CSV)

        for row in found:
            print(f'Printing {row} in Excel.')
            writer.writerow(row)

Я пробовал все кодировки, ни одна не читает это все. Как решить проблему?введите сюда описание изображения

введите сюда описание изображения

И на будущее, как вообще угадывать кодировки с сайтов, если дело в них? Сразу перекодировать в нужный формат, чтобы в excel лежала таблица, читаемая без проблем.


Ответы (0 шт):