Ходить по сайтам из файла и парсить название
Есть список сайтов в текстовом файле. Нужно зайти на каждый сайт и взять название сайта из хедера. Пробовал не просто из файла, а сам задавал название сайта, но не получилось (использовал pandas).
import pandas as pd
tables = pd.read_html("https://site.com/")
print(title)
Ещё не работал с парсерами. Что можете посоветовать?
Ответы (1 шт):
Автор решения: videx
→ Ссылка
import requests
from lxml import html
from bs4 import BeautifulSoup
#получаем данные
r = requests.get("https://google.com")
#создаём html файл
with open('html.html', 'w', encoding="utf-8") as output_file:
output_file.write(r.text)
#открываем html файл
html = open('html.html', encoding="utf-8").read()
soup = BeautifulSoup(html, 'lxml')
#ищем заголовок
title = soup.find('title')
print(title)