Как спарсить title c сайтов используя python
Я новичок в python и ни как не могу понять как реализовать следующую задачу.
Есть txt файл с доменами(около 10 000 доменов), сохранены в верхнем регистре. Нужно:
- адреса доменов перенести в нижний регистр
- добавить вначале домена строку 'http://', чтобы домен потом вставить в requests
- сделать цикл, чтобы парсер собрал title с каждого домена(сайта)
- записать все в файл таблицу с двумя полями | url сайта | title сайта |
Ответы (1 шт):
Автор решения: krytoy4el
→ Ссылка
Ну если я правильно понял суть вашего задания то вот.
import requests
from bs4 import BeautifulSoup as bs
f = open(r'file.txt','r+')
a=[]
for i in f:
a.append(i.lower().replace('\n',''))
a[-1]='https://'+a[-1]
f.close()
title_list=[]
for url in a:
r=requests.get(url)
page=bs(r.content,'html.parser')
title=page.find('title')
title_list.append(url)
title_list.append(title.text.replace('\n',''))
print(title_list)