bs4 не находит нужные элементы из корейского сайта
Пишу парсер для магазина товаров https://www.coupang.com/, и сразу столкнулся с проблемой, beautiful soup не находит в html странице нужный тег. Код выглядит следующим образом:
from bs4 import BeautifulSoup
headers = {
'accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,image/avif,image/webp,image/apng,*/*;q=0.8,application/signed-exchange;v=b3;q=0.9',
'accept-encoding': 'gzip, deflate, br',
'accept-language': 'ru-RU,ru;q=0.9,en-US;q=0.8,en;q=0.7',
'upgrade-insecure-requests': '1',
'user-agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/85.0.4183.121 Safari/537.36'
}
def get_html(url):
response = requests.get(url,headers=headers)
soup = BeautifulSoup(response.text, 'html.parser')
products = soup.find('div',class_='category-best-unit manclothe')
print(products)
get_html('https://www.coupang.com/')
Я пробовал использовать библиотеку selenium, но там проблема, в том, что разрывается соединение,возможно можно добавить заголовки,как в requests, но я не знаю работает ли это с selenium.
Ответы (1 шт):
Автор решения: RomanR
→ Ссылка
Суп тут не подойдет. Этот код открывает страницу в хроме и прокручивает, чтобы прогрузить скриптовые элементы. И выводит для примера текст по классу "name". Что нужно конкретно вам, реализовывайте уже сами по аналогии.
import time
from selenium import webdriver
from selenium.webdriver.common.keys import Keys
browser = webdriver.Chrome()
browser.get("https://www.coupang.com/")
time.sleep(1)
elem = browser.find_element_by_tag_name("body")
no_of_pagedowns = 30
while no_of_pagedowns:
elem.send_keys(Keys.PAGE_DOWN)
time.sleep(0.3)
no_of_pagedowns-=1
post_elems = browser.find_elements_by_class_name("name")
for i in post_elems:
print(i.text)
Добавка Этот код сохраняет прогруженную страницу и затем уже можно распарсить супом.
main_page = browser.page_source
soup = BeautifulSoup(main_page, "html.parser")
items = soup.find_all('div', class_='category-best-unit manclothe')
print(items)