Парсинг сайта в java
Всем привет. Необходимо получать главный текст по ссылке. В этом проблем особо нет, благо json все ещё работает, но проблема в том, что надо получать текст с любого сайта(если текст там есть) и при этом, не нужно получать хлам(комменты, разделы меню, и т.д ) есть ли какое то решение?
Ответы (2 шт):
Автор решения: Александр Артёмов
→ Ссылка
Если нужно распарсить html, то Jsoup для этой цели подойдет. Там можно задать, какие именно элементы вам нужны.
Автор решения: Arty Mart
→ Ссылка
В общем резюмируя: супер решения для своей проблемы я не нашел, но методом проб и ошибок вывел такой вид селектора для Jsoup
document.select("div[class*='content'] p").text();
Это не поможет получить вам главный текст со всех сайтов в мире, но русскоязычные сайты оно парсит ~ процентов на 70. Может кому будет полезно.