Парсинг сайта в java

Всем привет. Необходимо получать главный текст по ссылке. В этом проблем особо нет, благо json все ещё работает, но проблема в том, что надо получать текст с любого сайта(если текст там есть) и при этом, не нужно получать хлам(комменты, разделы меню, и т.д ) есть ли какое то решение?


Ответы (2 шт):

Автор решения: Александр Артёмов

Если нужно распарсить html, то Jsoup для этой цели подойдет. Там можно задать, какие именно элементы вам нужны.

→ Ссылка
Автор решения: Arty Mart

В общем резюмируя: супер решения для своей проблемы я не нашел, но методом проб и ошибок вывел такой вид селектора для Jsoup

document.select("div[class*='content'] p").text();

Это не поможет получить вам главный текст со всех сайтов в мире, но русскоязычные сайты оно парсит ~ процентов на 70. Может кому будет полезно.

→ Ссылка