Как вытащить все урлы из файла XML на Python
Есть следующий xml файл со следующим содержанием:
(убрано в html комментарий, см. в режиме редактирования или см. предыдущую ревизию вопроса)
Это далеко не все содержание. Оно огромное. Как мне вытащить все URL из данного файла и сохранить списком? Желательно на PYTHON
Ответы (2 шт):
Автор решения: Vadim.Sharoikin
→ Ссылка
с помощью регулярок в 1 строку
import re
urls = re.findall(r'http(?:s)?://\S+', open('123.xml').read())
print(urls)
Автор решения: Qwertiy
→ Ссылка
Ссылки в тексте надо искать вот так: https://ru.stackoverflow.com/a/594686/178988
Для xml, если считать, что ссылка должна быть полным значением xml-тега или значением атрибута, то при условии отсутствии CDATA отлично упрощается до
[>"]\s*((?:https?:\/\/|ftps?:\/\/|www\.)[^<"]*?)\s*["<]
Только брать надо будет первую группу, а не всё вхождение.