Как исключить ненужные слова регулярным выражением?
Пожалуйста, помогите чайнику разобраться с исключениями в regexp.
Задача обработать одним регулярным выражением список строк,
чтобы на выходе был экстракт только слов, которые стоят перед "</a>" или перед " ".
Строки:
<a href='/'>Нужные слова</a> <span>Какие-то еще слова</span>
<a href='/'>Вот нужные слова абракадабра</a> <span>Какие-то еще слова</span>
<a href='/'>Другие нужные слова</a> <span>Какие-то еще слова</span>
<a href='/'>Ещё нужные слова другие крякозябры</a> <span>Какие-то еще слова</span>
Желаемый результат:
Нужные слова
Вот нужные слова
Другие нужные слова
Ещё нужные слова
Пытаюсь парсить в SEO Spider.
Дальше <a href='/'>(.*?) я не ушел.
Ответы (1 шт):
Автор решения: Alex R.
→ Ссылка
Забыли альтернативу </a>. Главное в этом выражении ? в .*?, он делает выражение не жадным.
<a href='\/'>(.*?)(?: |<\/a>)
Язык не указан, / экранированы \.