Не могу понять в чём проблема с сортировкой информации на сайте во время чтения с Python'а
Никак не могу понять в чём проблема, дебаг не помогает решить.
Мой код (пока) берёт информацию со странички википедии про частотность букв в текстах и засовывает букву в один массив, а процент встречаемости - в другой.
Если с процентом всё вышло, потому что он в таблице и содержит % - я искала строки, где есть ячейка таблицы <td> и % - то с буквой так легко не выходит.
Раз буквы отображаются в окне дебага как b'<td>\xd0\xb5</td>\n', то я ищу в строках \x соответственно, но массив с буквами на выводе программы пустой, и если делать поиск \x отдельной функцией она всегда возвращает 0.
Помогите, пожалуйста, разобраться,
# -*- codecs: utf-8 -*-
import codecs
import urllib.request
link = urllib.request.urlopen('https://ru.wikipedia.org/wiki/%D0%A7%D0%B0%D1%81%D1%82%D0%BE%D1%82%D0%BD%D0%BE%D1%81%D1%82%D1%8C')
# функция, считающая длину строки
def findLen(str):
counter = 0
while str[counter:]:
counter += 1
return counter
percent_w = []
float_percent = []
symb_w = []
# выделение из кода страницы необходимой информации из таблицы частотности
for line in link.readlines():
if line.find(b'<td>') != -1 and findLen(line) == 12 and line.find(b'\\x') != -1:
symb_w.append(line)
if line.find(b'<td>') != -1 and line.find(b'%') != -1 and line.find(b'</a>') == -1:
percent_w.append(line)
link.close()
# перекодировка в utf8
for i in range(len(percent_w)):
percent_w[i] = percent_w[i].decode('utf-8')
symb_w[i] = symb_w[i].decode('utf-8')
# удаление ненужных символов из строки
for i in range(len(percent_w)):
percent_w[i] = percent_w[i].replace('%', '')
percent_w[i] = percent_w[i].replace('<td>', '')
symb_w[i] = symb_w.replace('<td>', '')
symb_w[i] = symb_w.replace('</td>', '')
symb_w[i] = symb_w.replace('/n', '')
for i in range(len(percent_w)):
float_lines = [float(x) for x in percent_w]
print(float_lines)
print(symb_w)
text_percents = []