Не могу понять в чём проблема с сортировкой информации на сайте во время чтения с Python'а

Никак не могу понять в чём проблема, дебаг не помогает решить.

Мой код (пока) берёт информацию со странички википедии про частотность букв в текстах и засовывает букву в один массив, а процент встречаемости - в другой.

Если с процентом всё вышло, потому что он в таблице и содержит % - я искала строки, где есть ячейка таблицы <td> и % - то с буквой так легко не выходит.

Раз буквы отображаются в окне дебага как b'<td>\xd0\xb5</td>\n', то я ищу в строках \x соответственно, но массив с буквами на выводе программы пустой, и если делать поиск \x отдельной функцией она всегда возвращает 0.

Помогите, пожалуйста, разобраться,

# -*- codecs: utf-8 -*-
import codecs
import urllib.request

link = urllib.request.urlopen('https://ru.wikipedia.org/wiki/%D0%A7%D0%B0%D1%81%D1%82%D0%BE%D1%82%D0%BD%D0%BE%D1%81%D1%82%D1%8C')

# функция, считающая длину строки

def findLen(str):
    counter = 0
    while str[counter:]:
        counter += 1
    return counter


percent_w = []
float_percent = []
symb_w = []
# выделение из кода страницы необходимой информации из таблицы частотности
for line in link.readlines():
    if line.find(b'<td>') != -1 and findLen(line) == 12 and line.find(b'\\x') != -1:
        symb_w.append(line)
    if line.find(b'<td>') != -1 and line.find(b'%') != -1 and line.find(b'</a>') == -1:
        percent_w.append(line)

link.close()
# перекодировка в utf8
for i in range(len(percent_w)):
    percent_w[i] = percent_w[i].decode('utf-8')
    symb_w[i] = symb_w[i].decode('utf-8')

# удаление ненужных символов из строки
for i in range(len(percent_w)):
    percent_w[i] = percent_w[i].replace('%', '')
    percent_w[i] = percent_w[i].replace('<td>', '')
    symb_w[i] = symb_w.replace('<td>', '')
    symb_w[i] = symb_w.replace('</td>', '')
    symb_w[i] = symb_w.replace('/n', '')

for i in range(len(percent_w)):
    float_lines = [float(x) for x in percent_w]

print(float_lines)
print(symb_w)
text_percents = []

Ответы (0 шт):