Зачем в кодировке UTF-8 нужны управляющие символы 10?

Зачем в кодировке UTF-8 используются управляющие символы 10, начиная со второго байта, если уже по первому понятно, каким количеством байтов кодируется символ?

Например, если мы начинаем читать байт, видим что он начинается с 110, то тут же понимаем, что надо считать два байта, чтобы получить символ. Читаем два, получаем символ, начинаем читать дальше. Третий байт начинается с 1110, понимаем, что должны считать три байта, чтобы получить символ. Читаем три, преобразуем и так далее.

Т.е. я понимаю, что 10 означает, что байт не является самостоятельным символом, а какой-то частью. Но не понимаю, каким образом это помогает. Разве что если какие-то ошибки при передаче по сети например и программа так понимает, "Хмм, байт начинается с 10, но до этого у меня не было ничего вроде 11100010. Стало быть, что-то потерялось и я не могу этот байт никак обработать, выведу какое-нибудь � вместо этого байта, пусть сами думают".

Правильно ли я предположил или есть другое объяснение наличию 10?


Ответы (0 шт):