Создать токены из слов между которыми нету пробелов?
Есть признак - TOP_RANK, в котором текстом определяется признак для определённого ID клиента. Вот пример:
'Data: 200 F=100MB,24H'
'On net 200F=Unlimited _call24H'
'Data:1000F=5GB,7d'
'MIXT: 200mnoff net _unl on net _5Go;30d'
Есть предложения с пробелами а есть предложения без пробелов. Как мне лучше создать токены разделяя предложение по определённым символам, например -":", или -";"? NLTK или создаёт одно слово из признака или разделяет по словам.