Извлечение строк текста из японской новеллы
Пытаюсь извлечь строки с текстом на японском из исходного скрипта в отдельный документ так, чтобы на выходе оставался только текст без кода.
Разобрался, как делать это с файлами на английском, но скрипт отказывается работать, если в файле присутствует японский. Как можно это исправить?
import re
with open('99.iet') as source, open ('99.txt', 'w') as destination:
word = source.read()
for string in word.split('\n'):
wert = "".join(re.findall('(^.*text.*$)',string))
if wert:
destination.write(wert+'\n')
Ответы (1 шт):
Автор решения: Jørgen Vitalsen
→ Ссылка
Решение найдено, спасибо cauf и MaxU за помощь!
import re
with open('99.iet', mode='r', encoding='utf-8') as source, open ('99.txt', mode='w', encoding='utf-8') as destination:
word = source.read()
for string in word.split('\n'):
wert = "".join(re.findall('(^.*text.*$)',string))
if wert:
destination.write(wert+'\n')