Google cloud vision DOCUMENT_TEXT_DETECTION language hints не работают корректно для русского языка

Работаю с распознаванием текста на документах. Библиотека для .NET Core

var client = ImageAnnotatorClient.Create();
                ImageContext context = new ImageContext();
                foreach (var hints in context.LanguageHints)
                {
                    Console.WriteLine("hint " + hints);
                }
               var response = client.DetectDocumentText(fromBytes, context);

На русском языке есть фраза "Однажды вечером" введите сюда описание изображения

Если я скармливаю этот документ Google DOCUMENT_TEXT_DETECTION без явного указания языка, тогда получаю результат "ОДНАЖДЫ BELEPOM"

Окей, возможно он сомневается в языке, укажем явно, что это русский

  context.LanguageHints.Add("ru");
  var response = client.DetectDocumentText(fromBytes, context);

Результат прежний - второе слово целиком латиницей.

Думаю, как то не так задаю подсказку? Попробуем для примера другие языки

context.LanguageHints.Add("en");
  var response = client.DetectDocumentText(fromBytes, context);

Результат

DAHAYKALI BELEPOM

Т.е. сам функционал подсказок работает, просто видимо русское слово "ВЕЧЕРОМ" распознается с такой низкой достоверностью, что он делает fallback на английский язык.

Вопрос - как вообще запретить ему распознавать слово "Вечером", да и вообще текущий текст, с учётом английского языка? Пусть хоть как пытается русские буквы распознать, пусть и с меньшей достоверностью.


Ответы (0 шт):