Нейросеть. Почему точность обучения больше 100%

Скажите по какой причине в принципе точность обучения нейросети (tensorflow>keras) может быть больше единицы (больше 100%)?

>>> Итерация 2 из 36  >>>  2021-02-27 09:43:43.045483
F1::1 Op3::1<>Ls2::1<>Ac1::1<>St1::1<>Lr2::1<>Mt3::2
Op=ftrl_004_07 <> Ls=BCE <> Mt=kl_div
Сигналов в обучающей выборке: [1801. 1780. 2859.] > На валидацию [ 360 356 571 ]
Сигналов в тестовой выборке:  [444. 448. 719.]
51/51 [==============================] - 0s 706us/step - loss: 0.5868 - kullback_leibler_divergence: 1.0058

Параметры модели:
Оптимизатор: ftrl_004_07 
Фн.Потерь:   BCE
> Размерность слоёв:
>>> Входной слой = 65
>>>>>> Скрытых слоёв -- 1
>>>>>>>> 1-й слой    = 42
>>>>>>>>>>> активация  = 'selu'
>>> >> слой имеет dropout = 0.3
>>> Выходной слой    = 3
>>>>>>>>>>> активация  = 'softmax'
Метрика = kl_div
<<< Обучение модели длилось: 0:08:07.184815, эпох: 2446 (2397) <<< 2021-02-27 09:51:50.231298

fit  > loss,     accuracy:     [ 0.5820409060    0.9975788593 ]
fit  > val_loss, val_accuracy: [ 0.5890457630    1.0094249249 ]
test > loss,     accuracy:     [ 0.5868121386    1.0058239698 ]

Что бы пояснить

ftrl_004_07 = optimizers.Ftrl(learning_rate_power=-0.7)
BCE = losses.BinaryCrossentropy()
kl_div = metrics.KLDivergence()

Я только могу предположить, что то-то "не срастается" между оптимизатором, потерями и метрикой. И никак не могу найти что с чем нужно использовать... К тому же, приведённый пример ещё не самый странный. Бывает что абсолютно все значения выше единицы. В том числе и потери...

>>> Итерация 8 из 36  >>>  2021-02-27 11:33:47.224657
F1::1 Op3::1<>Ls2::2<>Ac1::1<>St1::1<>Lr2::1<>Mt3::2
Op=ftrl_004_07 <> Ls=KL_div <> Mt=kl_div
Сигналов в обучающей выборке: [1801. 1780. 2859.] > На валидацию [ 360 356 571 ]
Сигналов в тестовой выборке:  [444. 448. 719.]
51/51 [==============================] - 0s 745us/step - loss: 1.0051 - kullback_leibler_divergence: 1.0051

Параметры модели:
Оптимизатор: ftrl_004_07 
Фн.Потерь:   KL_div
> Размерность слоёв:
>>> Входной слой = 65
>>>>>> Скрытых слоёв -- 1
>>>>>>>> 1-й слой    = 42
>>>>>>>>>>> активация  = 'selu'
>>> >> слой имеет dropout = 0.3
>>> Выходной слой    = 3
>>>>>>>>>>> активация  = 'softmax'
Метрика = kl_div
<<< Обучение модели длилось: 0:04:38.388074, эпох: 1349 (1300) <<< 2021-02-27 11:38:25.613730

fit  > loss,     accuracy:     [ 0.9976955652    0.9976955652 ]
fit  > val_loss, val_accuracy: [ 1.0087591410    1.0087591410 ]
test > loss,     accuracy:     [ 1.0051449537    1.0051449537 ]

Ответы (0 шт):