При обучении Match3 награда во встроенном алгоритме Unity ML-Agents отличается от награды собственного алгоритма на Python

Всем привет! Столкнулся со следующей проблемой: при обучении Match3 награда во встроенном алгоритме PPO Unity ML-Agents (примерно 35) отличается от награды собственного алгоритма на Python (примерно 3). То есть на графиках показываются разные награды, и я не могу понять как это исправить. Реализовано при помощи stable-baselines как в руководстве: https://github.com/Unity-Technologies/ml-agents/blob/1ee83d864856c60d77b9e39f06074adaa04a8a2d/gym-unity/README.md Встроенный PPO Реализация на Python


Ответы (0 шт):