Каким алгоритмом можно воспользоваться чтобы категоризировать назывние переменных к сущствующм ID?

Имеется набор данных о именах переменных и их ID. Стоит задача с помощью машинного обучения натренировать алгоритм категоризовывать новое имя переменной так, чтобы: 1) новому имени переменной присваивался ID той групы переменных, но которую это имя больше похоже 2) новому имени переменной присваивался ID - N/A, в случае неспособности категоризовать новую переменную.

Ожидалось что K-means могбы помочь мне решить такую задачу, но у меня фиксированные кластеры (ID) и плюс N/A. Я так же понял, что возможно "unsupervised learning" мне не подойдёт потому что кластеры заданы (Хотя в самих данных нет ID -> N/A, я думаю как его ввести и как потом можно классифицировать все переменные в категории N/A).

Скриншот из части таблицы: Отрывок из PivotTable с случаем когда для одного ID существуют несколько имен переменных. Таблица с частью данных: введите сюда описание ссылки

Подскажите пожалуйста, как подойти к решению поставленной задачи классификации и какой алгоритм стоит применить?


Ответы (0 шт):