Каким алгоритмом можно воспользоваться чтобы категоризировать назывние переменных к сущствующм ID?
Имеется набор данных о именах переменных и их ID. Стоит задача с помощью машинного обучения натренировать алгоритм категоризовывать новое имя переменной так, чтобы: 1) новому имени переменной присваивался ID той групы переменных, но которую это имя больше похоже 2) новому имени переменной присваивался ID - N/A, в случае неспособности категоризовать новую переменную.
Ожидалось что K-means могбы помочь мне решить такую задачу, но у меня фиксированные кластеры (ID) и плюс N/A. Я так же понял, что возможно "unsupervised learning" мне не подойдёт потому что кластеры заданы (Хотя в самих данных нет ID -> N/A, я думаю как его ввести и как потом можно классифицировать все переменные в категории N/A).
Скриншот из части таблицы:
Таблица с частью данных:
введите сюда описание ссылки
Подскажите пожалуйста, как подойти к решению поставленной задачи классификации и какой алгоритм стоит применить?