Построение регрессии для числовых и категориальных признаков

Необходимо оценить Среднее Количество Автомобилей на участке дороги.

Имеются данные о распределении скоростей за некоторый промежуток времени. Зачемечно, что СКА зависит от размера выборки данных скоростей,поэтому регрессия Y = f(x_1) могла бы помочь оценить СКА.

Сложность в том, что другие предикторы так же влияют на СКА, будучи как числовыми (x_2, .., x_k), так и категориальными (c_1 = data provider, c_2 = road class, .., c_m).

Мы считаем, что x_1 влияет на СКА значительно больше, чем другие предикторы. Так же сам предиктор x_1 можем зависеть от других предикторов.

Поэтому мы намерены получить множество регрессий Y = f(x_1) в зависимости от наборов (x_2, .., x_k, c_1, .., c_m).

Количество предикторов k и m невелико (<10).

Имеет ли смысл сперва разбивать датасет на кластеры (x2, .., x_k y_1, .., y_m), а затем находить регрессию Y=f(x_1) для каждого кластера?

Или лучше рассматривать все предикторы (x1, x2, .., x_k, y_1, .., y_m) вместе и ожидать, что x1 получит больший вес, чем остальные?


Ответы (0 шт):