Построение прогнозной модели

Что будет с качеством модели, если для ее построения использовать одну из переменных, которая ненормально распределена? Имеет ли она право на существование?


Ответы (2 шт):

Автор решения: passant

Что-то вы путаете. Если в данных есть тренд (рез речь зашла о прогнозе), то данные уже не нормально распределены. Это если мы говорим о временнЫх рядах.

Если вы под прогнозом понимаете регрессию - то тут важно как распределены ошибки, а не сами данные. Но есть и особый класс - т.н. робастные модели, которые устойчивы к выбросам.

Если под прогнозом вы понимаете задачу классификации - то тут все зависит от конкретного метода, некоторые требуют нормальности распределения, некоторые нет.

По качеству модели - это вообще загадка, так как имеется более 10 метрик качества. И они как правило, не зависят от распределения исходных данных.

→ Ссылка
Автор решения: vldminkov

Как правило предикторы с нормальным распределением дают лучшие результаты с любыми моделями(регрессии/классификации/кластеризации). Для приведения к нормальному распределению рекомендую пакет "bestNormalize" (R). Удачи

→ Ссылка