Извлечение из множества временных серий подмножества наиболее скоррелированных
Задача стоит следующая - есть N временных серий, из них нужно выбрать кластер из K наиболее взаимно скоррелированных. Вот примерный вид входа (8 серий, слева) и выхода(3 серии, справа):

Как делаю сейчас - строю матрицу корреляций, и по ней иерархическую кластеризацию. Но не всегда очевидно, как потом из данных кластеризации отобрать нужное число серий. Возможно, стоит попробовать другие варианты кластеризации? Или попробовать посчитать какую-нибудь метрику для всех отдельных подмножеств из набора серий и выбрать наилучшее подмножество? Тогда какая метрика будет лучше?
Ответы (1 шт):
Кластеризация временных рядов - не такая простая задача, как кажется. Там имеет значение все, от того, как вы выберете метрику различия самих рядов, до того, какой алгоритм кластеризации вы применете. Тут невозможно дать вам исчерпывающий ответ. Загуглите "Saeed Aghabozorgi. Time-seriesclustering – A decadereview" - это один из последних обзоров по этой теме. Посмотрите, может что и сгодиться, или появятся какие идеи.