Метод определения неравномерности распределения значений
Какую методику используют для измерения неравномерности распределения точек на отрезке? Если точнее, то задача такая: есть отрезок множества точек (порядка от сотен тысяч - до нескольких миллионов) равноудаленных друг от друга. На этом отрезке может быть отмечено несколько десятков позиций. Мне нужно найти критерий для оценки неравномерности распределения этих позиций на упомянутом множестве точек с целью сравнения одного варианта распределения с другим. Если есть какой-то общепринятый метод или методы, то буду благодарен за ссылку.
Ответы (1 шт):
Если вы считаете, что ваши данные должны быть равномерно распределены на некотором отрезке, то это значит, что в идеале они подчинены равномерному закону распределения. Реальные данные от этого распределения отличаются. Формально задача формулируется следующим образом: можно ли считать, что распределение выборки (реальных данных) статистически значимо отличается от распределения генеральной совокупности (теоретически).
Есть специальные методы для ответа на этот вопрос, которые используют т.н. критерии проверки согласия. Их много - от хи-квадрат, Колмогорова-Смирнова (это критерии универсальные, работают для любого распределения) до критериев Шермана, Янга, Неймана-Бартона и пр, заточенных именно на равномерное распределение.
Теория описывается в учебниках по статистике, а как хороший справочник рекомендую - Кобзарь А.И. "Прикладная математическая статистика. Для Инженеров и научных работников" (легко находится в сети).
В Python, библиотеке scipy.stats общие методы реализованы в разных вариантах. Если захотите что-то специальное, то запрограммировать тот-же критерий Шермана самому - большого труда не составляет.
Будут вопросы - задавайте.