☆ Сохранить Calinski–Harabasz Index — метрика оценки качества кластеризации по соотношению межкластерной и внутрикластерной дисперсии
07/22/2026
Calinski–Harabasz Index — это метрика оценки качества кластеризации, основанная на соотношении межкластерной дисперсии (Between-cluster variance) и внутрикластерной дисперсии (Within-cluster variance). Интуитивно хорошая кластеризация означает, что разные группы находятся далеко друг от друга, а объекты внутри одной группы расположены близко. Данный показатель измеряет эти характеристики численно, поэтому большее значение индекса указывает на более качественную структуру кластеров.
Проще говоря: хороший результат кластеризации означает, что данные внутри одного кластера должны быть похожими между собой, а разные кластеры должны быть хорошо отделены друг от друга. Calinski–Harabasz Index объединяет эти два условия и показывает числом, «насколько чётко сформированы кластеры».
Чем больше межкластерная дисперсия и меньше внутрикластерная дисперсия, тем выше значение Calinski–Harabasz Index.
Метод (принцип работы и особенности)
-
Понятие кластерной дисперсии
- Внутрикластерная дисперсия показывает, насколько близко расположены объекты внутри одного кластера.
- Межкластерная дисперсия отражает расстояние между центрами различных кластеров.
- Для качественной кластерной структуры желательно иметь небольшую внутреннюю дисперсию и большую межкластерную дисперсию.
- Calinski–Harabasz Index оценивает качество кластеризации на основе соотношения этих двух показателей.
-
\[ CH = \frac{Tr(B_k)/(k-1)}{Tr(W_k)/(n-k)} \]
\[ W_k = \sum_{i=1}^{k}\sum_{x \in C_i}||x-\mu_i||^2 \]
Качество кластерной структуры вычисляется через отношение межкластерной и внутрикластерной дисперсии.
-
Смысл вычисления показателя
- Tr(Bk) обозначает межкластерную дисперсию (Between-cluster variance). Она показывает, насколько центры кластеров удалены от среднего значения всех данных.
- Чем дальше находятся центры различных кластеров друг от друга, тем больше становится значение Tr(Bk). Это означает, что группы данных лучше разделены.
- Tr(Wk) обозначает внутрикластерную дисперсию (Within-cluster variance) и показывает, насколько сильно объекты одного кластера разбросаны вокруг своего центра.
- Если объекты внутри кластера расположены компактно около центра, значение Tr(Wk) уменьшается, что указывает на более качественную кластеризацию.
-
Как интерпретировать показатель
- Большее значение Calinski–Harabasz Index обычно означает более качественную структуру кластеров.
- Высокий показатель появляется, когда кластеры хорошо разделены, а объекты внутри каждой группы расположены компактно.
- На практике индекс рассчитывают для разных значений K и выбирают вариант с максимальным результатом.
- Поэтому метрика часто используется при выборе оптимального количества кластеров.
-
Связь с другими метриками оценки кластеризации
- Silhouette Score оценивает качество кластеризации на уровне отдельных объектов.
- Davies–Bouldin Index использует соотношение между разделением кластеров и их внутренней компактностью.
- Calinski–Harabasz Index является статистической метрикой на основе дисперсии данных.
- В реальных задачах несколько показателей обычно используют совместно для более надёжной оценки кластерной структуры.
Значение и ограничения
Calinski–Harabasz Index является одной из наиболее распространённых метрик для оценки качества кластеризации, поскольку учитывает одновременно различия между кластерами и компактность данных внутри них. Благодаря относительно простой формуле этот показатель широко применяется при сравнении различных алгоритмов кластеризации. Особенно часто его используют при выборе количества кластеров, выбирая значение K с максимальным индексом. Однако при работе с кластерами нестандартной формы или с сильно различающейся плотностью данных результаты могут быть менее точными. Поэтому на практике Calinski–Harabasz Index обычно анализируют вместе с другими метриками, такими как Silhouette Score или Davies–Bouldin Index.
Что стоит прочитать сначала (3/5)
+2
- Davies–Bouldin Index — метрика оценки качества кластеризации по компактности и разделению кластеров
- Elbow Method — выбор оптимального числа кластеров K в K-means с помощью анализа WCSS
- Импутация пропущенных значений — метод заполнения пропусков, чтобы они не ломали модель
- 2.5 Задачи и оценка в машинном обучении
- Class-Specific Explanation — интерпретация причин выбора конкретного класса моделью
Что читать дальше (5/16)
+5
- Scoring Function — как AI-модель оценивает и сравнивает результаты
- Weighted Voting — зачем нужны веса, если простое усреднение не работает? Разбираемся в Soft и Hard Voting
- Subset Accuracy — строгая оценка полного совпадения в Multi-label Classification
- Hamming Loss — как измерять частичные ошибки в Multi-label Classification
- Micro vs Macro Averaging — почему оценка меняется на несбалансированных данных
- ILSVRC (ImageNet Large Scale Visual Recognition Challenge) — эталон распознавания изображений, открывший эпоху глубокого обучения
- Performance Measure (метрика качества) — критерий, позволяющий численно оценить, насколько хорошо работает модель
- Gini Impurity — почему Decision Tree использует этот критерий для разделения данных: расчёт и интуитивное объяснение
- Weighted Average — почему простой средней недостаточно, когда значения имеют разный вес?
- Length Normalization — почему длинные последовательности получают заниженную оценку при генерации
- Verifier Model — как LLM проверяет ответы и повышает их надёжность
- Lost-in-the-Middle — почему LLM с Long Context теряет информацию в середине контекста
- Temperature Scaling — почему вероятности Softmax бывают слишком уверенными
- One-sample vs Two-sample KS Test — сравнение Distribution через максимальное расстояние между CDF
- One-sided vs Two-sided Test — как выбор области отклонения меняет статистический вывод
- Feature Ablation — как на практике проверить, какие features действительно важны. Часть 1 / 3
Статьи по той же теме (0/0)
В этом разделе пока нет других статей.
Связанные понятия (2/2)
- DBSCAN — плотностный алгоритм кластеризации для поиска групп и выявления шума
- Grid Search — полный перебор гиперпараметров для поиска оптимальной конфигурации модели
📍 Место этого понятия на карте изучения ИИ
Посмотрите, где это понятие находится во всей структуре AI Universe.
📍 Текущее положение в AI Universe
☰
Сбросить Показать завершённые · Требуется вход Загрузка…
🌌 AI Universe
‹
›
⭐ Понятие
Выберите звезду.
« PixelRNN — как авторегре…|Алгоритм кластеризации (… »
🔖 Теги: calinski-harabasz index · K-means · Silhouette Score · Unsupervised Learning · Кластеризация · машинное обучение · оценка кластеров