☆ 저장 Calinski–Harabasz Index — 군집 간 분산과 군집 내부 분산 비율로 군집 품질을 평가하는 지표
03/15/2026
Calinski–Harabasz Index는 군집 간 분산(Between-cluster variance)과 군집 내부 분산(Within-cluster variance)의 비율을 이용해 군집 품질을 평가하는 지표다. 직관적으로는 군집 간 거리는 멀고, 군집 내부 데이터는 서로 가까울수록 좋은 군집 구조라고 본다. 이 지표는 이런 특성을 수치로 측정하며, 값이 클수록 군집 구조가 잘 형성된 것으로 해석된다.
쉽게 말해: 좋은 군집은 같은 그룹 안의 데이터는 서로 가깝고, 다른 그룹과는 멀리 떨어져 있어야 한다. Calinski–Harabasz Index는 바로 이 두 가지 조건을 동시에 측정해 *“군집이 얼마나 깔끔하게 나뉘어 있는가”*를 숫자로 표현하는 방법이다.
군집 간 분산은 크고 군집 내부 분산은 작을수록 Calinski–Harabasz Index 값은 커진다.
방법 (작동 원리, 특징 등)
-
군집 분산 개념
- 군집 내부 분산은 같은 군집에 속한 데이터들이 얼마나 서로 가까운지를 나타낸다.
- 군집 간 분산은 서로 다른 군집 중심들이 얼마나 떨어져 있는지를 의미한다.
- 좋은 군집 구조에서는 내부 분산은 작고 군집 간 분산은 커야 한다.
- Calinski–Harabasz Index는 이 두 분산의 비율을 이용해 군집 품질을 평가한다.
-
\[ CH = \frac{Tr(B_k)/(k-1)}{Tr(W_k)/(n-k)} \]
\[ W_k = \sum_{i=1}^{k}\sum_{x \in C_i}||x-\mu_i||^2 \]
군집 간 분산과 군집 내부 분산의 비율을 이용해 군집 구조 품질을 계산한다.
-
지표 계산 의미
- Tr(Bk)는 **군집 간 분산(Between-cluster variance)**을 의미한다. 이는 각 군집 중심이 전체 데이터 평균에서 얼마나 떨어져 있는지를 나타낸다.
- 즉 군집 중심들이 서로 멀리 떨어져 있을수록 Tr(Bk) 값은 커지며, 데이터가 서로 다른 그룹으로 잘 분리되어 있다는 뜻이 된다.
- Tr(Wk)는 **군집 내부 분산(Within-cluster variance)**을 의미하며, 같은 군집 안의 데이터가 중심 주변에 얼마나 퍼져 있는지를 나타낸다.
- 군집 내부 데이터가 중심 근처에 촘촘히 모여 있을수록 Tr(Wk) 값은 작아지고, 이는 군집이 잘 형성되어 있다는 의미가 된다.
-
지표 해석 방법
- Calinski–Harabasz Index 값이 클수록 좋은 군집 구조를 의미한다.
- 군집 간 분리가 명확하고 군집 내부 데이터가 밀집된 경우 값이 크게 나타난다.
- 여러 K 값에 대해 계산한 뒤 가장 큰 값을 선택하는 방식으로 활용된다.
- 그래서 최적 군집 수 선택 과정에서도 자주 사용된다.
-
군집 평가 지표와의 관계
- Silhouette Score는 데이터 포인트 단위로 군집 품질을 평가한다.
- Davies–Bouldin Index는 군집 간 분리도와 내부 응집도의 비율을 사용한다.
- Calinski–Harabasz Index는 분산 기반 통계적 지표다.
- 실무에서는 여러 지표를 함께 사용해 군집 품질을 판단한다.
의의와 한계
Calinski–Harabasz Index는 군집 간 분산과 군집 내부 분산을 동시에 고려해 군집 품질을 평가할 수 있는 대표적인 지표다. 계산이 비교적 단순하면서도 군집 구조의 전반적인 품질을 잘 반영하기 때문에 다양한 군집 알고리즘 평가에 활용된다. 특히 여러 군집 수를 비교할 때 값이 가장 큰 경우를 선택하는 방식으로 자주 사용된다. 그러나 데이터가 비구형 형태를 가지거나 군집 밀도가 크게 다른 경우에는 평가가 왜곡될 수 있기 때문에 Silhouette Score나 Davies–Bouldin Index 같은 다른 지표와 함께 해석하는 것이 일반적이다.
먼저 보면 좋은 글 (3/3)
- K-medoids Clustering (K-메도이드 군집화) — 실제 데이터 포인트를 중심으로 군집을 형성하는 이상치에 강한 클러스터링 방법
- Kolmogorov–Smirnov Test (KS Test) — 누적분포의 최대 차이로 두 분포가 같은지 판단하는 검정
- One-sample vs Two-sample KS Test — CDF 최대 차이로 분포 비교 원리
이어서 보면 좋은 글 (0/0)
아직 이어서 볼 글이 없습니다.
같은 주제 글 (8/8)
- Clustering Algorithm (군집 알고리즘) — 정답 없이도 데이터의 숨은 그룹을 찾아 구조를 드러내는 비지도 학습 방법
- Davies–Bouldin Index — 군집 간 분리도와 내부 응집도를 함께 평가하는 군집 품질 지표
- Distribution Approximation (분포 근사) — 보이지 않는 실제 분포를 계산 가능한 모델로 바꿔 학습하는 방법
- Elbow Method (엘보 방법) — K-means에서 최적 군집 수 K를 선택하는 경험적 기준
- Mode-Covering (모드 커버링) — 데이터에 존재하는 패턴을 빠뜨리지 않도록 넓게 포함하려는 근사 성질
- Mode-Seeking (모드 시킹) — 가장 가능성 높은 패턴에 집중해 선명하게 맞추려는 근사 성질
- Silhouette Coefficient (실루엣 계수) — 군집 내부 응집도와 군집 간 분리도를 동시에 측정하는 클러스터링 평가 지표
- DBSCAN — 밀도 기반 군집과 노이즈 구분 알고리즘
관련 개념 글 (4/4)
- Distance-Weighted KNN — 가까운 이웃에 더 큰 가중치를 주는 원리
- K-Nearest Neighbor (K-최근접 이웃) — 가까운 사례를 바탕으로 새 데이터를 분류하고 값을 예측하는 방법
- Covariance and Covariance Matrix (공분산과 공분산 행렬) — 여러 변수가 함께 움직이는 구조를 읽는 방법
- Cohen’s d (코언의 d) — 두 집단 평균 차이를 표준편차로 해석하는 원리
📍 AI 학습 지도에서 현재 위치
이 개념이 AI Universe 전체 구조에서 어디에 있는지 확인할 수 있습니다.
📍 AI Universe에서 현재 위치
☰
초기화 학습 완료 표시 · 로그인 필요 불러오는 중…
🌌 AI Universe
‹
›
⭐ 개념
별을 선택하세요.
« PixelRNN — 픽셀 단위 이미지 생성을…|Clustering Algorithm (군집… »
🔖 태그: calinski-harabasz index · cluster analysis · Clustering Evaluation · k-means clustering · Unsupervised Learning