혼합 분포 군집
IT 위키
- Mixture Distribution Clustering; 혼합분포군집; GMM
- 데이터가 여러 확률분포의 가중 선형 결합에서 나왔다고 보고, 각 분포를 하나의 군집으로 삼는 모형 기반 군집 분석
가장 흔한 형태는 정규분포를 섞은 가우시안 혼합 모형(GMM)이다.
- 군집을 몇 개의 모수로 표현할 수 있다. 각 분포의 평균·분산·혼합계수가 그것이다
- 확률 분포를 도입하므로 각 개체가 어느 군집에 속할 확률을 준다(소프트 군집)
- 복잡한 형태의 분포도 여러 분포를 확률적으로 선형 결합해 설명할 수 있다
- 군집의 크기가 작으면 모수 추정이 어렵고 정밀도가 떨어진다. 작을수록 쉬워지는 것이 아니다
- 이상치에 민감하다
모수를 직접 구할 수 없으므로 EM(Expectation-Maximization) 알고리즘으로 반복 추정한다.
- E 단계 : 현재 모수로 각 개체가 각 분포에 속할 기대 확률을 계산한다
- M 단계 : 그 확률로 모수(평균·분산·혼합계수)를 다시 추정한다
- 두 단계를 수렴할 때까지 반복한다
- 데이터가 커지면 수렴에 걸리는 시간이 길어진다
| 구분 | 혼합 분포 군집 | K-평균 |
|---|---|---|
| 할당 | 확률(소프트) | 하나의 군집(하드) |
| 군집 모양 | 타원 등 유연함 | 구형에 가까움 |
| 기반 | 확률 모형 | 거리 |
