혼합 분포 군집

IT 위키
Mixture Distribution Clustering; 혼합분포군집; GMM
데이터가 여러 확률분포의 가중 선형 결합에서 나왔다고 보고, 각 분포를 하나의 군집으로 삼는 모형 기반 군집 분석

가장 흔한 형태는 정규분포를 섞은 가우시안 혼합 모형(GMM)이다.

  • 군집을 몇 개의 모수로 표현할 수 있다. 각 분포의 평균·분산·혼합계수가 그것이다
  • 확률 분포를 도입하므로 각 개체가 어느 군집에 속할 확률을 준다(소프트 군집)
  • 복잡한 형태의 분포도 여러 분포를 확률적으로 선형 결합해 설명할 수 있다
  • 군집의 크기가 작으면 모수 추정이 어렵고 정밀도가 떨어진다. 작을수록 쉬워지는 것이 아니다
  • 이상치에 민감하다

EM 알고리즘

[편집 | 원본 편집]

모수를 직접 구할 수 없으므로 EM(Expectation-Maximization) 알고리즘으로 반복 추정한다.

  • E 단계 : 현재 모수로 각 개체가 각 분포에 속할 기대 확률을 계산한다
  • M 단계 : 그 확률로 모수(평균·분산·혼합계수)를 다시 추정한다
  • 두 단계를 수렴할 때까지 반복한다
  • 데이터가 커지면 수렴에 걸리는 시간이 길어진다

K-평균과 비교

[편집 | 원본 편집]
구분 혼합 분포 군집 K-평균
할당 확률(소프트) 하나의 군집(하드)
군집 모양 타원 등 유연함 구형에 가까움
기반 확률 모형 거리

같이 보기

[편집 | 원본 편집]