컴퓨터 비전
IT 위키
- Computer Vision
- 컴퓨터가 영상과 동영상에서 의미 있는 정보를 추출해 내용을 이해하도록 하는 기술
| 과제 | 내용 |
|---|---|
| 영상 분류(Classification) | 이 사진이 무엇인가 |
| 객체 탐지(Object Detection) | 무엇이 어디에 있는가. 경계상자로 표시. YOLO, Faster R-CNN |
| 의미 분할(Semantic Segmentation) | 픽셀 단위로 어떤 부류인가 |
| 인스턴스 분할 | 같은 부류라도 개체별로 구분. Mask R-CNN |
| 객체 추적(Tracking) | 영상 속에서 같은 객체를 시간에 따라 따라간다 |
| 행동 인식(Action Recognition) | 사람이 무엇을 하고 있는가 |
| 자세 추정(Pose Estimation) | 관절 위치를 찾아 골격을 복원 |
| 3차원 복원 | 여러 시점의 영상에서 깊이와 형상을 복원. SLAM |
| 영상 생성·복원 | 초해상도, 노이즈 제거, 생성 모델 |
- 전처리 — 잡음 제거, 정규화, 히스토그램 평활화
- 특징 추출 — 고전적으로 SIFT, HOG, Haar. 지금은 딥 러닝이 학습으로 대체
- 모델 — CNN(ResNet, EfficientNet), 트랜스포머 기반(ViT, DETR)
- 학습 데이터 — 대규모 레이블링, 데이터 증강
- 경량화·가속 — 양자화, 프루닝, 엣지 추론
- ETRI 가 주관한 국내 대규모 시각지능 연구개발 과제
- 대규모 영상 데이터를 스스로 학습해 사람 수준으로 인식·이해하는 시각지능 원천기술 확보를 목표로 했다
주요 기술요소는 다음과 같다.
- 대규모 시각 데이터 학습 — 레이블이 적은 상황에서의 준지도·자기지도 학습
- 객체 탐지·분할 고도화 — 다수 객체가 겹친 복잡한 장면 처리
- 행동·상황 이해 — 단순 인식을 넘어 장면의 맥락과 사건을 해석
- 실시간 경량화 — 엣지 기기에서 동작하도록 모델을 줄인다
- 응용 — 지능형 CCTV, 재난 감시, 자율주행, 스마트 팩토리의 검사 공정
