컴퓨터 비전

IT 위키
Computer Vision
컴퓨터가 영상과 동영상에서 의미 있는 정보를 추출해 내용을 이해하도록 하는 기술

주요 과제

[편집 | 원본 편집]
과제 내용
영상 분류(Classification) 이 사진이 무엇인가
객체 탐지(Object Detection) 무엇이 어디에 있는가. 경계상자로 표시. YOLO, Faster R-CNN
의미 분할(Semantic Segmentation) 픽셀 단위로 어떤 부류인가
인스턴스 분할 같은 부류라도 개체별로 구분. Mask R-CNN
객체 추적(Tracking) 영상 속에서 같은 객체를 시간에 따라 따라간다
행동 인식(Action Recognition) 사람이 무엇을 하고 있는가
자세 추정(Pose Estimation) 관절 위치를 찾아 골격을 복원
3차원 복원 여러 시점의 영상에서 깊이와 형상을 복원. SLAM
영상 생성·복원 초해상도, 노이즈 제거, 생성 모델

기술 요소

[편집 | 원본 편집]
  • 전처리 — 잡음 제거, 정규화, 히스토그램 평활화
  • 특징 추출 — 고전적으로 SIFT, HOG, Haar. 지금은 딥 러닝이 학습으로 대체
  • 모델 — CNN(ResNet, EfficientNet), 트랜스포머 기반(ViT, DETR)
  • 학습 데이터 — 대규모 레이블링, 데이터 증강
  • 경량화·가속 — 양자화, 프루닝, 엣지 추론

딥뷰(DeepView)

[편집 | 원본 편집]
ETRI 가 주관한 국내 대규모 시각지능 연구개발 과제
대규모 영상 데이터를 스스로 학습해 사람 수준으로 인식·이해하는 시각지능 원천기술 확보를 목표로 했다

주요 기술요소는 다음과 같다.

  • 대규모 시각 데이터 학습 — 레이블이 적은 상황에서의 준지도·자기지도 학습
  • 객체 탐지·분할 고도화 — 다수 객체가 겹친 복잡한 장면 처리
  • 행동·상황 이해 — 단순 인식을 넘어 장면의 맥락과 사건을 해석
  • 실시간 경량화 — 엣지 기기에서 동작하도록 모델을 줄인다
  • 응용 — 지능형 CCTV, 재난 감시, 자율주행, 스마트 팩토리의 검사 공정

같이 보기

[편집 | 원본 편집]