정보 검색

IT 위키
Information Retrieval; IR; 정보 검색
대량의 자료에서 이용자의 정보 요구에 맞는 자료를 찾아 주는 기술과 방법

검색 모델

[편집 | 원본 편집]
모델 내용
불리언 모델 AND·OR·NOT 으로 조건을 조합한다. 결과가 이분법적이라 순위가 없다
벡터 공간 모델 문서와 질의를 벡터로 보고 코사인 유사도로 순위를 매긴다. TF-IDF 가중치를 쓴다
확률 모델 문서가 적합할 확률을 추정해 순위를 매긴다. BM25 가 대표적이다
언어 모델 문서가 질의를 생성할 확률로 순위를 매긴다
의미 기반(벡터) 검색 임베딩으로 문장의 뜻을 수치화해 유사한 것을 찾는다

브라우징 모델

[편집 | 원본 편집]
이용자가 무엇을 찾을지 명확히 모를 때, 자료 구조를 훑어 가며 원하는 것에 다가가는 방식

질의어를 입력하는 검색(Searching)과 대비된다.

유형 내용 장점 단점
평면 브라우징(Flat) 문서를 한 평면에 늘어놓고 훑는다. 검색 결과 목록이 그 예다 단순하고 직관적이다 자료가 많아지면 전체 구조가 보이지 않는다
구조 안내 브라우징(Structure Guided) 디렉터리·분류 체계 같은 계층 구조를 따라 내려간다 주제 관계가 드러나고 범위를 좁히기 쉽다 분류 체계를 미리 만들어야 하고, 분류가 안 맞으면 찾지 못한다
하이퍼텍스트 브라우징(Hypertext) 문서 사이의 링크를 타고 이동한다. 위키가 그 예다 연관 자료로 자유롭게 확장된다 길을 잃기 쉽다(Lost in Hyperspace). 인지 부하가 크다
  • 실제 서비스는 검색과 브라우징을 함께 제공한다. 검색으로 범위를 좁히고 패싯(Faceted) 브라우징으로 다듬는 방식이 일반적이다

성능 평가

[편집 | 원본 편집]
  • 정확률(Precision) = 검색된 것 중 적합한 것의 비율
  • 재현율(Recall) = 적합한 것 중 검색된 것의 비율
  • F-measure, MAP, nDCG
  • 정확률과 재현율은 대체로 상충한다

같이 보기

[편집 | 원본 편집]