정보 검색
IT 위키
- Information Retrieval; IR; 정보 검색
- 대량의 자료에서 이용자의 정보 요구에 맞는 자료를 찾아 주는 기술과 방법
| 모델 | 내용 |
|---|---|
| 불리언 모델 | AND·OR·NOT 으로 조건을 조합한다. 결과가 이분법적이라 순위가 없다 |
| 벡터 공간 모델 | 문서와 질의를 벡터로 보고 코사인 유사도로 순위를 매긴다. TF-IDF 가중치를 쓴다 |
| 확률 모델 | 문서가 적합할 확률을 추정해 순위를 매긴다. BM25 가 대표적이다 |
| 언어 모델 | 문서가 질의를 생성할 확률로 순위를 매긴다 |
| 의미 기반(벡터) 검색 | 임베딩으로 문장의 뜻을 수치화해 유사한 것을 찾는다 |
- 이용자가 무엇을 찾을지 명확히 모를 때, 자료 구조를 훑어 가며 원하는 것에 다가가는 방식
질의어를 입력하는 검색(Searching)과 대비된다.
| 유형 | 내용 | 장점 | 단점 |
|---|---|---|---|
| 평면 브라우징(Flat) | 문서를 한 평면에 늘어놓고 훑는다. 검색 결과 목록이 그 예다 | 단순하고 직관적이다 | 자료가 많아지면 전체 구조가 보이지 않는다 |
| 구조 안내 브라우징(Structure Guided) | 디렉터리·분류 체계 같은 계층 구조를 따라 내려간다 | 주제 관계가 드러나고 범위를 좁히기 쉽다 | 분류 체계를 미리 만들어야 하고, 분류가 안 맞으면 찾지 못한다 |
| 하이퍼텍스트 브라우징(Hypertext) | 문서 사이의 링크를 타고 이동한다. 위키가 그 예다 | 연관 자료로 자유롭게 확장된다 | 길을 잃기 쉽다(Lost in Hyperspace). 인지 부하가 크다 |
- 실제 서비스는 검색과 브라우징을 함께 제공한다. 검색으로 범위를 좁히고 패싯(Faceted) 브라우징으로 다듬는 방식이 일반적이다
- 정확률(Precision) = 검색된 것 중 적합한 것의 비율
- 재현율(Recall) = 적합한 것 중 검색된 것의 비율
- F-measure, MAP, nDCG
- 정확률과 재현율은 대체로 상충한다
