리랭킹(Reranking)이란? AI가 찾은 문서의 순서를 더 정확히 고르는 방법
TL;DR
리랭킹(Reranking)은 AI 검색이 먼저 찾아낸 문서 후보를 질문의 뜻과 더 잘 맞는 순서로 다시 정렬하는 단계입니다. 검색 범위를 새로 넓히는 기능이라기보다, 이미 찾은 후보 중에서 지금 질문에 더 알맞은 자료를 위로 올리는 일에 가깝습니다. RAG나 사내 문서 검색의 답변 품질을 점검할 때 자주 만나는 개념입니다.
핵심 3줄 요약
- 핵심 1
리랭킹은 첫 검색 결과를 그대로 쓰지 않고, 질문과 문서의 관련성을 한 번 더 비교해 순서를 조정합니다. - 핵심 2
벡터 검색은 후보를 찾는 단계이고, 리랭킹은 그 후보 중 무엇을 먼저 보여 주거나 AI에게 전달할지 고르는 단계입니다. - 핵심 3
리랭킹이 있어도 오래됐거나 틀린 문서를 정답으로 바꿔 주지는 않습니다. 원문 품질, 최신성, 권한, 출처 검증은 따로 관리해야 합니다.
이 글에서 다룰 내용
- 리랭킹의 한 문장 정의와 AI 검색에서 필요한 이유
- 사내 문서 검색과 RAG로 보는 쉬운 예시
- 벡터 검색, 임베딩, RAG, 재검색과의 차이
- 리랭킹 결과를 실제 서비스에 쓰는 방법
- 점수와 순서를 해석할 때의 주의점
리랭킹의 한 문장 정의
리랭킹은 검색 시스템이 먼저 찾아낸 문서 후보를 질문과의 의미적 관련성에 따라 다시 점수화하고 순서를 조정하는 과정입니다.
AI 검색은 한 번에 모든 문서를 깊게 비교하면 느려질 수 있습니다. 그래서 보통 첫 단계에서 키워드, 벡터 유사도, 또는 둘을 합친 방식으로 후보를 넓게 찾습니다. 그다음 리랭커가 질문과 후보 문서 내용을 더 자세히 비교해 상위 결과의 순서를 바꿉니다.
Microsoft의 Azure AI Search 문서는 시맨틱 랭커가 초기 BM25 또는 RRF 결과 집합에 2차 순위를 적용한다고 설명합니다. Google Cloud도 Vertex AI Ranking API를 검색·RAG에서 가져온 레코드를 질문에 맞춰 다시 순위화하는 API로 안내합니다. 제품마다 구현은 다르지만, 핵심 역할은 같습니다. 첫 검색의 후보를 더 정교하게 줄 세우는 것입니다.
핵심 인사이트: 리랭킹은 “더 많이 찾기”보다 “이미 찾은 것 중 무엇을 먼저 쓸지”에 집중하는 단계입니다.
AI 검색에서 리랭킹이 왜 중요한가요?
문서 제목이나 단어가 비슷하다고 해서 질문의 답이 되는 것은 아닙니다. 예를 들어 “환불 가능한 기간이 바뀐 상품”을 찾는데, 검색 결과에 “환불”, “기간”, “상품”이라는 단어가 많이 들어간 오래된 공지와 최신 정책 문서가 함께 나올 수 있습니다. 첫 검색은 둘 다 후보로 잡을 수 있습니다.
리랭킹은 질문 전체의 맥락을 보고 최신 정책을 설명한 문서, 예외 조건을 담은 문서처럼 실제 답에 더 가까운 후보를 위로 올리는 데 도움을 줍니다. 문서가 길고 표현이 제각각인 사내 지식 검색, 고객 지원 검색, RAG 챗봇에서 특히 유용합니다.
다만 리랭킹은 모든 자료를 처음부터 다시 뒤지는 기능이 아닙니다. Azure AI Search의 시맨틱 랭커도 초기 결과 중 상위 후보만 다시 평가합니다. 첫 검색에서 좋은 문서를 후보군에 넣지 못하면 리랭킹도 그 문서를 위로 올릴 수 없습니다.
한 줄 정리: 리랭킹 품질은 리랭커만의 문제가 아닙니다. 첫 검색 후보, 문서 내용, 메타데이터, 권한 필터가 함께 받쳐 줘야 합니다.
쉬운 예시로 이해하기
감자나라ai님이 사내 문서에 “신규 고객의 첫 주문 취소 조건은 무엇인가요?”라고 물었다고 가정해 보겠습니다.
첫 검색은 “신규 고객”, “첫 주문”, “취소”, “조건”과 비슷한 문서를 열 개 찾습니다. 그 안에는 과거 이벤트 공지, 일반 취소 정책, 첫 주문 쿠폰 안내, 최신 취소 정책이 섞여 있을 수 있습니다. 이때 리랭킹은 질문에 직접 답하는 문서가 위쪽에 오도록 후보 열 개의 순서를 다시 조정합니다. RAG는 이 상위 문서 몇 개를 모델의 참고 자료로 넣어 답변을 만들 수 있습니다.
같은 구조는 파일 검색 기능, 쇼핑 검색, 고객 상담 보조, 내부 위키 검색에도 적용할 수 있습니다. 핵심은 AI가 문서 전체를 외워 답하는 것이 아니라, 먼저 찾아낸 후보 중 더 관련 있는 자료를 고른다는 점입니다.
예시: 첫 검색 결과가 “일반 취소 정책 → 쿠폰 안내 → 최신 첫 주문 취소 정책” 순서라면, 리랭킹 뒤에는 “최신 첫 주문 취소 정책 → 일반 취소 정책 → 쿠폰 안내”처럼 바뀔 수 있습니다.
벡터 검색, 임베딩, RAG와 무엇이 다른가요?
임베딩은 의미를 숫자로 바꾸는 표현입니다
임베딩은 문장이나 문서의 의미를 숫자 벡터로 나타낸 값입니다. 검색 시스템은 질문과 문서의 임베딩을 비교해 의미가 가까운 후보를 빠르게 찾을 수 있습니다. 리랭킹은 임베딩 그 자체가 아니라, 찾아낸 후보의 우선순위를 다시 정하는 후속 단계입니다.
벡터 검색은 후보를 찾는 방법입니다
벡터 검색은 질문과 의미가 가까운 문서를 후보로 가져오는 검색 방식입니다. 리랭킹은 키워드 검색, 벡터 검색, 하이브리드 검색으로 얻은 결과를 다시 정렬할 수 있습니다. 따라서 벡터 검색과 리랭킹은 경쟁 관계가 아니라 앞뒤로 이어질 수 있는 역할입니다.
RAG는 검색 결과를 답변에 쓰는 전체 구조입니다
RAG는 관련 자료를 검색하고 그 자료를 바탕으로 생성형 AI가 답하도록 만드는 방식입니다. 리랭킹은 RAG 안에서 어떤 문서를 모델에 넣을지 고르는 부품이 될 수 있습니다. 리랭킹만으로 답변이 생성되는 것은 아닙니다.
재검색은 후보군을 다시 찾는 일입니다
리랭킹은 기존 후보의 순서를 바꿉니다. 반면 검색어 확장, 필터 변경, 다른 인덱스 조회처럼 후보군 자체를 새로 만드는 작업은 재검색에 가깝습니다. 둘을 같이 쓰기도 하지만 같은 기능은 아닙니다.
비교 정리: 임베딩은 의미의 숫자 표현, 벡터 검색은 후보 찾기, 리랭킹은 후보 순서 조정, RAG는 자료를 찾아 답변에 활용하는 전체 흐름입니다.
리랭킹은 실제로 어떻게 활용하나요?
AI 검색이나 RAG를 만들 때는 아래 흐름으로 생각하면 이해하기 쉽습니다.
- 문서를 적당한 단위로 나누고 제목, 날짜, 권한 같은 메타데이터를 붙입니다.
- 키워드·벡터·하이브리드 검색으로 질문과 관련된 후보를 넓게 가져옵니다.
- 리랭커로 상위 후보의 관련성을 다시 비교합니다.
- 다시 정렬된 결과 중 필요한 수만 화면에 보여 주거나 생성형 AI의 참고 자료로 넣습니다.
- 실제 질문 사례로 결과를 검토하고, 틀린 문서가 상위에 오는 이유를 확인합니다.
Google Cloud의 Ranking API 문서처럼 리랭커는 질문과 레코드 목록을 받아 순위화하는 형태로 제공되기도 합니다. Azure AI Search는 시맨틱 랭커 결과에 별도 재정렬 점수를 포함할 수 있습니다. 어느 제품을 쓰든, 상위 몇 개를 다시 평가할지, 무엇을 최종 답변 근거로 쓸지, 권한 없는 문서를 처음부터 제외했는지를 정해야 합니다.
실전 팁: 리랭킹을 켜기 전에 실제 사용자 질문 20~50개와 기대 문서를 모아 두세요. 리랭킹 전후에 상위 3개 결과가 얼마나 달라지는지 보면 설정의 효과를 더 현실적으로 판단할 수 있습니다.
리랭킹 점수와 순서를 어떻게 해석해야 하나요?
리랭커 점수는 보통 같은 요청 안에서 후보의 관련성을 비교하는 신호입니다. 서로 다른 서비스, 모델 버전, 인덱스 설정, 질문 길이까지 같은 기준으로 비교할 수 있는 절대 점수라고 단정하면 안 됩니다. Microsoft 문서도 인프라 조건과 랭킹 모델 업데이트에 따라 점수 분포가 달라질 수 있으므로 너무 세밀한 임계값을 피하라고 안내합니다.
점수가 높은 문서도 오래됐거나 권한상 보여 주면 안 되는 자료일 수 있습니다. 리랭킹은 사실 검증, 최신성 판정, 개인정보 필터링, 권한 통제를 대신하지 않습니다. 특히 RAG에서는 검색 결과가 좋아 보여도 모델이 내용을 잘못 요약하거나 출처를 빠뜨릴 수 있으므로, 답변과 인용 위치를 함께 점검해야 합니다.
주의: 리랭킹은 문서의 진실성이나 안전성을 보증하지 않습니다. 관련성 순서를 돕는 기능일 뿐, 정확성·최신성·권한 검증은 별도 단계로 남습니다.
자주 묻는 질문
Q1. 리랭킹이 있으면 벡터 검색은 필요 없나요?
아닙니다. 리랭킹은 보통 먼저 찾아낸 후보를 다시 정렬합니다. 벡터 검색이나 키워드 검색, 하이브리드 검색은 좋은 후보를 가져오는 역할을 합니다. 첫 후보군이 부실하면 리랭킹도 한계가 있습니다.
Q2. 리랭킹은 RAG와 같은 말인가요?
아닙니다. RAG는 검색 자료를 생성형 AI 답변에 활용하는 전체 방식입니다. 리랭킹은 RAG에서 참고 자료의 우선순위를 조정하는 단계 중 하나가 될 수 있습니다.
Q3. 리랭킹을 쓰면 AI 환각이 없어지나요?
아닙니다. 관련 문서를 더 잘 고르면 답변 근거가 나아질 수는 있지만, 문서 자체의 오류나 오래된 내용, 모델의 잘못된 해석까지 자동으로 없애지는 못합니다. 출처 표시와 사람 검토가 필요합니다.
Q4. 리랭킹 점수에 공통 합격선을 정해도 되나요?
서비스와 설정에 따라 점수 분포가 달라질 수 있어 공통 숫자 하나를 그대로 적용하기 어렵습니다. 실제 질문과 기대 결과로 테스트한 뒤, 서비스별로 보수적인 기준을 정하는 편이 안전합니다.
Q5. 작은 문서 검색에도 리랭킹이 필요한가요?
문서 수가 적고 키워드가 뚜렷하다면 효과가 크지 않을 수 있습니다. 표현이 다양하고 문서가 길거나 비슷한 자료가 많아 상위 결과의 순서가 자주 어긋날 때 우선 검토해 볼 만합니다.
출처
마무리
리랭킹은 AI 검색이 찾은 후보를 질문에 더 맞는 순서로 다시 고르는 과정입니다. 검색 결과가 “관련은 있어 보이지만 첫 번째로 보기에는 아쉬운” 상황을 줄이는 데 도움이 됩니다.
처음 도입할 때는 리랭킹 점수만 보지 말고, 실제 질문에서 상위 문서가 왜 선택됐는지 원문과 함께 확인하세요. 좋은 후보 검색, 정확한 문서 관리, 권한 필터, 최신성 점검, 출처 확인이 이어질 때 리랭킹도 제 역할을 합니다.
