← Work로 돌아가기
생성형 AI(K-Bot) RAG 메타데이터 기반 문서 출처 추적
LLM 답변의 인라인 출처 표기를 청크 메타데이터와 매칭해 실제 문서 근거까지 추적하는 end-to-end 그라운딩 시스템
검색된 문서 전체가 출처처럼 노출되고 실제 답변에 인용된 문장과 문서 위치를 연결하기 어려워, 사용자가 LLM 답변의 근거를 직접 검증하기 힘들었습니다.
02 / Constraints
LLM의 출처 표기 형식이 매번 완전히 같지 않았습니다.
PDF 페이지, Excel 행, 텍스트 문서가 서로 다른 위치 체계를 사용했습니다.
검색·리랭킹을 거쳐도 본문과 출처 메타데이터가 분리되면 안 됐습니다.
03 / Decisions & approach
청크 단위 출처 모델
파일·페이지·시트·행 정보를 공통 메타데이터로 정규화했습니다.
보완 가능한 매칭
LLM 표기를 정규화한 뒤 정확 매칭과 보완 매칭을 순서대로 적용했습니다.
인용된 근거만 노출
검색 후보 전체가 아니라 답변에서 실제로 참조한 출처만 사용자에게 보여줬습니다.
04 / System flow
출처 추적 흐름
-
Retrieve
-
Rerank
-
Generate
-
Match
-
Verify
05 / Outcome
- 답변의 인라인 출처를 PDF 페이지·Excel 행·텍스트 근거까지 연결했습니다.
- 사용자는 답변에 실제로 쓰인 근거만 확인할 수 있게 됐습니다.
RAG의 신뢰는 출처 목록의 개수가 아니라 답변과 근거 사이의 연결 정확도에서 만들어집니다.