← Work로 돌아가기

Selected case studies · SYSTEM

생성형 AI(K-Bot) RAG 메타데이터 기반 문서 출처 추적

LLM 답변의 인라인 출처 표기를 청크 메타데이터와 매칭해 실제 문서 근거까지 추적하는 end-to-end 그라운딩 시스템

Role
AI/RAG · Backend
Period
2025.12 ~ 2026.01
Stack
RAG · Metadata design · Svelte

01 / Problem

검색된 문서 전체가 출처처럼 노출되고 실제 답변에 인용된 문장과 문서 위치를 연결하기 어려워, 사용자가 LLM 답변의 근거를 직접 검증하기 힘들었습니다.

02 / Constraints

  1. 01

    LLM의 출처 표기 형식이 매번 완전히 같지 않았습니다.

  2. 02

    PDF 페이지, Excel 행, 텍스트 문서가 서로 다른 위치 체계를 사용했습니다.

  3. 03

    검색·리랭킹을 거쳐도 본문과 출처 메타데이터가 분리되면 안 됐습니다.

03 / Decisions & approach

01

청크 단위 출처 모델

파일·페이지·시트·행 정보를 공통 메타데이터로 정규화했습니다.

02

보완 가능한 매칭

LLM 표기를 정규화한 뒤 정확 매칭과 보완 매칭을 순서대로 적용했습니다.

03

인용된 근거만 노출

검색 후보 전체가 아니라 답변에서 실제로 참조한 출처만 사용자에게 보여줬습니다.

04 / System flow

출처 추적 흐름

  1. 01

    Retrieve

    본문+출처 검색

  2. 02

    Rerank

    메타데이터 유지

  3. 03

    Generate

    인라인 출처 생성

  4. 04

    Match

    정규화·보완 매칭

  5. 05

    Verify

    실제 문서 위치 열기

05 / Outcome

  • 답변의 인라인 출처를 PDF 페이지·Excel 행·텍스트 근거까지 연결했습니다.
  • 사용자는 답변에 실제로 쓰인 근거만 확인할 수 있게 됐습니다.

06 / Lessons

RAG의 신뢰는 출처 목록의 개수가 아니라 답변과 근거 사이의 연결 정확도에서 만들어집니다.