지정해주신 소스 문서 raw/Building the Entire RAG Ecosystem and Optimizing Every Component.md를 바탕으로 ‘다중 표현 인덱싱 (Multi-Representation Indexing)’ 개념에 대한 고품질 한국어 위키 노트를 작성 완료했습니다.

생성된 노트는 다중 표현 인덱싱.md에 저장되었습니다.


📄 작성된 위키 노트 내용 개요

  • 파일 위치: llm-wiki/wiki/다중 표현 인덱싱.md
  • Frontmatter:
    • type: workflow
    • status: draft
    • core: false
    • tags: ['llm', 'rag', 'indexing']
    • sources: ['raw/Building the Entire RAG Ecosystem and Optimizing Every Component.md']
    • created: 2026-08-28 / updated: 2026-08-28

주요 포함 내용:

  1. 한 줄 정의 및 핵심 요지:
    • 검색(Retrieval)용 고밀도 요약 벡터와 생성(Generation)용 원본 부모 문서(Parent Document)를 물리적으로 이원화 및 연결하여 RAG의 청크 사이즈 딜레마(Chunk Size Dilemma)를 극복하는 아키텍처 기술 명시.
  2. 상세 메커니즘:
    • 요약본 벡터 스토어(Chroma)와 원본 대형 문서 저장소(InMemoryByteStore / docstore) 간의 식별키(doc_id) 기반 2단계 매핑 구조 및 MultiVectorRetriever 워크플로우 서술.
    • 관련 인덱싱 기술인 계층적 인덱싱 (RAPTOR) 및 ColBERT와의 비교 분석 포함.
  3. 구체적 코드 예시 및 활용 시나리오:
    • Python 및 LangChain 기반의 MultiVectorRetriever, Chroma, InMemoryByteStore, OpenAIEmbeddings, ChatOpenAI(gpt-3.5-turbo) 실행 코드 제공.
    • 장문 연구 논문/법률 문서 및 개발 코드베이스/API 문서 적용 시나리오 상세 수록.
  4. 충돌 및 한계점 (Trade-offs):
    • 요약 체인 품질 의존성, 초기 LLM 요약 인덱싱 연산 오버헤드, 저장소 이원화에 따른 데이터 정합성 관리 복잡성 기재.
  5. Obsidian 연동 위키링크 및 출처:
    • [[RAG]], [[청크 분할]], [[임베딩]], [[벡터 데이터베이스]], [[계층적 인덱싱]], [[ColBERT]], [[RAG 퓨전]], [[Corrective RAG]], [[3단계 컨텍스트 압축]] 등 관련 개념 노트와 연결.
    • 소스 문서 경로 명시 및 지표/파라미터 인용 출처 표기 (raw/Building the Entire RAG Ecosystem and Optimizing Every Component.md).