요청하신 ‘컨텍스트 보강 청크 분할’ (Contextualized Chunking) 위키 노트 작성이 성공적으로 완료되었습니다.

생성된 노트 파일


주요 변경 및 기재 내용 요약

  1. 규격화된 Frontmatter 적용

    • type: workflow, status: draft, core: false, sources: ['raw/Building a RAG Pipeline for 10M+ Documents With Near-Zero Hallucination.md'], 생성 및 수정 일자(2026-08-28)를 명확히 적용하였습니다.
  2. 개념 정의 및 상세 워크플로우 기술

    • 고정 길이 청크 분할 시 배경 엔티티(주어/시점 등)가 유실되어 무의미해지는 ‘깡통 청크’ 문제를 예방하는 핵심 메커니즘을 서술했습니다.
    • 텍스트 정규화 및 MinHash LSH(유사도 0.9, 64개 순열) 기반 근사 중복 제거, Qwen3 토크나이저 기반의 문장 경계 보존 StructureAwareChunker(256 타겟, 32 오버랩), LLM 기반 25단어 이하 요약 문장 주입(Contextualizer), 밀집/희소 하이브리드 인덱싱으로 이어지는 4단계 워크플로우를 체계적으로 정리했습니다.
  3. 구체적 수치 및 실증 코드/모델 포함

    • 20,007개 문서를 19,987개 알짜 문서로 정제하고, 평균 125 토큰(p95=236) 규모의 21,259개 청크로 분할하여 로컬 Qwen3-32B(vLLM continuous batching) 및 32개 멀티스레드 워커로 초고속 주입하는 실제 구현 파이프라인 수치 및 Python 예시 코드를 포함했습니다.
    • 텍스트 검증 지표 표기 원칙에 따라 소스 파일 경로(raw/Building a RAG Pipeline for 10M+ Documents With Near-Zero Hallucination.md)를 문단 내에 명기했습니다.
  4. 연관 위키 링크 구축