요청하신 개념 ‘전문가 스트리밍’ (유형: workflow)에 대한 한국어 위키 노트를 고품질로 완결하여 신규 작성했습니다.

작성된 위키 노트 경로: llm-wiki/wiki/전문가 스트리밍.md


📝 주요 작성 내역 요약

  1. Frontmatter 규격 준수:

    • type: workflow
    • status: draft
    • sources: ['raw/16GB Mac mini에서 Qwen 3.5 122B LLM 실행하기 - TurboQuant-MLX를 활용한 MoE 전문가 스트리밍.md']
    • created/updated: 2026-08-27
  2. 핵심 분석 및 상세 워크플로우 구성:

    • 물리 RAM 과 모델 크기의 격리: 16GB RAM 맥 미니(가용 1012GB)에서 54GB 크기(3비트 양자화 기준)의 1,220억 매개변수 MoE 모델(Qwen3.5-122B-A10B)을 Peak RSS 69GB로 구동하는 기법 정리.
    • 단순 지연 로딩(mmap)의 한계 파악: MLX 지연 로딩 시 첫 matmul 단계에서 256개 전체 전문가 가중치가 GPU 메탈 버퍼로 재질화(Materialize)되어 OOM이 발생하는 메커니즘 분석.
    • 저수준 OS 버퍼 차단: fcntl(fd, F_NOCACHE, 1)os.pread를 통한 macOS 커널 통합 페이지 캐시(Page Cache) 메모리 잠식 방지책 포함.
    • 시스템의 물리적 한계점 명확화: RAM 용량이 아닌 Metal GPU Wired-Memory Cap(약 10.5GB)이 진짜 한계선임을 보이고, 이를 회피하기 위한 골디락스 캐시 예산 설정 공식(mlx_peak ≈ 5GB + cache_budget) 제시.
  3. 구체적 코드 및 벤치마크 예시 수록:

    • TurboQuant-MLX CLI 구동 명령어 및 Python API 파이프라인 연동 스크립트 작성.
    • 16GB Mac mini 하드웨어 상에서의 Qwen3.6-35B-A3B vs Qwen3.5-122B-A10B 모델 실측 비교표 수록 (캐시 히트율 44.6%~91.0%, 초당 토큰 속도 등).
  4. 충돌 및 지식 연동: