요청하신 개념 ‘전문가 스트리밍’ (유형: workflow)에 대한 한국어 위키 노트를 고품질로 완결하여 신규 작성했습니다.
작성된 위키 노트 경로: llm-wiki/wiki/전문가 스트리밍.md
📝 주요 작성 내역 요약
-
Frontmatter 규격 준수:
type:workflowstatus:draftsources:['raw/16GB Mac mini에서 Qwen 3.5 122B LLM 실행하기 - TurboQuant-MLX를 활용한 MoE 전문가 스트리밍.md']created/updated:2026-08-27
-
핵심 분석 및 상세 워크플로우 구성:
- 물리 RAM 과 모델 크기의 격리: 16GB RAM 맥 미니(가용 10
12GB)에서 54GB 크기(3비트 양자화 기준)의 1,220억 매개변수 MoE 모델(Qwen3.5-122B-A10B)을 Peak RSS 69GB로 구동하는 기법 정리. - 단순 지연 로딩(
mmap)의 한계 파악: MLX 지연 로딩 시 첫 matmul 단계에서 256개 전체 전문가 가중치가 GPU 메탈 버퍼로 재질화(Materialize)되어 OOM이 발생하는 메커니즘 분석. - 저수준 OS 버퍼 차단:
fcntl(fd, F_NOCACHE, 1)및os.pread를 통한 macOS 커널 통합 페이지 캐시(Page Cache) 메모리 잠식 방지책 포함. - 시스템의 물리적 한계점 명확화: RAM 용량이 아닌
Metal GPU Wired-Memory Cap(약 10.5GB)이 진짜 한계선임을 보이고, 이를 회피하기 위한 골디락스 캐시 예산 설정 공식(mlx_peak ≈ 5GB + cache_budget) 제시.
- 물리 RAM 과 모델 크기의 격리: 16GB RAM 맥 미니(가용 10
-
구체적 코드 및 벤치마크 예시 수록:
- TurboQuant-MLX CLI 구동 명령어 및 Python API 파이프라인 연동 스크립트 작성.
- 16GB Mac mini 하드웨어 상에서의 Qwen3.6-35B-A3B vs Qwen3.5-122B-A10B 모델 실측 비교표 수록 (캐시 히트율 44.6%~91.0%, 초당 토큰 속도 등).
-
충돌 및 지식 연동:
- 기존 위키 노트인 전문가 혼합 아키텍처 및 메모리 벽의 “가중치가 디스크로 오프로드되면 PCIe 대역폭 병목으로 인해 토큰 생성 속도가 수 초~수 분 단위로 마비되어 오프로딩이 불가능하다”는 주장과 전문가 스트리밍 워크플로우가 이루어낸 실용적 반증 간의 충돌 섹션 기재.
- 전문가 혼합 아키텍처, 메모리 벽, MXFP4, 공개 가중치 모델 등 다수의 내부 Obsidian 링크 연결 완료.