요청하신 개념 TurboQuant-MLX에 대한 위키 노트를 지정된 스키마, 템플릿 구조, 검증된 지표 표기 규칙, 충돌 분석 및 Obsidian 위키링크 연결 지침에 따라 성공적으로 작성 및 저장하였습니다.

작성된 위키 노트의 파일 경로: TurboQuant-MLX.md


위키 노트 주요 반영 사항

  1. Frontmatter 및 메타데이터 준수

    • type: tool, status: draft, core: false
    • 두 소스 파일 경로를 sources 항목에 명시하고 생성일/수정일을 반영했습니다.
  2. 핵심 분석 내용 통합

    • 3비트 TurboQuant 양자화1.58비트 삼진(Ternary) 양자화 기술의 메커니즘을 상술했습니다.
    • macOS의 F_NOCACHEos.pread 저수준 파일 제어와 Metal Wired-Memory Cap(16GB 기준 10.5GB 제한)의 하드웨어 특성을 명시했습니다.
  3. 두 소스 문서 간의 ’## 충돌’ 분석

    • 35B 모델에 대해 3비트 양자화 시 물리 RAM(18GB) 수용 불가능으로 인해 필수적이었던 디스크 스트리밍 구동 방식이, 포맷 고도화(1.58비트 삼진 양자화 9.4GB)를 거치며 전량 메모리 상주(Fully Resident) 구동 방식으로 전환되는 기술 패러다임 변화/대립을 심도 있게 작성했습니다.
    • GPT-OSS-120B 모델과 같이 이미 4비트 양자화된 원본 가중치에 1.58비트 압축 중첩 시 발생하는 라우팅 실패 및 문맥 붕괴 한계점도 명시했습니다.
  4. 검증 가능한 지표 및 수치 소스 표기

    • 122B / 35B 모델의 메모리 적재량(RSS), 초당 토큰 속도(1 tok/s, 10 tok/s), 캐시 예산, 전문가 히트율(44.6%, 91%) 등 소스 문서의 정확한 벤치마크 데이터를 문단별 소스 출처 괄호 표기와 함께 기술했습니다.
  5. 실전 예시 및 관련 노트 연결

    • Python API 사용법, 122B MoE 스트리밍 CLI, 35B 풀 메모리 상주 CLI, OpenAI 호환 서버 실행 명령어 등 구체적인 코드 예시 3종을 수록했습니다.
    • [[전문가 스트리밍]], [[전문가 혼합 아키텍처]], [[메모리 벽]], [[희소 모델 라우팅 실패]], [[MXFP4]] 등의 위키링크를 자연스럽게 배치하였습니다.