한 줄 정의

거대 언어 모델(LLM)의 가중치를 -c, 0, +c라는 세 개의 값(trit)으로만 저장하여 32비트 워드당 20개의 trit를 압축하는 극단적인 모델 경량화 기법이다.

핵심 요지

  • 가중치를 단 세 개의 값으로 묶어 저장하면 log₂ 3 ≈ 1.58비트의 정보량만 차지하게 되며, 기존 4비트 양자화보다도 절반 이하로 크기를 줄일 수 있다.
  • 70GB 크기의 Qwen3.6-35B 모델을 9.4GB로 압축하여 16GB 메모리를 가진 기본형 M4 Mac mini에서도 온전히 메모리에 올려(fully resident) 구동할 수 있게 만든다.
  • 정보 압축의 손실을 흡수할 수 있는 특정 조건(풍부한 전문가(Expert) 수, 넉넉한 라우팅, 정밀도를 유지한 원본 모델)을 만족하는 Mixture of Experts(MoE) 구조에서 특히 잘 작동한다.

상세

과거에는 메모리가 부족한 기기에서 거대 모델을 구동하기 위해 디스크에서 모델 가중치를 실시간으로 읽어오는 ‘스트리밍(Streaming)’ 방식을 사용했으나, 이는 느린 초기 로딩과 설정의 복잡함을 동반했다. 반면 1.58-bit 삼진 양자화 모델은 극단적으로 압축되어 하드 드라이브 스트리밍 없이 모델 전체가 RAM 안에 거주할 수 있다. TurboQuant-MLX 등 Apple의 MLX 프레임워크를 기반으로 한 엔진을 통해 Mac에서 쉽게 적용 가능하다. 단, 극한 압축 상태이므로 추론 과정을 작성하는 ‘생각(thinking)’ 단계에서 엉뚱한 방향으로 빠지거나 반복 출력하는 한계가 생길 수 있다.

예시

  • Qwen3.6-35B 구동: 350억 파라미터의 거대 모델을 터미널 명령어 두 줄만으로 9.4GB 크기로 변환하여 16GB Mac mini에서 초당 10토큰 속도로 동작시킨다.
  • GPU 연산 트레이드오프: 저장 공간은 절반으로 줄지만, 삼진법 숫자를 풀기 위해 추가 연산이 필요하므로 초당 토큰 생성 속도는 일부 감소할 수 있다.

관련 노트