• 744B 파라미터와 40B 활성 파라미터, 1M 컨텍스트 윈도우를 갖춘 Z.ai의 새 오픈 모델로, 롱 호라이즌 코딩·추론·에이전트 작업에서 SOTA 성능 제공
  • Unsloth Dynamic GGUF를 통해 로컬 하드웨어에서 실행 가능하며, Claude 4.8 Opus·GPT-5.5·Gemini 3.1 Pro와 대등한 벤치마크 성능 기록
  • Dynamic 1-bit는 86% 작은 크기로 약 76.2% top-1 정확도, Dynamic 2-bit는 84% 작은 크기로 약 82% 정확도 달성, 1.5TB 풀 모델 대비 정확도 손실 최소화
  • 2-bit 양자화 UD-IQ2_M은 239GB로 256GB 통합 메모리 Mac에 탑재 가능하며, Unsloth Studiollama.cpp 두 경로로 구동 지원
  • 저비트 양자화로도 성능을 유지해, 초대형 오픈 모델을 개인·소규모 하드웨어에서 실행할 수 있는 접근성 확보

GLM-5.2 모델 개요

  • Z.ai의 새 오픈 모델로 롱 호라이즌 코딩(여러 단계에 걸쳐 길게 이어지는 코딩 작업), 추론, 에이전트 작업 전반에서 SOTA 성능 제공
  • 744B 파라미터, 40B 활성 파라미터, 1M 컨텍스트 윈도우 구성
  • 현재까지 가장 강력한 오픈 모델로, Artificial Analysis 및 다수 벤치마크에서 Claude 4.8 Opus, GPT-5.5, Gemini 3.1 Pro와 대등한 성능
  • Z.ai가 Unsloth에 day-zero 액세스를 제공함

양자화별 정확도와 크기

  • Dynamic 1-bit는 86% 작은 크기로 약 76.2% top-1 정확도 기록
  • Dynamic 2-bit는 84% 작은 크기로 약 82% 정확도 기록
  • 84% 작아져도 풀 1.5TB 모델 대비 약 18% 정도만 정확도 하락
  • "76% 정확도"의 의미

  • 76% top-1은 "프랑스 수도는"이라는 질문에서 Paris를 76%, Sydney를 24% 고르는 의미가 아님 (Paris는 항상 100%, Sydney는 0%)

  • 76% 수치는 코퍼스 전반의 필러·정지어 분포를 포함, 예를 들어 "Create a novel" 요청 시 [I, The, What] 같은 시작어 분포가 변하는 것
  • 24% 확률로 의미 없는 출력이나 오답이 나오는 것을 의미하지 않음

추론 하드웨어 요구사항

  • 비트별 총 메모리(RAM + VRAM 또는 통합 메모리) 요구량
  • 1-bit: 223GB / 2-bit: 245GB / 3-bit: 290–360GB / 4-bit: 372–475GB / 5-bit: 570GB / 8-bit: 810GB
  • 2-bit 양자화 UD-IQ2_M은 239GB 디스크 사용, 256GB 통합 메모리 Mac에 직접 탑재 가능하며 1x24GB GPU + 256GB RAM에서 MoE 오프로딩으로 동작
  • 최적 성능을 위해 VRAM과 시스템 RAM을 합한 총 가용 메모리가 양자화 모델 파일 크기를 여유 있게 초과해야 함

권장 설정

  • 3가지 thinking 모드 지원: Non-thinking, Thinking High, Thinking Max
  • 복잡한 작업에는 Max Thinking 사용 권장
  • 대부분 작업 기본값: temperature 1.0, top_p 0.95
  • SWE-Bench Pro: temperature 1.0, top_p 1.0
  • 최대 컨텍스트 윈도우: 1,048,576
  • Thinking 비활성화 및 reasoning effort 조정

  • GLM-5.2는 기본적으로 reasoning 사용, reasoning_effort를 "high", "max" 또는 비활성화로 설정 가능

  • thinking 비활성화: --chat-template-kwargs '{"enable_thinking":false}'
  • llama.cpp에서 --reasoning on 또는 --reasoning off로도 제어 가능

양자화 분석 (KLD 벤치마크)

  • 양자화 정확도 측정에 KLD(KL Divergence) 벤치마크 사용
  • Dynamic 4-bit UD-Q4_K_XL과 5-bit UD-Q5_K_XL은 거의 무손실
  • 작은 양자화도 중요 레이어를 높은 정밀도로 남기고 덜 중요한 레이어를 저비트로 처리해 잘 동작
  • 99.9% KLD는 일반적으로 양호하나 4bit 이상에서 상승폭이 커, 대규모 out-of-distribution 작업에는 dynamic 4-bit가 적합
  • mean KLD 사용
  • 전체 학습 코퍼스(예: 15T 토큰) 대상 KLD 실행은 비용이 커, 대표 부분집합을 샘플링해 최적화
  • mean KLD는 디스크 공간 대비 단조 추세를 보이며 1-bit GLM-5.2도 잘 동작함을 보여줌
  • 양자화 목표는 baseline f(W)와 양자화 모델 출력의 "거리"를 최소화하는 것, 0 KLD면 완벽 재구성

Unsloth Studio 실행

  • 로컬 AI용 오픈소스 웹 UI로, 자동 RAM 오프로딩 및 멀티GPU 자동 감지
  • MacOS, Windows, Linux 지원 및 주요 기능
  • GGUF·safetensor 모델 검색·다운로드·실행
  • Self-healing 툴 콜링 + 웹 검색
  • Python·Bash 코드 실행
  • 추론 파라미터(temp, top-p 등) 자동 튜닝
  • llama.cpp 기반 빠른 CPU + GPU 추론
  • LLM을 2배 빠르게, VRAM 70% 절감하며 학습
  • 설치 및 실행

  • 설치 후 unsloth studio -H 0.0.0.0 -p 8888 실행, 브라우저에서 http://127.0.0.1:8888 접속

  • 무료 Cloudflare 터널을 통한 HTTPS 보안 실행은 unsloth studio --secure 사용
  • 첫 실행 시 계정 보안을 위한 비밀번호 생성 필요

llama.cpp 실행

  • 가이드 기준 UD-IQ2_M 양자화는 최소 245GB RAM 필요, 양자화 타입 변경 가능
  • llama.cpp는 ollama run처럼 모델 로드·다운로드 직접 수행
  • 다운로드 속도가 느릴 수 있어 huggingface_hub 통한 수동 다운로드가 더 빠름
  • 2bit는 UD-IQ2_M, 1bit는 UD-IQ1_S 파일 사용
  • GPU 미사용 또는 CPU 추론 시 빌드에서 -DGGML_CUDA=ON-DGGML_CUDA=OFF로 변경, Apple Mac/Metal은 OFF 설정 후 Metal 기본 지원
  • 1-bit 양자화 데모 사례

  • 1-bit 양자화로 짧은 Flappy Bird 게임 생성을 요청한 결과, 사운드가 포함된 정상 동작 게임 생성

  • 해당 데모는 1-bit 양자화임에도 잘 작동함

KV Cache 양자화로 롱 컨텍스트 확보

  • llama.cpp에서 롱 컨텍스트 활용 시 메모리 절감을 위해 KV cache 양자화 적용 필요
  • 최근 llama.cpp가 KV cache 양자화에 고정밀도 기법 추가
  • 지원 KV cache dtype: f32, f16, bf16, q8_0, q4_0, q4_1, iq4_nl, q5_0, q5_1 (기본값 f16)
  • 약 4.5 bits/weight인 q4_0 사용 시 약 3.5배 긴 컨텍스트 확보 (10K → 35K 도달 가능)
  • q4_1은 shifting 파라미터가 있어 더 우수, 5 bits/weight로 약 3.2배 컨텍스트 확장
  • --cache-type-k q4_1 --cache-type-v q4_1 형태로 적용

벤치마크 비교

  • GLM-5.2를 Claude Opus 4.8, GPT-5.5, Gemini 3.1 Pro, GLM-5.1, Qwen3.7-Max, MiniMax M3, DeepSeek-V4-Pro와 비교
  • Reasoning

  • AIME 2026에서 GLM-5.2 99.2로 비교군 중 최고치

  • IMOAnswerBench에서 GLM-5.2 91.0으로 Claude Opus 4.8(83.5)보다 높음
  • HLE 40.5, GPQA-Diamond 91.2, HMMT Feb. 2026 92.5
  • Coding

  • SWE-bench Pro 62.1, Terminal Bench 2.1(Best Reported Harness) 82.7로 비교군 중 높은 수준

  • NL2Repo 48.9, DeepSWE 46.2, ProgramBench 63.7, FrontierSWE(Dominance) 74.4
  • Agentic

  • MCP-Atlas(Public Set) 76.8, Tool-Decathlon 48.2