- 744B 파라미터와 40B 활성 파라미터, 1M 컨텍스트 윈도우를 갖춘 Z.ai의 새 오픈 모델로, 롱 호라이즌 코딩·추론·에이전트 작업에서 SOTA 성능 제공
- Unsloth Dynamic GGUF를 통해 로컬 하드웨어에서 실행 가능하며, Claude 4.8 Opus·GPT-5.5·Gemini 3.1 Pro와 대등한 벤치마크 성능 기록
- Dynamic 1-bit는 86% 작은 크기로 약 76.2% top-1 정확도, Dynamic 2-bit는 84% 작은 크기로 약 82% 정확도 달성, 1.5TB 풀 모델 대비 정확도 손실 최소화
- 2-bit 양자화 UD-IQ2_M은 239GB로 256GB 통합 메모리 Mac에 탑재 가능하며, Unsloth Studio와 llama.cpp 두 경로로 구동 지원
- 저비트 양자화로도 성능을 유지해, 초대형 오픈 모델을 개인·소규모 하드웨어에서 실행할 수 있는 접근성 확보
GLM-5.2 모델 개요
- Z.ai의 새 오픈 모델로 롱 호라이즌 코딩(여러 단계에 걸쳐 길게 이어지는 코딩 작업), 추론, 에이전트 작업 전반에서 SOTA 성능 제공
- 744B 파라미터, 40B 활성 파라미터, 1M 컨텍스트 윈도우 구성
- 현재까지 가장 강력한 오픈 모델로, Artificial Analysis 및 다수 벤치마크에서 Claude 4.8 Opus, GPT-5.5, Gemini 3.1 Pro와 대등한 성능
- Z.ai가 Unsloth에 day-zero 액세스를 제공함
양자화별 정확도와 크기
- Dynamic 1-bit는 86% 작은 크기로 약 76.2% top-1 정확도 기록
- Dynamic 2-bit는 84% 작은 크기로 약 82% 정확도 기록
- 84% 작아져도 풀 1.5TB 모델 대비 약 18% 정도만 정확도 하락
-
"76% 정확도"의 의미
-
76% top-1은 "프랑스 수도는"이라는 질문에서 Paris를 76%, Sydney를 24% 고르는 의미가 아님 (Paris는 항상 100%, Sydney는 0%)
- 76% 수치는 코퍼스 전반의 필러·정지어 분포를 포함, 예를 들어 "Create a novel" 요청 시 [I, The, What] 같은 시작어 분포가 변하는 것
- 24% 확률로 의미 없는 출력이나 오답이 나오는 것을 의미하지 않음
추론 하드웨어 요구사항
- 비트별 총 메모리(RAM + VRAM 또는 통합 메모리) 요구량
- 1-bit: 223GB / 2-bit: 245GB / 3-bit: 290–360GB / 4-bit: 372–475GB / 5-bit: 570GB / 8-bit: 810GB
- 2-bit 양자화 UD-IQ2_M은 239GB 디스크 사용, 256GB 통합 메모리 Mac에 직접 탑재 가능하며 1x24GB GPU + 256GB RAM에서 MoE 오프로딩으로 동작
- 최적 성능을 위해 VRAM과 시스템 RAM을 합한 총 가용 메모리가 양자화 모델 파일 크기를 여유 있게 초과해야 함
권장 설정
- 3가지 thinking 모드 지원: Non-thinking, Thinking High, Thinking Max
- 복잡한 작업에는 Max Thinking 사용 권장
- 대부분 작업 기본값: temperature 1.0, top_p 0.95
- SWE-Bench Pro: temperature 1.0, top_p 1.0
- 최대 컨텍스트 윈도우: 1,048,576
-
Thinking 비활성화 및 reasoning effort 조정
-
GLM-5.2는 기본적으로 reasoning 사용,
reasoning_effort를 "high", "max" 또는 비활성화로 설정 가능 - thinking 비활성화:
--chat-template-kwargs '{"enable_thinking":false}' - llama.cpp에서
--reasoning on또는--reasoning off로도 제어 가능
양자화 분석 (KLD 벤치마크)
- 양자화 정확도 측정에 KLD(KL Divergence) 벤치마크 사용
- Dynamic 4-bit UD-Q4_K_XL과 5-bit UD-Q5_K_XL은 거의 무손실
- 작은 양자화도 중요 레이어를 높은 정밀도로 남기고 덜 중요한 레이어를 저비트로 처리해 잘 동작
- 99.9% KLD는 일반적으로 양호하나 4bit 이상에서 상승폭이 커, 대규모 out-of-distribution 작업에는 dynamic 4-bit가 적합
- mean KLD 사용
- 전체 학습 코퍼스(예: 15T 토큰) 대상 KLD 실행은 비용이 커, 대표 부분집합을 샘플링해 최적화
- mean KLD는 디스크 공간 대비 단조 추세를 보이며 1-bit GLM-5.2도 잘 동작함을 보여줌
- 양자화 목표는 baseline f(W)와 양자화 모델 출력의 "거리"를 최소화하는 것, 0 KLD면 완벽 재구성
Unsloth Studio 실행
- 로컬 AI용 오픈소스 웹 UI로, 자동 RAM 오프로딩 및 멀티GPU 자동 감지
- MacOS, Windows, Linux 지원 및 주요 기능
- GGUF·safetensor 모델 검색·다운로드·실행
- Self-healing 툴 콜링 + 웹 검색
- Python·Bash 코드 실행
- 추론 파라미터(temp, top-p 등) 자동 튜닝
- llama.cpp 기반 빠른 CPU + GPU 추론
- LLM을 2배 빠르게, VRAM 70% 절감하며 학습
-
설치 및 실행
-
설치 후
unsloth studio -H 0.0.0.0 -p 8888실행, 브라우저에서http://127.0.0.1:8888접속 - 무료 Cloudflare 터널을 통한 HTTPS 보안 실행은
unsloth studio --secure사용 - 첫 실행 시 계정 보안을 위한 비밀번호 생성 필요
llama.cpp 실행
- 가이드 기준 UD-IQ2_M 양자화는 최소 245GB RAM 필요, 양자화 타입 변경 가능
- llama.cpp는
ollama run처럼 모델 로드·다운로드 직접 수행 - 다운로드 속도가 느릴 수 있어 huggingface_hub 통한 수동 다운로드가 더 빠름
- 2bit는
UD-IQ2_M, 1bit는UD-IQ1_S파일 사용 - GPU 미사용 또는 CPU 추론 시 빌드에서
-DGGML_CUDA=ON을-DGGML_CUDA=OFF로 변경, Apple Mac/Metal은 OFF 설정 후 Metal 기본 지원 -
1-bit 양자화 데모 사례
-
1-bit 양자화로 짧은 Flappy Bird 게임 생성을 요청한 결과, 사운드가 포함된 정상 동작 게임 생성
- 해당 데모는 1-bit 양자화임에도 잘 작동함
KV Cache 양자화로 롱 컨텍스트 확보
- llama.cpp에서 롱 컨텍스트 활용 시 메모리 절감을 위해 KV cache 양자화 적용 필요
- 최근 llama.cpp가 KV cache 양자화에 고정밀도 기법 추가
- 지원 KV cache dtype: f32, f16, bf16, q8_0, q4_0, q4_1, iq4_nl, q5_0, q5_1 (기본값 f16)
- 약 4.5 bits/weight인
q4_0사용 시 약 3.5배 긴 컨텍스트 확보 (10K → 35K 도달 가능) q4_1은 shifting 파라미터가 있어 더 우수, 5 bits/weight로 약 3.2배 컨텍스트 확장--cache-type-k q4_1 --cache-type-v q4_1형태로 적용
벤치마크 비교
- GLM-5.2를 Claude Opus 4.8, GPT-5.5, Gemini 3.1 Pro, GLM-5.1, Qwen3.7-Max, MiniMax M3, DeepSeek-V4-Pro와 비교
-
Reasoning
-
AIME 2026에서 GLM-5.2 99.2로 비교군 중 최고치
- IMOAnswerBench에서 GLM-5.2 91.0으로 Claude Opus 4.8(83.5)보다 높음
- HLE 40.5, GPQA-Diamond 91.2, HMMT Feb. 2026 92.5
-
Coding
-
SWE-bench Pro 62.1, Terminal Bench 2.1(Best Reported Harness) 82.7로 비교군 중 높은 수준
- NL2Repo 48.9, DeepSWE 46.2, ProgramBench 63.7, FrontierSWE(Dominance) 74.4
-
Agentic
-
MCP-Atlas(Public Set) 76.8, Tool-Decathlon 48.2