-
MiMo-V2.5-Pro-UltraSpeed: 초당 1000토큰을 생성하는 1T 모델
MiMo-V2.5-Pro-UltraSpeed: 초당 1000토큰을 생성하는 1T 모델 | GeekNews
<ul> <li><strong>1조(1T) 파라미터 모델</strong>에서 디코딩 속도 <strong>1000 tokens/s</strong>를 처음으로 돌파한 모델</li> <li>전용 하드웨어가 아닌 <strong>commodity GPU</strong>만으로 속도를 달성했으며, 단일 표준 <strong>8-GPU …
-
Gemma 4 QAT 모델: 모바일과 노트북 효율성을 위한 압축 최적화
Gemma 4 QAT 모델: 모바일과 노트북 효율성을 위한 압축 최적화 | GeekNews
<ul> <li>Gemma 4 <strong>양자화 인식 학습(QAT) 체크포인트</strong>는 일상적 에지 기기와 소비자용 GPU에서 로컬 실행을 돕도록 메모리 요구량과 온디바이스 성능을 최적화함</li> <li><strong>QAT</strong>는 학습 중 양자화를 시뮬레이션해 압축 시 품질 손실을 줄이며, 표준…