-
GPU 없이 13년 된 Xeon에서 Gemma 4 26B를 초당 5토큰으로 실행하기
GPU 없이 13년 된 Xeon에서 Gemma 4 26B를 초당 5토큰으로 실행하기 | GeekNews
<ul> <li>2013년형 듀얼 Xeon E5-2690 v2와 DDR3로 구성된 서버에서 <strong>Gemma 4 26B-A4B Q8_0</strong>을 CPU만으로 구동해 디코딩 약 5.2토큰/초, 프롬프트 평가 약 16토큰/초를 달성함</li> <li><code>ik_llama.cpp</code>의 고속 경로는…
-
Show HN: 느린 컴퓨터에서 GLM 5.2 실행하기
Show HN: 느린 컴퓨터에서 GLM 5.2 실행하기 | GeekNews
<ul> <li>colibrì는 <strong>GLM-5.2 744B MoE</strong>를 소비자용 머신의 약 25GB RAM에서 실행하도록 만든 순수 C 엔진이며, 라우팅된 expert를 디스크에서 스트리밍해 GPU 없이 동작함</li> <li>핵심 구조는 dense 부분 약 17B 파라미터를 <strong>int4…
-
AMD Ryzen AI Halo, $4000(약 600만원) AI 개발 키트
AMD Ryzen AI Halo, $4000(약 600만원) AI 개발 키트 | GeekNews
<ul> <li>로컬 AI 개발 환경을 직접 맞추는 부담을 줄이기 위해, Ryzen AI Halo는 <strong>Ryzen AI Max+ 395</strong> 미니 PC에 ROCm·드라이버·모델·개발 도구를 묶어 제공함</li> <li>단일 구성은 16코어/32스레드 Zen 5 CPU, Radeon 8060S 내장 G…