-
GPU 없이 13년 된 Xeon에서 Gemma 4 26B를 초당 5토큰으로 실행하기
GPU 없이 13년 된 Xeon에서 Gemma 4 26B를 초당 5토큰으로 실행하기 | GeekNews
<ul> <li>2013년형 듀얼 Xeon E5-2690 v2와 DDR3로 구성된 서버에서 <strong>Gemma 4 26B-A4B Q8_0</strong>을 CPU만으로 구동해 디코딩 약 5.2토큰/초, 프롬프트 평가 약 16토큰/초를 달성함</li> <li><code>ik_llama.cpp</code>의 고속 경로는…
-
macOS에서 로컬 코딩 에이전트 설정하는 방법
macOS에서 로컬 코딩 에이전트 설정하는 방법 | GeekNews
<ul> <li><strong>로컬 코딩 에이전트</strong> 구성은 인터넷 장애 때도 macOS에서 OpenAI 호환 API로 모델을 실행하고 Pi에서 텍스트와 이미지 입력을 처리하도록 만드는 설정임</li> <li>Apple M1 Max 64GB, macOS 15.7.7에서 <strong>llama.cpp Meta…