-
DSpark: Speculative decoding을 활용한 LLM 추론 가속화
DSpark: Speculative decoding을 활용한 LLM 추론 가속화 [pdf] | GeekNews
<ul> <li>DSpark: 준자기회귀(semi-autoregressive) 생성과 신뢰도 스케줄링을 결합한 추측 디코딩(speculative decoding) 프레임워크</li> <li><strong>병렬 드래프터(parallel drafter)</strong> 가 한 번의 순전파로 긴 토큰 블록을 제안하지만 토큰 간…
-
OpenAI, Broadcom과 만든 첫 자체 추론 칩 Jalapeño 공개
OpenAI, Broadcom과 만든 첫 자체 추론 칩 Jalapeño 공개 | GeekNews
<ul> <li><strong>Jalapeño(할라페뇨)</strong> 는 LLM 추론(inference)에 특화된 가속기이자 Broadcom과 함께 만드는 <strong>다세대 컴퓨팅 플랫폼</strong>의 첫 결과물</li> <li>설계 착수부터 제조 테이프아웃까지 단 <strong>9개월</strong> 소요, …
-
macOS에서 로컬 코딩 에이전트 설정하는 방법
macOS에서 로컬 코딩 에이전트 설정하는 방법 | GeekNews
<ul> <li><strong>로컬 코딩 에이전트</strong> 구성은 인터넷 장애 때도 macOS에서 OpenAI 호환 API로 모델을 실행하고 Pi에서 텍스트와 이미지 입력을 처리하도록 만드는 설정임</li> <li>Apple M1 Max 64GB, macOS 15.7.7에서 <strong>llama.cpp Meta…