• TurboFieldfare는 전체 14.3GB 모델을 메모리에 올리지 않고 Gemma 4 26B-A4B를 약 2GB의 메모리로 실행해, 8GB Apple Silicon Mac에서도 로컬 추론이 가능함
  • 1.35GB 공유 코어와 FP16 KV 캐시만 상주시킨 뒤 토큰마다 필요한 MoE 전문가 가중치를 SSD에서 스트리밍하며, 16슬롯 LFU 캐시와 병렬 pread로 입출력을 제한함
  • Gemma 4 26B-A4B는 토큰당 약 3.88B 파라미터를 활성화하며, 측정된 디코딩 속도는 8GB M2 MacBook Air에서 5.1~6.3 tok/s, 24GB M5 Pro에서 31~35 tok/s임
  • Swift 6.2와 Metal 4로 구현된 전용 런타임이며, 네이티브 Mac 앱·CLI·설치 도구·실험적 OpenAI 호환 서버를 동일한 .gturbo 모델 디렉터리 위에서 제공함
  • 현재 범위는 macOS 26 이상과 최소 8GB RAM을 갖춘 Apple Silicon Mac의 텍스트 전용 추론으로 한정되며, 이미지·음성·영상과 원격 서버 인증·TLS는 지원하지 않음

메모리를 줄이는 실행 구조

  • TurboFieldfare는 instruction-tuned Gemma 4 26B-A4B를 전체 메모리에 적재하지 않음
  • 1.35GB 공유 코어와 FP16 KV 캐시는 메모리에 유지함
  • 각 토큰에 필요한 routed expert만 SSD에서 Metal이 볼 수 있는 버퍼로 읽음
  • 설치된 텍스트 전용 모델은 약 14.3GB지만, 가중치와 4K KV 캐시가 사용하는 메모리는 약 2GB임
  • 모델은 총 26B 파라미터 가운데 토큰당 약 3.88B 파라미터를 활성화함
  • 가중치는 group 64 기반 MLX affine 4비트를 사용하며, router는 8비트, 공유 및 routed expert는 4비트임
  • MLX나 llama.cpp를 감싼 구성이 아니라 Gemma 4 26B-A4B에 맞춰 만든 Swift·Metal 전용 런타임

토큰 생성 과정

  • 각 Transformer 레이어에서 Metal이 상주 가중치로 attention과 router를 계산함
  • CPU는 router가 선택한 상위 8개 expert ID를 레이어별 16슬롯 LFU 캐시와 대조함
  • 캐시 미스는 제한된 수의 병렬 pread 호출로 채움
  • SSD 읽기가 진행되는 동안 Metal은 상주하는 shared-expert 분기를 계산함
  • 읽기가 끝나면 shared output과 routed output을 결합함
  • 프롬프트 prefill은 최대 128토큰 청크를 사용해 한 번 가져온 expert가 여러 행을 처리할 수 있게 함
  • 생성 단계에서는 routed layer 루프를 토큰 단위로 반복함
  • KV 캐시는 25개 sliding-window layer에 제한된 순환 저장소를, 5개 full-attention layer에 선형 저장소를 사용함
  • 디코딩 attention은 정규화된 K와 V 경로를 분리한 exact split-K/V 방식임

설치와 모델 형식

  • 첫 실행에서 Download를 선택하면 고정된 Hugging Face revision에서 약 15GB를 범위 요청으로 내려받음
  • 설치기는 원본 체크포인트 전체를 임시 파일이나 메모리에 만들지 않음
  • 필요한 바이트 범위를 받아 곧바로 .gturbo 레이아웃으로 재패킹함
  • 전체 shard나 tensor를 별도로 준비하지 않아 임시 메모리 사용량이 제한됨
  • 완성된 설치본은 manifest와 파일 해시 검증을 통과해야 사용할 수 있음
  • 설치 완료 후 모델은 약 14.3GB 저장 공간을 차지하며, 설치 과정 자체는 모델을 메모리에 로드하지 않음
  • 런타임은 최종 manifest.json이 있는 완성된 .gturbo 디렉터리만 허용함
  • 중단된 다운로드 재개, 부분 다운로드 상태 삭제, 모델을 로드하지 않는 설치 검증을 지원함

실행 환경과 성능

  • 요구 환경은 Apple Silicon Mac, macOS 26, Metal 4, Xcode 26, Swift 6.2 이상임
  • 패키지는 arm64 전용이며 이전 macOS와 Metal 버전은 지원하지 않음
  • 검증 대상은 8GB M2 MacBook Air이며 모델 설치를 위한 여유 저장 공간과 최초 다운로드용 인터넷 연결이 필요함
  • 측정된 디코딩 성능은 다음과 같음
  • 8GB M2 MacBook Air: 5.1~6.3 tok/s
  • 24GB M5 Pro: 31~35 tok/s
  • 처리량은 프롬프트 길이, 생성 길이, 페이지 캐시 상태, 하드웨어에 따라 달라지므로 측정치는 성능 상한이 아닌 기준점임
  • 모델 실행 전 메모리를 많이 쓰는 앱을 닫고 memory_pressure -Q로 여유 메모리를 확인해야 함
  • 앱, decode service, CLI, 서버, 테스트 또는 다른 로컬 모델 프로세스는 한 번에 하나만 실행해야 함

제공 제품과 사용 방식

  • Swift 패키지는 여섯 제품을 제공함
  • TurboFieldfare: 런타임과 Metal 커널을 포함한 Swift 라이브러리
  • TurboFieldfareMac: 설치와 생성을 위한 네이티브 Mac 앱
  • TurboFieldfareDecodeService: Mac 앱이 사용하는 일회성 로컬 모델·Metal 소유 프로세스
  • TurboFieldfareCLI: 명령행 instruction chat 및 raw completion
  • TurboFieldfareServer: loopback OpenAI 호환 Chat Completions 서버
  • TurboFieldfareRepack: 스트리밍 설치 및 설치 검증 도구
  • Mac 앱에서는 모델을 내려받은 뒤 Load Model을 선택하고 프롬프트를 입력해 생성함
  • 상태 표시줄에서 진행 상황, 디코딩 속도, 메모리 사용량을 확인할 수 있음
  • sampling, context length, expert-cache slot과 런타임 옵션을 조정할 수 있음
  • CLI의 instruction chat은 JSON 메시지 배열을 받아 Mac 앱과 같은 형식으로 변환함
  • 응답 한도인 --max-new의 기본값은 1,024토큰임
  • Mac 앱은 선택한 context window가 가득 찰 때까지 생성할 수 있음
  • --prompt는 채팅 형식을 적용하지 않는 raw completion과 재현 가능한 비교에 사용함
  • 생성 텍스트는 표준 출력, 시간 통계는 표준 오류로 보내며 --quiet로 통계 출력을 끌 수 있음

프롬프트와 지원 범위

  • Mac 앱은 입력을 instruction으로 처리하고 Gemma의 채팅 형식을 자동 적용함
  • 기본 sampling 설정은 temperature 0.2, Top-K 64, Top-P 0.95
  • temperature를 0으로 설정하면 결정론적 greedy output을 사용함
  • 모델은 반복하거나 잘못 답할 수 있으므로 중요한 결과는 확인해야 함
  • 앱과 CLI는 사용자·모델 메시지와 선택적 system guidance를 지원하지만 도구를 노출하거나 실행하지 않음
  • 현재 모델 입출력은 텍스트 전용이며 이미지, 오디오, 비디오는 지원하지 않음
  • CLI는 --max-context, --temperature, --top-k, --top-p, --repetition-penalty, --seed, 반복 가능한 --stop 문자열을 제공함

OpenAI 호환 로컬 서버

  • 실험적 서버는 127.0.0.1:8080/v1에서 실행되며 Chat Completions, 스트리밍, 함수 도구 선언, 단일 prefix 프롬프트 재사용을 지원함
  • 서버는 모델이 만든 tool call을 반환하지만, 모든 도구 호출의 승인과 실행은 클라이언트가 담당함
  • 원격 인증과 TLS가 없으므로 서버를 loopback에만 유지해야 함
  • Mac 앱, CLI, 서버는 같은 .gturbo 디렉터리를 사용하지만 모델을 소유하는 제품은 동시에 하나만 실행해야 함

구현 범위와 실험 기록

  • 커스텀 Metal 커널은 양자화 GEMV, attention, MoE, normalization, RoPE, sampling과 프로덕션 fusion을 처리함
  • 런타임은 SSD 기반 routed-expert 스트리밍, 제한된 expert 캐시, 청크 단위 단일 프롬프트 prefill, 토큰 단위 생성을 구현함
  • 커널, 캐싱, 입출력, prefill, decode에 걸친 103개 측정 결과를 실험 기록으로 관리함
  • 실험 문서는 효과가 컸던 최적화, 실패한 아이디어, 더 강한 검증 후 뒤집힌 초기 결과를 포함함
  • 향후 작업은 iPhone·iPad 앱 개발과 모바일 추론 속도·메모리 측정, 16GB M4 Mac mini 및 다른 8GB Apple Silicon Mac의 벤치마크임

라이선스와 모델 조건

  • 소스 코드와 문서는 Apache License 2.0으로 배포됨
  • 모델 가중치는 저장소에 포함되지 않으며 설치기가 고정된 Hugging Face 체크포인트에서 별도로 내려받음
  • 가중치에는 원본 배포 조건이 계속 적용됨
  • TurboFieldfare는 Google과 제휴하거나 Google의 후원·승인을 받은 프로젝트가 아닌 독립 연구 프로젝트