• 10B 규모 산업용 파운데이션 모델이 주도하던 고품질 이미지 인페인팅을, 파라미터를 2% 미만으로 압축하면서도 동등하거나 그 이상의 품질로 구현한 경량 전문가 모델
  • 0.22B(226M) 파라미터로 동작하며, 11.9B 규모의 FLUX.1-Fill-Dev 대비 15배 이상 빠른 추론 속도 달성
  • diffusion 백본을 재구성하는 Local-λ Mix Interaction(LλMI) 블록으로 공간 맥락과 전역 의미 정보를 고정 크기 선형 행렬로 압축
  • latent space 내에서만 작동하는 적응형 다중 입자도 distillation 전략으로 대용량 teacher 모델의 표현력을 경량 모델에 전이
  • 무작정 규모를 키우는 대신, 작업을 명확히 정의했을 때 더 똑똑하고 가볍고 빠른 모델이 가능함을 보여주는 task-specific specialist 접근

배경 및 문제 정의

  • 10B 규모 산업용 파운데이션 모델이 이미지 인페인팅의 한계를 끌어올렸으나, 막대한 연산 비용으로 실제 배포가 크게 제약됨
  • 작업 특화 전문가 모델 구축이 유망한 대안이지만, 극단적 구조 압축은 심각한 표현 병목(representation bottleneck) 을 유발함
  • 이를 극복하기 위해 고효율 경량 인페인팅 프레임워크 Moebius 제안

Method — 전체 파이프라인

  • Latent Diffusion Model(LDM) 프레임워크에 Latent Categories Guidance(LCG) 를 결합한 구조 채택
  • denoising U-Net을 제안한 LλMI 블록으로 체계적으로 재구성해 극단적 아키텍처 효율 확보
  • 학습 단계에서 적응형 다중 입자도 distillation 전략을 적용, 경량 specialist를 고용량 teacher와 정렬해 극단적 구조 압축에 따른 용량 손실 완화

핵심 성과 (Highlights)

  • 극단적 파라미터 효율 (< 2%)

  • 0.22B(226M) 파라미터 로만 동작하며, 이는 대형 모델 FLUX.1-Fill-Dev(11.9B) 의 2% 미만 규모

  • 무거운 연산이 필수라는 통념을 깨고, 컨슈머급 및 엣지 디바이스에서도 고품질 인페인팅 가능
  • 15배 추론 속도 향상 (26ms/step)

  • 단일 GPU에서 step당 26.01ms 라는 매우 낮은 추론 지연 달성

  • 최적화된 샘플링 단계와 결합해 10B급 모델 대비 전체 런타임 15배 이상 가속
  • 10B급 인페인팅 품질

  • 크기 축소가 표현력 저하를 의미하지 않음을 입증

  • 아키텍처와 distillation의 시너지 최적화를 통해 복잡한 텍스처, 얼굴 자연스러움 등 일부 시나리오에서는 10B급 SOTA 모델(FLUX.1-Fill-Dev, SD3.5 Large-Inpainting)을 능가
  • 자연 장면(Places2)과 인물 장면(CelebA-HQ, FFHQ)을 아우르는 6개 벤치마크에서 검증
  • 시너지 기반 핵심 혁신

  • 아키텍처 설계(LλMI Block): self-attention과 cross-attention을 재구성해 공간 맥락과 전역 의미 정보를 고정 크기 선형 행렬로 압축, 이차(quadratic) 연산 부담 회피

  • 적응형 다중 입자도 distillation: teacher 모델 PixelHacker 의 표현력을 latent space 내에서만 전이해 비싼 pixel-space 디코딩 회피
    • 미시적 중간 특징부터 거시적 diffusion 궤적까지 다중 입자도 감독을 정렬하며, gradient norm 기반 적응형 손실 가중 메커니즘으로 학습을 동적으로 균형
  • 최적 시너지 균형: 압축 구조와 distillation 사이의 상호 제약 및 상한을 체계적으로 탐색
    • 아키텍처-distillation 시너지 경계를 매핑해, 0.22B Moebius(student)가 표현 포화 없이 PixelHacker(teacher)의 의미 추론 능력을 최대로 흡수하도록 보장
  • 비대한 범용 모델보다 작업 특화 전문가

  • "작업이 명확히 정의되면 모델이 더 똑똑하고, 가볍고, 빠를 수 있는가"라는 근본 질문에 답하는 접근

  • 실제 이미지 인페인팅과 AI 객체 제거를 파라미터 비대화에서 해방하는 고도 최적화 specialist 역할

평가 및 비교

  • 자연 장면(Places2)과 인물 장면(CelebA-HQ, FFHQ) 양쪽에서 광범위한 실험 수행
  • 생성 품질 면에서 10B급 산업용 범용 모델 FLUX.1-Fill-Dev와 대등하거나 능가하는 결과 확인
  • 파라미터 2% 미만(0.22B vs 11.9B) 규모로 15배 이상의 추론 시간 가속을 달성해, 고충실도 인페인팅의 새로운 효율 기준 제시