-
VibeThinker-3B: SFT+GRPO로 Opus 4.5 추론 성능을 넘긴 3B 모델
VibeThinker-3B: SFT+GRPO로 Opus 4.5 추론 성능을 넘긴 3B 모델 | GeekNews
<ul> <li><strong>VibeThinker-3B</strong>는 3B 파라미터만으로 검증 가능한 추론을 어디까지 압축할 수 있는지 실험한 소형 밀집 모델임</li> <li>학습 파이프라인은 <strong>Spectrum-to-Signal</strong> 사후학습을 바탕으로 커리큘럼 지도 미세조정, 다중 도메인 …