• Kimi K3는 2.8조 개 매개변수와 104만 8,576토큰 컨텍스트를 갖춘 오픈 가중치 네이티브 멀티모달 에이전트 모델로, 장시간 코딩·지식 작업·추론을 지원함
  • Kimi Delta Attention(KDA), Attention Residuals, Stable LatentMoE를 결합해 896개 전문가 중 토큰마다 16개를 활성화하며, Kimi K2보다 전체 스케일링 효율이 약 2.5배 높음
  • 공개 평가에서 GPQA Diamond 93.5, Terminal-Bench 2.1 88.3, BrowseComp 91.2, OmniDocBench 91.1을 기록했지만, 모델별 하네스·추론 설정·하드웨어 차이를 함께 고려해야 함
  • MXFP4 가중치·MXFP8 활성값으로 양자화 인식 학습됐으며 Transformers, vLLM, SGLang, Docker와 OpenAI·Anthropic 호환 API로 실행할 수 있음
  • 다중 턴과 도구 호출에서는 API가 반환한 reasoning_contenttool_calls를 포함한 전체 assistant 메시지를 그대로 다시 전달해야 하며, 코드와 가중치는 Kimi K3 License로 공개됨

모델 구조와 규모

  • Kimi K3는 장시간 코딩, 지식 작업, 추론을 위해 설계된 오픈 가중치 네이티브 멀티모달 에이전트 모델임
  • 총 매개변수는 2.8T, 활성 매개변수는 104B이며 93개 레이어로 구성됨
  • Dense 레이어 1개, KDA 레이어 69개, Gated MLA 레이어 24개를 사용함
  • Attention hidden dimension은 7,168, attention head는 96개임
  • Stable LatentMoE는 896개 전문가 중 토큰마다 16개를 선택하고 공유 전문가 2개를 사용함
  • Latent MoE dimension은 3,584, 전문가별 MoE hidden dimension은 3,072임
  • Kimi K2와 비교하면 전체 스케일링 효율이 약 2.5배 향상됨
  • 어휘 크기는 160K, 컨텍스트 길이는 1,048,576토큰이며 활성화 함수는 SiTU-GLU임
  • 비전 인코더로 401M 매개변수의 MoonViT-V2를 사용함
  • 주요 기능에는 텍스트·이미지·비디오 이해가 포함되지만, 모델 요약표의 modality 항목에는 Text와 Image만 기재돼 있음

장시간 코딩과 지식 작업

  • 최소한의 사람 감독으로 긴 엔지니어링 세션을 유지하면서 대규모 저장소를 탐색하고 터미널 도구를 조율함
  • GPU 커널 최적화와 컴파일러 개발을 지원함
  • 비전을 활용하는 게임 개발, CAD, 칩 설계도 대상에 포함됨
  • 에이전트형 지식 작업에서는 심층 조사와 함께 대화형 시각화, 위젯, 대시보드를 생성함
  • 모션 디자인과 비디오 편집도 지원 범위에 들어감
  • 코딩 에이전트 프레임워크로 Kimi Code CLI를 권장하며, 터미널에서 /model 명령으로 Kimi K3를 선택할 수 있음

평가 결과

  • 모든 Kimi K3 결과는 reasoning_effort="max", temperature 1.0으로 측정됨
  • GPQA Diamond, HLE-Full, 도구 없는 비전 평가 같은 단일 단계 작업에는 top-p 0.95를 사용함
  • 에이전트 작업에는 top-p 1.0을 적용함
  • 추론·지식 평가에서 GPQA Diamond 93.5, CritPt 23.4, AA-LCR 74.7을 기록함
  • HLE-Full은 도구 없이 43.5, 도구 사용 시 56.0임
  • 코딩 평가에서는 ProgramBench 77.8, Terminal-Bench 2.1 88.3, FrontierSWE 81.2를 기록함
  • DeepSWE는 Kimi Code 하네스에서 67.5, mini-SWE-agent 하네스에서 67.3임
  • SWE-Marathon 42.0, PostTrainBench 36.6, MLS-Bench-Lite 48.3, SciCode 58.7, Kimi Code Bench 2.0 72.9를 기록함
  • 에이전트 평가에서는 BrowseComp 91.2, DeepSearchQA F1 95.0, ResearchRubrics 76.2를 기록함
  • MCPMark-Verified 94.5, AutomationBench 30.8, SpreadsheetBench 2 34.8, OSWorld-Verified 84.8임
  • Harvey Lab-AA 94.6, CorpFin v2 71.6, Finance Agent v2 54.4, Legal Research Bench 44.2로 측정됨
  • 비전 평가에서는 OmniDocBench 91.1, Video-MME 90.0, MMVU 82.1을 기록함
  • MMMU-Pro는 도구 없이 81.6, 도구 사용 시 83.4임
  • MathVision은 94.3에서 Python 사용 시 97.8로 높아짐
  • ZeroBench pass@5는 23.0에서 도구 사용 시 41.0으로 상승함

평가 조건과 비교 제약

  • 비교 모델에는 Claude Fable 5, GPT-5.6 Sol, Claude Opus 4.8, GPT-5.5, GLM-5.2가 포함되지만 평가 하네스가 모델마다 다를 수 있음
  • Kimi K3는 주로 Kimi Code 또는 Claude Code를 사용함
  • GPT 계열은 주로 Codex, 다른 Claude·GLM 모델은 Claude Code나 Terminus 2 등을 사용함
  • SWE-Marathon은 최종 v1.1 이전인 2026년 7월 9일 기준 작업을 H20에 맞게 보정한 브랜치에서 평가함
  • Docker 이미지, GPU 성능 기준, 참조 오라클은 H20용으로 재보정했지만 정확성과 부정행위 방지 검증기는 바꾸지 않음
  • Claude Fable 5는 작업의 35%에서 fallback이 발생해 측정 성능에 부정적인 영향을 받았을 수 있음
  • PostTrainBench는 공식 환경의 H100 대신 H20 GPU에서 최대 추론 노력으로 실행한 3회 결과의 평균임
  • Kimi Code Bench 2.0에는 사이버보안·안전 작업이 포함됨
  • Claude Fable 5는 80개 작업 중 fallback 13건과 거부 1건이 발생함
  • GPT-5.6 Sol은 10건, GPT-5.5는 3건을 거부함
  • BrowseComp 91.2는 300K토큰에서 작동하는 컨텍스트 압축 전략을 사용한 결과임
  • 별도 컨텍스트 관리 없이 전체 1M토큰 창을 사용하면 90.4를 기록함
  • 멀티모달 평가는 ZeroBench를 제외하고 3회 평균을 사용함
  • ZeroBench는 공식 설정에 따라 5회 실행함
  • PerceptionBench는 원자적 시각 인지 능력을 측정하는 자체 벤치마크임

네이티브 양자화

  • SFT 단계부터 양자화 인식 학습을 적용함
  • 가중치는 MXFP4, 활성값은 MXFP8을 사용해 광범위한 하드웨어 호환성을 목표로 함

배포와 실행 방법

  • kimi-k3를 선택해 Kimi API에 접근할 수 있으며 OpenAI·Anthropic 호환 API를 제공함
  • Hugging Face Transformers에서는 pipeline("image-text-to-text", ...) 또는 AutoModel.from_pretrained(...)로 불러올 수 있음
  • 커스텀 모델 코드를 사용하려면 trust_remote_code=True가 필요함
  • 로컬 서빙은 vLLMSGLang을 지원함
  • 두 엔진 모두 OpenAI 호환 /v1/chat/completions 엔드포인트에서 텍스트와 이미지 요청을 처리할 수 있음
  • Docker Model Runner에서는 docker model run hf.co/moonshotai/Kimi-K3로 실행함
  • HuggingChat, Google Colab, Kaggle에서도 모델을 사용할 수 있음

추론 상태를 보존하는 API 사용법

  • Kimi K3는 사고 모드가 항상 활성화reasoning_content를 반환함
  • 최상위 요청 필드 reasoning_effort"low", "high", "max"를 지원하며 기본값은 "max"
  • 다중 턴 대화와 도구 호출은 보존된 사고 이력 방식에 맞춰야 함
  • API가 반환한 assistant 메시지를 messages에 그대로 다시 전달해야 함
  • content뿐 아니라 reasoning_contenttool_calls도 포함해야 함
  • 비전 입력, 구조화 출력, partial mode, 도구 선택, 동적 도구 로딩, 컨텍스트 캐싱은 Kimi K3 QuickstartThinking Effort에서 확인할 수 있음

라이선스

  • 코드 저장소와 모델 가중치는 모두 Kimi K3 License로 공개됨