• 평가된 170개 모델 중 Claude Opus 5 Adaptive Reasoning·Max Effort가 Intelligence Index 61점으로 1위를 차지했으며, Xhigh Effort와 Claude Fable 5가 각각 60점으로 뒤를 이음
  • Intelligence Index v4.1은 에이전트 작업·코딩·과학 추론·지식 신뢰성·장문맥 추론을 다루는 9개 평가를 결합하고, 추론 모델의 확장 사고 시간도 성능 측정에 반영함
  • 출력 속도는 Mercury 2가 901.6 tokens/s로 가장 빠르고, 첫 토큰 지연은 Gemini 2.5 Flash-Lite가 0.34초로 가장 짧으며, Llama 4 Scout는 10M 토큰의 최대 문맥 창을 제공함
  • 가격은 토큰 단가뿐 아니라 입력·캐시 적중·캐시 쓰기·추론·답변 토큰을 가중한 작업당 비용으로 비교하며, 캐시 쓰기와 저장 비용은 제공업체마다 다름
  • 공개 가중치 모델 중 GLM-5.2 (max) 가 51점으로 가장 높지만 전체 1위보다 10점 낮아, 모델 선택에는 지능과 함께 비용·속도·지연·문맥 창을 고려해야 함

Claude Opus 5의 지능 순위

  • Claude Opus 5 (Adaptive Reasoning, Max Effort) 는 Intelligence Index 61점으로 평가된 170개 모델 가운데 1위임
  • 상위 5개 모델은 다음과 같음
  • Claude Opus 5 (Adaptive Reasoning, Max Effort): 61점
  • Claude Opus 5 (Adaptive Reasoning, Xhigh Effort): 60점
  • Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback): 60점
  • GPT-5.6 Sol (max): 59점
  • Claude Opus 5 (Adaptive Reasoning, High Effort): 59점
  • Max Effort 구성은 126개 추론 모델 중에서도 1위이며, 추론 모델은 답변 전에 복잡한 문제를 처리하기 위한 확장 사고를 수행함

Intelligence Index v4.1의 평가 구성

  • Intelligence Index v4.1은 다음 9개 평가를 결합함
  • GDPval-AA v2: 에이전트 기반 실제 업무
  • 𝜏³-Banking: 에이전트 도구 사용
  • Terminal-Bench v2.1: 에이전트 코딩 및 터미널 사용
  • SciCode: 코딩
  • Humanity's Last Exam: 추론 및 지식
  • GPQA Diamond: 과학적 추론
  • CritPt: 물리학 추론
  • AA-Omniscience: 지식 정확도와 비환각률
  • AA-LCR: 장문맥 추론
  • 용도에 따라 종합 지능 점수보다 특정 평가 결과가 더 중요할 수 있음
  • 별도 평가 항목에는 다음 벤치마크도 포함됨
  • AA-Briefcase: 에이전트 지식 업무
  • AutomationBench-AA: 에이전트 SaaS 워크플로
  • Harvey LAB-AA: 법률 에이전트 업무
  • EnterpriseOps-Gym-AA: 에이전트 비즈니스 운영
  • IFBench: 지시 준수
  • APEX-Agents-AA: 장기 에이전트 작업
  • ITBench-AA: Kubernetes 사고 근본 원인 분석
  • MMMU-Pro: 시각적 추론

지식 업무·신뢰성·개방성 지표

  • AA-Briefcase Elo는 분석 품질 Elo, 프레젠테이션 Elo, 평가 기준 통과율을 결합함
  • 통과율은 합성 일대일 대결을 통해 Elo로 변환함
  • Elo와 95% 신뢰구간 경계는 0 미만이 되지 않도록 제한함
  • AA-Omniscience Index는 지식 신뢰성과 환각을 -100~100점으로 측정함
  • 정답에는 보상하고 환각에는 벌점을 부여하지만, 답변 거부에는 벌점이 없음
  • 0점은 정답과 오답 수가 같고, 음수는 오답이 정답보다 많다는 뜻임
  • Openness Index는 모델의 개방성을 0~100의 정규화 점수로 평가하며, 높을수록 더 개방적임
  • 가중치 공개 여부를 구분하고, 가중치는 공개됐지만 상업적 이용에 유료 라이선스 등이 필요한 모델은 Commercial Use Restricted로 표시함

공개 가중치 모델 순위

  • 평가된 170개 모델 중 94개가 공개 가중치 모델임
  • 공개 가중치 모델의 Intelligence Index 상위권은 다음과 같음
  • GLM-5.2 (max): 51점
  • MiniMax-M3: 44점
  • DeepSeek V4 Pro (Reasoning, Max Effort): 44점
  • GLM-5.2 (max)가 공개 가중치 모델 중 가장 높은 점수를 기록함

출력 속도와 작업 처리 시간

  • Mercury 2는 901.6 tokens/s로 출력 속도가 가장 빠름
  • Gemini 3.5 Flash-Lite: 435.1 tokens/s
  • HyperNova 60B 2605: 427.6 tokens/s
  • Granite 4.0 H Small도 상위권에 포함됨
  • 출력 속도는 스트리밍 모델에서 첫 청크를 받은 뒤, 모델이 토큰을 생성하는 동안 수신한 초당 토큰 수
  • Intelligence Index의 작업당 시간은 작업당 출력 토큰 수를 출력 속도로 나누고 각 벤치마크의 상대적 가중치를 적용해 계산함
  • 첫 토큰 도착 시간(TTFT)과 기타 오버헤드는 제외함
  • 자체 API가 있으면 해당 API 성능을 사용하고, Meta Llama처럼 자체 API가 없으면 여러 제공업체의 중앙값을 사용함

지연과 종단 간 응답 시간

  • 첫 답변 토큰 도착 시간이 가장 짧은 모델은 Gemini 2.5 Flash-Lite (Non-reasoning) 로 0.34초임
  • Command A+: 0.42초
  • North Mini Code: 0.49초
  • Gemini 2.5 Flash도 지연이 짧은 모델에 포함됨
  • 첫 토큰 지연은 API 요청 후 첫 답변 토큰을 받을 때까지 걸리는 시간임
  • 추론 모델에서는 답변 전 사고 시간도 포함함
  • 스트리밍을 지원하지 않는 모델에는 전체 응답을 받는 시간이 적용됨
  • 500토큰 종단 간 응답 시간은 다음 요소를 합산함
  • 첫 응답 토큰을 받기까지의 입력 시간
  • 추론 모델이 답변 전에 사용하는 사고 시간
  • 출력 속도에 기반해 500개 답변 토큰을 생성하는 시간
  • 사고 토큰 수는 서로 다른 60개 프롬프트에서 측정한 평균을 사용함

가격과 작업당 비용

  • 가격 비교에는 캐시 적중·입력·출력 토큰의 100만 토큰당 달러 단가를 사용함
  • 목록에서 Devstral 2와 North Mini Code는 100만 토큰당 $0.00으로 표시되며, Gemma 3 4B와 Gemma 3 27B가 뒤를 이음
  • 혼합 단가 기준 가장 저렴한 모델은 다음과 같음
  • Nova Micro: $0.03/1M tokens
  • Sarvam 30B (high): $0.03/1M tokens
  • Gemma 4 E4B (Non-reasoning): $0.03/1M tokens
  • Intelligence Index 작업당 비용은 각 평가의 입력·캐시 적중·캐시 쓰기·추론·답변 토큰 가격을 작업 수로 나누고, Index 내 평가 가중치를 적용함
  • 전체 Index 실행 비용은 반복 실행을 제외한 평가별 토큰 사용량과 각 토큰 유형의 가격으로 계산함
  • 표시된 캐시 혼합 가격은 캐시 적중 비용만 사용하며, 다른 캐시 비용은 제공업체마다 다름
  • Anthropic은 캐시 쓰기 비용을 별도로 부과하며, 5분과 1시간 TTL의 요율이 다르고 1시간이 더 비쌈
  • Google Vertex/Gemini는 캐시 적중 가격 외에 시간당 저장 비용을 부과함
  • 일부 제공업체는 200K 토큰을 넘는 프롬프트에 구간별 가격을 적용함
  • OpenAI와 DeepSeek 등은 일반적으로 쓰기·저장 비용 없이 캐시 적중 가격만 부과함

토큰 사용량과 문맥 창

  • 작업당 출력 토큰 수는 각 평가의 출력 토큰에 Intelligence Index 내 상대적 가중치를 곱한 뒤, 반복을 제외한 작업 수로 나눠 계산함
  • 문맥 창 상위 모델은 다음과 같음
  • Llama 4 Scout: 10M 토큰
  • Grok 4.20 0309: 2M 토큰
  • Gemini 1.5 Pro (May)
  • Grok 4.1 Fast
  • 문맥 창은 입력과 출력 토큰을 합친 최대 한도이며, 출력 토큰 한도는 일반적으로 이보다 훨씬 작고 모델마다 다름
  • 큰 문맥 창은 대량 데이터에서 정보를 검색하고 추론하는 RAG 워크플로와 관련됨

공개 가중치 모델의 크기

  • 모델 크기는 학습 가능한 가중치와 편향을 합한 전체 파라미터와 실제 추론에서 실행되는 활성 파라미터로 구분함
  • Mixture of Experts 모델은 라우팅 메커니즘이 토큰마다 일부 전문가만 선택하므로 활성 파라미터가 전체보다 적음
  • Dense 모델은 모든 파라미터를 사용하므로 활성 파라미터와 전체 파라미터가 같음

비교 범위와 활용법

  • 모델은 지능, 가격, 출력 속도, 첫 토큰 지연, 종단 간 응답 시간, 문맥 창 크기 등 여러 차원에서 비교됨
  • 성능 지표는 586개 모델을 대상으로 표준화된 프롬프트를 사용해 직접 측정함
  • 각 모델의 상세 페이지에서 세부 지표와 유사 모델 간 직접 비교를 확인할 수 있으며, 모델 선택기로 차트에 표시할 모델을 조정할 수 있음