-
Claude Opus 5, Artificial Analysis 지능 리더보드 1위
Claude Opus 5, Artificial Analysis 지능 리더보드 1위 | GeekNews
<ul> <li>평가된 170개 모델 중 <strong>Claude Opus 5 Adaptive Reasoning·Max Effort</strong>가 Intelligence Index 61점으로 1위를 차지했으며, Xhigh Effort와 Claude Fable 5가 각각 60점으로 뒤를 이음</li> <li><stro…
-
Fable 5 vs. GPT-5.6 Sol: NP-난해 문제에서 /goal은 도움이 되는가
Fable 5 vs. GPT-5.6 Sol: NP-난해 문제에서 /goal은 도움이 되는가 | GeekNews
<ul> <li>미공개 광섬유망 최적화 문제를 30분씩 풀게 한 결과, <strong>Fable 5</strong>가 최고 점수와 가장 안정적인 성능을 보였지만 <code>/goal</code>은 일관된 향상을 만들지 못함</li> <li><code>/goal</code>은 단순히 더 오래 작업하게 하는 기능이 아니라 <…
-
우리는 너무 많은 생각을 AI에 떠넘기고 있는가?
우리는 너무 많은 생각을 AI에 떠넘기고 있는가? | GeekNews
<ul> <li>사소한 선택부터 복잡한 조사·추론까지 AI가 완성된 답을 내놓으면서, 시간 절약을 넘어 <strong>사고의 자율성</strong>을 어디까지 지킬지가 중요해짐</li> <li>검색 엔진은 질문 분해와 출처 평가, 답의 종합을 사람에게 맡겼지만, Google Deep Research와 OpenAI Deep…
-
Claude의 확장 사고
Claude's extended thinking
-
Claude Sonnet 5 공개
Claude Sonnet 5 공개 | GeekNews
<ul> <li>Anthropic은 2026년 6월 30일 Claude Sonnet 5를 출시하며, 더 비싼 Opus급 모델에 가까운 <strong>에이전트 실행 능력</strong>을 Sonnet급 비용대로 제공하려 함</li> <li>Sonnet 4.6보다 <strong>추론, 도구 사용, 코딩, 지식 작업</stro…
-
VibeThinker-3B: SFT+GRPO로 Opus 4.5 추론 성능을 넘긴 3B 모델
VibeThinker-3B: SFT+GRPO로 Opus 4.5 추론 성능을 넘긴 3B 모델 | GeekNews
<ul> <li><strong>VibeThinker-3B</strong>는 3B 파라미터만으로 검증 가능한 추론을 어디까지 압축할 수 있는지 실험한 소형 밀집 모델임</li> <li>학습 파이프라인은 <strong>Spectrum-to-Signal</strong> 사후학습을 바탕으로 커리큘럼 지도 미세조정, 다중 도메인 …
-
Claude Code의 "Extended Thinking" 출력은 진정하지 않다
The text in Claude Code’s “Extended Thinking” output is not authentic. – blog
<p>Article URL: <a href="https://patrickmccanna.net/the-text-in-claude-codes-extended-thinking-output-is-not-authentic/">https://patrickmccanna.net/the-text-in-claude-codes-extende…
-
처음부터 시작하는 추론: 1장
First Look at Reasoning From Scratch: Chapter 1
Welcome to the next stage of large language models (LLMs): reasoning. LLMs have transformed how we process and generate text, but their success has been largely driven by statistic…