-
Laguna S 2.1 출시: Deepseek v4 Flash보다 저렴하고 V4 Pro보다 우수
[AINews] "Laguna S 2.1 Released: Cheaper than Deepseek v4 Flash, Better than V4 Pro"
a quiet day lets us highlight a new neolab win.
-
Kimi K3는 Fable과 경쟁 중, Kimi K3와 Fable은 최첨단 기술
Kimi K3 Is Competitive with Fable; Kimi K3 and Fable Is SoTA
<p>Also: Kimi K3: second only to Fable 5 on AA-Briefcase <a href="https://artificialanalysis.ai/articles/kimi-k3-agentic-knowledge-benchmark" rel="nofollow">https://artificialanal…
-
Fable 5 vs. GPT-5.6 Sol: NP-난해 문제에서 /goal은 도움이 되는가
Fable 5 vs. GPT-5.6 Sol: NP-난해 문제에서 /goal은 도움이 되는가 | GeekNews
<ul> <li>미공개 광섬유망 최적화 문제를 30분씩 풀게 한 결과, <strong>Fable 5</strong>가 최고 점수와 가장 안정적인 성능을 보였지만 <code>/goal</code>은 일관된 향상을 만들지 못함</li> <li><code>/goal</code>은 단순히 더 오래 작업하게 하는 기능이 아니라 <…
-
Kimi K3의 순간
Kimi K3의 순간 | GeekNews
<ul> <li>일상적인 코딩 작업에서 <strong>Kimi K3와 Claude</strong>를 병행한 결과, 출력 품질과 답변에 필요한 토큰 수에서 실질적인 차이를 구별하기 어려웠음</li> <li>Kimi K3 API는 100만 토큰당 입력 <strong>$3</strong>, 출력 $15로, 각각 $10와 $50…
-
Fable 5 vs. GPT-5.6 Sol: NP-난제에서 /goal이 도움이 될까?
Fable 5 vs. GPT-5.6 Sol on an NP-Hard Problem: Does /goal Help? - Charles AZAM
<p>Article URL: <a href="https://charlesazam.com/blog/fable-5-gpt-5-6-sol-goal/">https://charlesazam.com/blog/fable-5-gpt-5-6-sol-goal/</a></p> <p>Comments URL: <a href="https://ne…
-
2026년 7월 오픈소스 AI 현황
2026년 7월 오픈소스 AI 현황 | GeekNews
<ul> <li>오픈 웨이트 모델은 코딩·지시 이행·일반 지식에서 폐쇄형과 비슷한 수준에 도달했고, 추론 비용도 36개월간 <strong>50배 하락</strong>하면서 경쟁의 중심이 모델 자체에서 <strong>에이전트 하네스</strong>로 이동함</li> <li>2026년 중반 OpenRouter에서 오픈 웨이트…
-
100달러 AI 뮤직비디오 제작 대결: Claude Fable 5 vs. GPT-5.6 S
100달러 AI 뮤직비디오 제작 대결: Claude Fable 5 vs. GPT-5.6 S | GeekNews
<ul> <li>Claude Fable 5와 GPT-5.6 Sol에 같은 곡과 가사, <strong>25·100달러 예산</strong>, 웹 검색과 ffmpeg를 제공하고 조사부터 영상 생성·편집까지 맡긴 결과, 네 번 모두 원곡을 결합한 완전한 길이의 영상을 자율적으로 완성함</li> <li>생성 모델과 제작 방식도 …
-
Kimi K3 2.8T-A50B: 지금까지 출시된 가장 큰 오픈 모델; Opus 4.8급 성능에 Sonnet 5 가격대
[AINews] Kimi K3 2.8T-A50B: the largest open model ever released; Opus 4.8-class at Sonnet 5 pricing
a great week for open models continues.
-
$100 AI 뮤직 비디오: Claude Fable 5 대 GPT-5.6 Sol
$100 AI Music Video: Claude Fable 5 vs. GPT-5.6 Sol
<p>Article URL: <a href="https://www.tryai.dev/blog/ai-music-video-arena-claude-vs-gpt-5.6">https://www.tryai.dev/blog/ai-music-video-arena-claude-vs-gpt-5.6</a></p> <p>Comments UR…
-
GPT-5.6, Grok 4.5, Claude, Muse Spark로 동일한 앱 4개를 만
GPT-5.6, Grok 4.5, Claude, Muse Spark로 동일한 앱 4개를 만 | GeekNews
<ul> <li>12개 모델에 레이캐스터 미로, 3D 루빅스 큐브, 계산기, Conway’s Game of Life를 만들게 한 결과, <strong>GPT-5.6 Sol</strong>과 <strong>Claude Fable 5</strong>가 복잡한 과제의 선두를 나눠 가짐</li> <li>모델마다 과제별로 <str…
-
오픈 모델로 갈아타는 데 따른 단점은 크지 않음
오픈 모델로 갈아타는 데 따른 단점은 크지 않음 | GeekNews
<ul> <li>기술 업무에서 <strong>오픈 LLM</strong>은 여전히 성능·호환성·신뢰 비용이 있지만, 최근 격차가 줄어 Claude나 GPT 같은 독점 모델 의존을 낮출 여지가 커짐</li> <li>과거 Linux는 MS Office 호환성, 특수 파일 형식, 미성숙한 오픈소스 생태계 때문에 전문 업무에서 …
-
GLM-5.2 vs Claude Opus | 기술 비교
GLM-5.2 vs Claude Opus | Tech Stackups
<p>Article URL: <a href="https://techstackups.com/comparisons/glm-5.2-vs-opus/">https://techstackups.com/comparisons/glm-5.2-vs-opus/</a></p> <p>Comments URL: <a href="https://news…
-
GPT-5.5가 MIT 라이선스 GLM-5.2보다 3배 더 환각함
GPT-5.5 hallucinates 3x more than MIT-licensed GLM-5.2
<p>Article URL: <a href="https://arrowtsx.dev/bigger-models/">https://arrowtsx.dev/bigger-models/</a></p> <p>Comments URL: <a href="https://news.ycombinator.com/item?id=48600167">h…
-
[AINews] GLM > GPT? GLM-5.2 통과; Z.ai, 12월 오픈 Fable 예측
[AINews] GLM > GPT? GLM-5.2 passes vibe check; Z.ai forecasts Open Fable by December
With GLM-5.2 passing everyone's vibe check, the open models story finally becomes a real frontier story.
-
Rio-3.5-Open-397B는 약 0.6 x Nex-N2_pro + 0.4 x Qwen
Rio-3.5-Open-397B ≈ 0.6 x Nex-N2_pro + 0.4 x Qwen · Issue #4 · nex-agi/Nex-N2
<p>Article URL: <a href="https://github.com/nex-agi/Nex-N2/issues/4">https://github.com/nex-agi/Nex-N2/issues/4</a></p> <p>Comments URL: <a href="https://news.ycombinator.com/item?…
-
DeepSeek V4 Pro, 정밀도에서 GPT-5.5 Pro를 앞서다
DeepSeek V4 Pro, 정밀도에서 GPT-5.5 Pro를 앞서다 | GeekNews
<ul> <li>사전 준비가 불가능하도록 즉석 생성된 <strong>4개 텍스트 과제</strong> 1:1 비교에서 DeepSeek V4 Pro가 <strong>38.0점</strong>, GPT-5.5 Pro가 33.0점 기록</li> <li>두 모델 모두 강력했으나, DeepSeek는 더 엄격하고 직역적이며 <str…
-
현실: 최종 평가 - Andon Labs의 Lukas Petersson과 Axel Backlund
Reality: The Final Eval — Lukas Petersson and Axel Backlund of Andon Labs
We talk with the VendingBench authors on evaling Claudes from Haiku to Mythos, and how they build leading, and lasting, frontier evals from scratch.
-
GPT-2에서 gpt-oss로: 아키텍처 발전 분석
From GPT-2 to gpt-oss: Analyzing the Architectural Advances
And How They Stack Up Against Qwen3
-
주요 LLM 아키텍처 비교
The Big LLM Architecture Comparison
From DeepSeek-V3 to Kimi K2: A Look At Modern LLM Architecture Design