-
Claude Cookbook: 에이전트부터 RAG·멀티모달·운영까지
Claude Cookbook: 에이전트부터 RAG·멀티모달·운영까지 | GeekNews
<ul> <li>Claude 애플리케이션을 구현하는 <strong>실전 가이드와 예제</strong>를 모아 에이전트 구축부터 RAG·도구 사용·멀티모달·평가까지 폭넓게 다룸</li> <li><strong>Claude Agent SDK·Managed Agents</strong> 예제에는 멀티에이전트 조율, 세션 관리, 배…
-
FLUX 3 모델 공개
FLUX 3 모델 공개 | GeekNews
<ul> <li>이미지·비디오·오디오를 하나의 아키텍처에서 함께 학습해 생성·이해·행동 예측을 통합하려는 <strong>멀티모달 기반 모델</strong>이며, FLUX 3 Video부터 Early Access로 제공됨</li> <li>이미지의 공간 구조, 비디오의 시간·물리 역학, 오디오의 사건·소리 관계를 상호 제약으…
-
FLUX 3 x mimic: 로봇을 위한 차세대 비디오-액션 모델
FLUX 3 x mimic: 로봇을 위한 차세대 비디오-액션 모델 | GeekNews
<ul> <li>Black Forest Labs와 mimic robotics는 이미지·비디오·오디오를 공동 학습한 <strong>FLUX 3 백본</strong>에 로봇 행동 예측을 결합해, Audi 생산 현장에서 시험·배포한 FLUX-mimic을 개발함</li> <li>전체 학습 연산의 <strong>95% 이상을 차지…
-
Qwen-Image-3.0 - 풍부한 콘텐츠, 사실적 디테일, 깊이 있는 지식
Qwen-Image-3.0 - 풍부한 콘텐츠, 사실적 디테일, 깊이 있는 지식 | GeekNews
<ul> <li>Qwen-Image 시리즈의 3세대 기반 이미지 생성 모델로, 보기 좋은 이미지를 넘어 생산성 작업에 활용할 수 있는 ‘<strong>Real(实)</strong>’을 핵심 목표로 삼음</li> <li>최대 <strong>4.5k 토큰 입력</strong>을 처리해 신문·스토리보드·시험지처럼 정보량이 많은…
-
Inkling: Thinking Machines Lab의 오픈 웨이트 모델
Inkling: Thinking Machines Lab의 오픈 웨이트 모델 | GeekNews
<ul> <li>처음부터 학습해 전체 가중치를 공개한 <strong>Inkling</strong>은 총 975B·활성 41B 파라미터의 MoE Transformer로, 최대 1M 토큰 문맥과 텍스트·이미지·오디오 기반 추론을 지원함</li> <li>텍스트·이미지·오디오·비디오로 구성된 45조 토큰으로 사전 학습했으며, 특…
-
ChatGPT Work
ChatGPT Work | GeekNews
<ul> <li>ChatGPT가 질문 답변을 넘어 <strong>앱·파일·브라우저를 오가는 업무 에이전트</strong>로 확장되어, 복잡한 목표를 단계별 작업과 완성물로 이어가게 됨</li> <li>내장된 <strong>Codex 기술</strong>과 <strong>GPT‑5.6</strong>이 다단계 추론, 템플릿…