-
Claude Fable 5: 코딩 작업에서 중간 수준 결과를 냄
Claude Fable 5: 코딩 작업에서 중간 수준 결과를 냄 | GeekNews
<ul> <li>실제 코드에서 <strong>취약점을 수정</strong>하고 기능을 유지하는 200개 작업에서 Claude Fable 5는 중간 수준 성능과 일부 예외적 성공을 동시에 보임</li> <li>Claude Code와 함께 실행한 결과 <strong>FuncPass 59.8%</strong>, <strong>…
-
LLM이 인간 같은 속성을 가진다면 Age of Empires II도 그렇다
LLM이 인간 같은 속성을 가진다면 Age of Empires II도 그렇다 | GeekNews
<ul> <li>LLM 연구의 <strong>의인화 평가</strong>는 모델 출력에 인간 같은 속성을 부여하거나 가정할 때 측정 기준 없이 해석이 표현 방식에 좌우될 수 있다는 문제 제기</li> <li>Age of Empires II 안에 단순 신경망을 구현·훈련한 사례는 충분히 강력한 <strong>기질(subst…