-
GLM 5.2, Semgrep IDOR 벤치마크에서 Claude 앞서
GLM 5.2, Semgrep IDOR 벤치마크에서 Claude 앞서 | GeekNews
<ul> <li>Semgrep의 <strong>IDOR 취약점 탐지</strong> 벤치마크에서 Zhipu AI의 open-weight 모델 <strong>GLM 5.2</strong>가 단순 프롬프트 조건만으로 Claude Code보다 높은 F1을 기록함</li> <li>실험은 데이터셋·평가 방식·시스템 프롬프트를 고정…
-
Claude Fable 5: 코딩 작업에서 중간 수준 결과를 냄
Claude Fable 5: 코딩 작업에서 중간 수준 결과를 냄 | GeekNews
<ul> <li>실제 코드에서 <strong>취약점을 수정</strong>하고 기능을 유지하는 200개 작업에서 Claude Fable 5는 중간 수준 성능과 일부 예외적 성공을 동시에 보임</li> <li>Claude Code와 함께 실행한 결과 <strong>FuncPass 59.8%</strong>, <strong>…
-
Defending Code Reference Harness - AI 기반 취약점 발견과 수정용 Anthropic 오픈소스 프레임워크
<ul> <li><strong>Defending Code Reference Harness</strong>는 Claude로 자율 취약점 발견과 수정을 수행하기 위한 참조 구현이며, 여러 조직의 보안팀과 협업하며 얻은 학습을 바탕으로 구성한 프로젝트임</li> <li>이 저장소는 제품이 아니라 <strong>참조 구현</st…