-
Databricks가 자체 코딩 AI 벤치마크를 만든 방법과 결과
Databricks가 자체 코딩 AI 벤치마크를 만든 방법과 결과 | GeekNews
<ul> <li>공개된 코딩 벤치마크는 회사별 상황에 딱 맞지 않고 치팅이 가능한 것이 문제 <ul> <li>Databricks에서 실제 수행한 과제, 언어로 벤치마크를 만들어 평가</li> </ul> </li> <li>GLM 5.2는 가장 어려운 과제도 Opus 4.8과 같은 수준으로 해결했지만 가격은 Opus의 66%…
-
코드 라인 수가 더 나은 홍보 담당자를 얻었다
코드 라인 수가 더 나은 홍보 담당자를 얻었다 | GeekNews
<ul> <li>개발자 생산성 평가는 코드 양보다 고객 가치, 매출, 신뢰성 같은 <strong>결과 지표</strong>로 판단해야 함</li> <li>Google, Anthropic, OpenAI, Cursor의 최근 AI 코딩 홍보 수치는 모두 <strong>코드 생성 비율</strong>이나 코드 라인 수 같은 양…