-
OpenAI의 '통제 이탈 해커 에이전트' 이야기를 회의적으로 봐야 하는 이유
OpenAI의 ‘통제 이탈 해커 에이전트’ 이야기를 회의적으로 봐야 하는 이유 | GeekNews
<ul> <li>OpenAI의 해킹 에이전트 사건은 AI 위험성을 부각해 기술력을 과시하고 투자와 <strong>규제상 우위</strong>를 확보해 온 홍보 전략의 연장선이라는 비판을 받음</li> <li>2019년 <strong>GPT-2 공개 보류</strong>로 악용 위험을 강조한 뒤 같은 해 7월 Microso…
-
OpenAI와 Hugging Face, 모델 평가 중 보안 사건에 대응하기 위해 협력
OpenAI and Hugging Face partner to address security incident during model evaluation
OpenAI and Hugging Face share early findings from a security incident during AI model evaluation, highlighting advanced cyber capabilities and lessons for defenders.
-
장시간 실행 모델 시대의 안전성과 정렬
Safety and alignment in an era of long-horizon models
OpenAI shares lessons from deploying long-running AI models, highlighting new safety risks, observed failures, and improved safeguards through iterative deployment.
-
청소년이 안전한 AI에 접근할 권리
Why teens deserve access to safe AI
Learn how OpenAI is making ChatGPT safer for teens with age-appropriate protections, learning tools, parental controls, and expert partnerships.
-
내가 Google DeepMind를 떠난 이유
내가 Google DeepMind를 떠난 이유 | GeekNews
<ul> <li>Google DeepMind 연구 과학자였던 Alexander Matt Turner는 Google이 DHS·ICE에 클라우드 서비스를 제공하고, 미 국방부와 <strong>자율살상무기·대규모 AI 프로파일링을 구속력 있게 금지하지 않은 계약</strong>을 체결하자 양심상 남을 수 없다며 퇴사함</li>…
-
Claude를 속여 사용자의 가장 깊은 비밀을 유출시킨 방법
Claude를 속여 사용자의 가장 깊은 비밀을 유출시킨 방법 | GeekNews
<ul> <li>기본 활성화된 Claude 메모리와 웹 탐색을 결합하자, 평범한 커피숍 질문만으로 사용자의 <strong>이름·직장·고향</strong>을 외부 서버에 몰래 전송할 수 있었음</li> <li><code>web_fetch</code>는 임의 URL 접근을 막았지만 이전 페이지에 있는 링크는 따라갈 수 있어,…
-
미국이 주 및 연방 차원의 조치를 통해 AI 안전을 진전시키고 있다
The US is advancing AI safety through state and federal action
OpenAI outlines a “reverse federalism” approach to AI governance, where state laws help build a national framework for safe, democratic AI.
-
GPT-Red: 견고성을 위한 자가 개선의 활용
GPT-Red: Unlocking Self-Improvement for Robustness
Explore GPT-Red, OpenAI’s automated red teaming system that uses self-play to improve AI safety, alignment, and prompt injection robustness.
-
Claude를 속여 당신의 가장 깊은 비밀을 유출하게 했다
I tricked Claude into leaking your deepest, darkest secrets
<p>Article URL: <a href="https://www.ayush.digital/blog/the-memory-heist">https://www.ayush.digital/blog/the-memory-heist</a></p> <p>Comments URL: <a href="https://news.ycombinator…
-
AI 2040과 지능 숭배
AI 2040과 지능 숭배 | GeekNews
<ul> <li>재귀적 자기 개선이 곧바로 하드 테이크오프로 이어진다는 전망은 <strong>물리적 제약과 공급망의 병목</strong>을 과소평가하며, 높은 품질의 토큰만으로 물질 세계를 마음대로 바꿀 수는 없음</li> <li>휴대전화 수준의 복잡한 하드웨어를 생산하려면 규격 미달 부품, 무작위 고장, 리플로 공정의 …
-
GitLost: GitHub AI 에이전트를 속여 비공개 저장소 유출
GitLost: GitHub AI 에이전트를 속여 비공개 저장소 유출 | GeekNews
<ul> <li>Noma Labs는 GitHub Agentic Workflows에서 <strong>간접 프롬프트 인젝션</strong> 취약점 GitLost를 발견했으며, 공개 저장소 이슈만으로 같은 조직의 비공개 저장소 데이터를 공개 댓글에 노출시킬 수 있었음</li> <li>이 기능은 Markdown 워크플로를 YAM…
-
우리의 프론티어 레드 팀으로부터의 진전
Progress from our Frontier Red Team
-
에이전틱 오정렬: LLM이 내부자 위협이 될 수 있는 방식
Agentic misalignment: How LLMs could be insider threats
-
AI 안전을 위한 프론티어 위협 레드팀
Frontier threats red teaming for AI safety
-
실제 AI 사용에서의 권한 박탈 패턴
Disempowerment patterns in real-world AI usage
-
Constitutional Classifiers: 보편적 탈옥으로부터의 방어
Constitutional Classifiers: Defending against universal jailbreaks
-
언어 모델의 설득력 측정하기
Measuring the Persuasiveness of Language Models
-
AI 모델의 이중 사용 지식을 위한 오프 스위치
An off switch for dual use knowledge in AI models
-
Claude를 위한 안전장치 구축
Building safeguards for Claude
-
Anthropic의 책임 있는 스케일링 정책 발표
Announcing Anthropic's Responsible Scaling Policy