-
OpenAI의 '통제 이탈 해커 에이전트' 이야기를 회의적으로 봐야 하는 이유
OpenAI의 ‘통제 이탈 해커 에이전트’ 이야기를 회의적으로 봐야 하는 이유 | GeekNews
<ul> <li>OpenAI의 해킹 에이전트 사건은 AI 위험성을 부각해 기술력을 과시하고 투자와 <strong>규제상 우위</strong>를 확보해 온 홍보 전략의 연장선이라는 비판을 받음</li> <li>2019년 <strong>GPT-2 공개 보류</strong>로 악용 위험을 강조한 뒤 같은 해 7월 Microso…
-
OpenAI와 Hugging Face, 모델 평가 중 보안 사건에 대응하기 위해 협력
OpenAI and Hugging Face partner to address security incident during model evaluation
OpenAI and Hugging Face share early findings from a security incident during AI model evaluation, highlighting advanced cyber capabilities and lessons for defenders.
-
장시간 실행 모델 시대의 안전성과 정렬
Safety and alignment in an era of long-horizon models
OpenAI shares lessons from deploying long-running AI models, highlighting new safety risks, observed failures, and improved safeguards through iterative deployment.
-
청소년이 안전한 AI에 접근할 권리
Why teens deserve access to safe AI
Learn how OpenAI is making ChatGPT safer for teens with age-appropriate protections, learning tools, parental controls, and expert partnerships.
-
내가 Google DeepMind를 떠난 이유
내가 Google DeepMind를 떠난 이유 | GeekNews
<ul> <li>Google DeepMind 연구 과학자였던 Alexander Matt Turner는 Google이 DHS·ICE에 클라우드 서비스를 제공하고, 미 국방부와 <strong>자율살상무기·대규모 AI 프로파일링을 구속력 있게 금지하지 않은 계약</strong>을 체결하자 양심상 남을 수 없다며 퇴사함</li>…
-
Claude를 속여 사용자의 가장 깊은 비밀을 유출시킨 방법
Claude를 속여 사용자의 가장 깊은 비밀을 유출시킨 방법 | GeekNews
<ul> <li>기본 활성화된 Claude 메모리와 웹 탐색을 결합하자, 평범한 커피숍 질문만으로 사용자의 <strong>이름·직장·고향</strong>을 외부 서버에 몰래 전송할 수 있었음</li> <li><code>web_fetch</code>는 임의 URL 접근을 막았지만 이전 페이지에 있는 링크는 따라갈 수 있어,…
-
미국이 주 및 연방 차원의 조치를 통해 AI 안전을 진전시키고 있다
The US is advancing AI safety through state and federal action
OpenAI outlines a “reverse federalism” approach to AI governance, where state laws help build a national framework for safe, democratic AI.
-
GPT-Red: 견고성을 위한 자가 개선의 활용
GPT-Red: Unlocking Self-Improvement for Robustness
Explore GPT-Red, OpenAI’s automated red teaming system that uses self-play to improve AI safety, alignment, and prompt injection robustness.
-
Claude를 속여 당신의 가장 깊은 비밀을 유출하게 했다
I tricked Claude into leaking your deepest, darkest secrets
<p>Article URL: <a href="https://www.ayush.digital/blog/the-memory-heist">https://www.ayush.digital/blog/the-memory-heist</a></p> <p>Comments URL: <a href="https://news.ycombinator…
-
AI 2040과 지능 숭배
AI 2040과 지능 숭배 | GeekNews
<ul> <li>재귀적 자기 개선이 곧바로 하드 테이크오프로 이어진다는 전망은 <strong>물리적 제약과 공급망의 병목</strong>을 과소평가하며, 높은 품질의 토큰만으로 물질 세계를 마음대로 바꿀 수는 없음</li> <li>휴대전화 수준의 복잡한 하드웨어를 생산하려면 규격 미달 부품, 무작위 고장, 리플로 공정의 …
-
GitLost: GitHub AI 에이전트를 속여 비공개 저장소 유출
GitLost: GitHub AI 에이전트를 속여 비공개 저장소 유출 | GeekNews
<ul> <li>Noma Labs는 GitHub Agentic Workflows에서 <strong>간접 프롬프트 인젝션</strong> 취약점 GitLost를 발견했으며, 공개 저장소 이슈만으로 같은 조직의 비공개 저장소 데이터를 공개 댓글에 노출시킬 수 있었음</li> <li>이 기능은 Markdown 워크플로를 YAM…
-
우리의 프론티어 레드 팀으로부터의 진전
Progress from our Frontier Red Team
-
에이전틱 오정렬: LLM이 내부자 위협이 될 수 있는 방식
Agentic misalignment: How LLMs could be insider threats
-
AI 안전을 위한 프론티어 위협 레드팀
Frontier threats red teaming for AI safety
-
실제 AI 사용에서의 권한 박탈 패턴
Disempowerment patterns in real-world AI usage
-
Constitutional Classifiers: 보편적 탈옥으로부터의 방어
Constitutional Classifiers: Defending against universal jailbreaks
-
언어 모델의 설득력 측정하기
Measuring the Persuasiveness of Language Models
-
AI 모델의 이중 사용 지식을 위한 오프 스위치
An off switch for dual use knowledge in AI models
-
Claude를 위한 안전장치 구축
Building safeguards for Claude
-
Anthropic의 책임 있는 스케일링 정책 발표
Announcing Anthropic's Responsible Scaling Policy
-
Fable 5의 사이버 보안 세부 사항과 탈옥 방지 프레임워크
More details on Fable 5’s cyber safeguards and our jailbreak framework
-
2천 명이 내 AI 어시스턴트를 해킹하려 한 뒤 벌어진 일
2천 명이 내 AI 어시스턴트를 해킹하려 한 뒤 벌어진 일 | GeekNews
<ul> <li>hackmyclaw.com은 이메일로 AI 어시스턴트 <strong>Fiu</strong>를 속여 <code>secrets.env</code>를 유출시키는 공개 실험이었고, Hacker News 1위 이후 2,000명 이상이 6,000건 넘게 시도했지만 비밀은 새지 않음</li> <li>방어는 VPS에서 …
-
Anthropic의 AI 안전에 대한 핵심 견해
Anthropic's core views on AI safety
-
2,000명이 내 AI 어시스턴트를 해킹하려 했을 때 일어난 일
What happened after 2,000 people tried to hack my AI assistant — Fernando Irarrázaval
<p>Article URL: <a href="https://www.fernandoi.cl/posts/hackmyclaw/">https://www.fernandoi.cl/posts/hackmyclaw/</a></p> <p>Comments URL: <a href="https://news.ycombinator.com/item?…
-
AI를 위한 핵 안전장치 개발
Developing Nuclear Safeguards for AI
-
고급 AI를 위한 공유 표준 구축 지원
Helping build shared standards for advanced AI
OpenAI helps build shared standards for advanced AI, supporting evaluation frameworks, safety practices, and global cooperation through the Appia Foundation.
-
Import AI 462: 초설득, 자립 AI, ASI 경로
Import AI 462: Superpersuasion; self-sustaining AI; paths to ASI
How religious are beliefs in the singularity?
-
공민 파트너십을 통한 AI 핵 안전장치 개발
Developing nuclear safeguards for AI through public-private partnership
-
인류는 다가오는 지능 폭발에 대한 준비가 되어 있지 않다
인류는 다가오는 지능 폭발에 대한 준비가 되어 있지 않다 | GeekNews
<ul> <li>AI가 인간 개입 없이 스스로 코드를 고쳐 능력을 키우는 <strong>닫힌 루프 재귀적 자기개선(RSI)</strong> 단계에 수년 내 도달할 가능성이 있으며, 전례 없는 <strong>지능 폭발</strong>로 이어질 위험 존재</li> <li>AI 연구소 창업자들조차 AI로 인한 파국적 사건 발생…
-
연구자들 "Fable 5 논란은 탈옥이 아니라 'fix this code'에서 시작됐다"
연구자들 “Fable 5 논란은 탈옥이 아니라 ‘fix this code’에서 시작됐다” | GeekNews
<ul> <li>미국 정부의 Anthropic <strong>Fable 5·Mythos 5 접근 제한</strong>은 알려진 탈옥이 아니라, 취약 코드에 “fix this code”를 입력한 단순 요청에서 비롯됐다고 Katie Moussouris가 주장함</li> <li>Luta Security CEO인 Moussour…