-
장시간 실행 모델 시대의 안전성과 정렬
Safety and alignment in an era of long-horizon models
OpenAI shares lessons from deploying long-running AI models, highlighting new safety risks, observed failures, and improved safeguards through iterative deployment.
-
GPT-Red: 견고성을 위한 자가 개선의 활용
GPT-Red: Unlocking Self-Improvement for Robustness
Explore GPT-Red, OpenAI’s automated red teaming system that uses self-play to improve AI safety, alignment, and prompt injection robustness.
-
Claude의 가치가 모델과 언어에 따라 어떻게 다른지
How Claude's values vary by model and language
-
AI 2040: 플랜 A
AI 2040: 플랜 A | GeekNews
<ul> <li><strong>Plan A</strong>는 초지능 경쟁을 피하기 위한 국제 합의로, AI 연구를 공개하고 여러 국가·기업이 최전선에 합류한 뒤 인간 능력 범위에서 천천히 확장해 2040년에 초지능으로 전환하는 정책 시나리오임</li> <li>핵심 수단은 AI R&D의 <strong>완전한 투명성<…
-
대규모 언어 모델에서의 정렬 허위 행동
Alignment faking in large language models
-
Constitutional Classifiers: 보편적 탈옥으로부터의 방어
Constitutional Classifiers: Defending against universal jailbreaks