-
장시간 실행 모델 시대의 안전성과 정렬
Safety and alignment in an era of long-horizon models
OpenAI shares lessons from deploying long-running AI models, highlighting new safety risks, observed failures, and improved safeguards through iterative deployment.
-
GPT-Red: 견고성을 위한 자가 개선의 활용
GPT-Red: Unlocking Self-Improvement for Robustness
Explore GPT-Red, OpenAI’s automated red teaming system that uses self-play to improve AI safety, alignment, and prompt injection robustness.
-
Claude의 가치가 모델과 언어에 따라 어떻게 다른지
How Claude's values vary by model and language
-
대규모 언어 모델에서의 정렬 허위 행동
Alignment faking in large language models
-
Constitutional Classifiers: 보편적 탈옥으로부터의 방어
Constitutional Classifiers: Defending against universal jailbreaks
-
Anthropic의 AI 안전에 대한 핵심 견해
Anthropic's core views on AI safety
-
Import AI 461: 정렬이 진행 중이 아님, FrontierCode, 그리고 합성 연구 인턴
Import AI 461: "Alignment is not on track"; FrontierCode; and synthetic research interns
Where are your agents right now?
-
어시스턴트 축: 대규모 언어 모델의 특성 규명 및 안정화
The assistant axis: situating and stabilizing the character of large language models
-
자동화된 정렬 연구자들: 대규모 언어 모델을 활용한 확장 가능한 감시
Automated Alignment Researchers: Using large language models to scale scalable oversight