-
Claude의 가치가 모델과 언어에 따라 어떻게 다른지
How Claude's values vary by model and language
-
대규모 언어 모델에서의 정렬 허위 행동
Alignment faking in large language models
-
Constitutional Classifiers: 보편적 탈옥으로부터의 방어
Constitutional Classifiers: Defending against universal jailbreaks
-
어시스턴트 축: 대규모 언어 모델의 특성 규명 및 안정화
The assistant axis: situating and stabilizing the character of large language models
-
자동화된 정렬 연구자들: 대규모 언어 모델을 활용한 확장 가능한 감시
Automated Alignment Researchers: Using large language models to scale scalable oversight