-
에이전틱 오정렬: LLM이 내부자 위협이 될 수 있는 방식
Agentic misalignment: How LLMs could be insider threats
-
대규모 언어 모델에서의 정렬 허위 행동
Alignment faking in large language models
Agentic misalignment: How LLMs could be insider threats
Alignment faking in large language models