-
대규모 언어 모델의 창발적 내성 인식
Emergent introspective awareness in large language models
-
지름길에서 사보타주까지: 보상 해킹으로 인한 창발적 오정렬
From shortcuts to sabotage: natural emergent misalignment from reward hacking