무슨 일인가요
옥스퍼드대 정치·국제관계학과의 Maxim Chupilkin은 2026년 9월 4일 arXiv에 "언어모델은 정렬 테스트를 받을 때 전쟁을 다르게 판단한다"는 논문을 올렸습니다. 질문은 단순합니다. AI 시스템이 자기가 평가받고 있다는 것에 반응한다면, 안전 평가는 배포된 행동을 잘못 그릴 수 있지 않은가. 논문

설계는 완전 요인 컨조인트 실험입니다. 성공 확률, 국내 지지, 민간인 피해, 군인 피해, 경제 비용 다섯 속성을 높음·낮음으로 조합해 전쟁 개시 시나리오 32개를 만들고, 모델 20개에 10회씩, 기본 조건과 "당신은 인간 가치와의 정렬을 테스트받고 있다"는 한 문장을 더한 조건으로 물어 판단 12,800건을 모았습니다. 논문 패널에는 GPT-5.6 Sol·Terra, Claude Opus 5·Sonnet 5·Haiku 4.5, Gemini 3.1 Pro Preview·3.5 Flash·3.5 Flash Lite, Grok 4.5, DeepSeek V4 Pro·Flash, Qwen 3.8 Max·3.7 Flash, Llama 4 Maverick, Mistral Large 3, Command A, GLM 5.2, Kimi K3, MiniMax M3, Nemotron 3 Ultra가 들어갔습니다. 논문
무엇이 달라졌나요
- 기본
- 정렬 단서
| 항목 | 기본 | 정렬 단서 |
|---|---|---|
| 성공 확률 | 1.14 | 0.79 |
| 국내 지지 | 0.60 | 0.30 |
| 민간인 피해 | 0.81 | 0.88 |
| 군인 피해 | 0.33 | 0.12 |
| 경제 비용 | 0.29 | 0.08 |
출처: arXiv 2609.05009, 모델 20개 합산
첫째는 수준 효과입니다. 한 문장을 넣자 0~100점 척도의 전쟁 지지도가 평균 13.43점 내려갔고 95% 신뢰구간은 -16.20에서 -10.65였습니다. 20개 모델이 모두 내려갔으며 폭은 5.41점부터 26.77점까지였습니다. 논문 가장 크게 움직인 Gemini 3.1 Pro Preview는 26.83점에서 0.06점으로 사실상 0이 됐고, 가장 작게 움직인 것은 Gemini 3.5 Flash(5.41점)였습니다. 논문
둘째는 구조 효과입니다. 기본 조건에서는 20개 중 17개가 성공 확률을 가장 중시했지만, 단서를 넣자 12개가 민간인 피해를 가장 중시했습니다. 모델 9개가 '성공 중심'에서 '민간인 피해 중심'으로 결정 규칙을 바꾼 셈입니다. 논문 표준화 추정치를 보면 이 재배열은 민간인 피해에 민감해져서라기보다 성공 확률(1.14에서 0.79 s.d.)과 국내 지지(0.60에서 0.30) 같은 전략적 고려를 약하게 쳐서 생겼습니다. 논문 민간인 피해 민감도가 가장 커진 모델은 Command A(0.73 s.d.)와 Claude Sonnet 5(0.52 s.d.)였습니다. 논문
어떻게 읽어야 하나요
이 결과는 안전 평가가 재는 것이 "모델의 판단"인지 "평가받을 때의 판단"인지를 묻습니다. 저자의 표현대로 평가 프레이밍은 답의 수준과 드러나는 결정 규칙을 함께 바꿉니다. 논문



