Do Large Language Models Plan Answer Positions? Position Bias in Multiple-Choice Question Generation
본 논문은 대규모 언어 모델이 숨은 표현 내의 정답 위치 암시적 계획으로 인해 객관식 문제 생성 시 체계적인 위치 편향을 나타낸다는 것을 밝히고, 이러한 내부 상태를 조작하여 해당 편향을 제어하고 수정하는 데 활성화 조정이 효과적임을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇 셰프를 고용하여 '객관식 문제' 케이크 한 배치를 굽는다고 상상해 보세요. 로봇에게 "케이크 100 개를 만들고, '정답' 재료를 A, B, C, D 슬롯 중 하나에 공정한 게임처럼 무작위로 숨기세요"라고 지시합니다.
당신은 로봇이 완벽하게 무작위일 것이라고 기대합니다. 하지만 케이크를 맛보면 패턴이 눈에 띕니다: 로봇 A 는 항상 정답을 슬롯 A 에 숨깁니다. 로봇 B 는 항상 B 나 C 슬롯에 숨깁니다. 로봇 C 는 슬롯 A 를 너무 좋아해서 D 슬롯을 전혀 사용하지 않습니다.
이 논문인 **"대형 언어 모델은 정답 위치를 계획하는가?"**는 이러한 로봇 셰프들 (대형 언어 모델, LLM) 이 퀴즈를 만들 때 왜 이렇게 강력하고 예측 가능한 습관을 가지는지 조사한 것입니다.
다음은 간단한 비유를 사용한 그들의 발견 사항 요약입니다:
1. "숨겨진 습관" (문제)
연구진은 10 가지 다른 로봇 셰프 (LLM) 와 이미지를 볼 수 있는 5 가지 로봇 셰프 (시각 - 언어 모델) 를 테스트했습니다. 그리고 세 가지 다른 주방에서 퀴즈를 만들도록 요청했습니다:
- 지식 주방: 일반 사실 (역사나 수학 등).
- 독해 주방: 뉴스 기사를 기반으로 한 질문.
- 시각 주방: 이미지를 기반으로 한 질문.
발견: 로봇들은 무작위가 아니었습니다. 그들은 "위치 편향"을 가지고 있었습니다.
- 일부 모델 (Llama 등) 은 **첫 번째 슬롯 (A)**에 집착했습니다.
- 다른 모델들 (Gemini 등) 은 **중간 슬롯 (B 와 C)**을 좋아했습니다.
- 거의 모든 모델이 **마지막 슬롯 (D)**을 무시했습니다.
마치 모든 셰프가 레시피가 무엇을 말하든 상관없이 우승 쿠키를 본능적으로 넣는 비밀 "선호 선반"을 가지고 있는 것과 같습니다.
2. "수정구" (조사)
큰 질문은 이것입니다: 로봇이 단순히 A, B, C, D 글자들에 기반해 추측하는 것일까요, 아니면 옵션을 쓰기 시작하기 전에 실제로 정답을 "계획"하고 있는 것일까요?
이를 알아내기 위해 연구진은 로봇이 정답을 쓰기 전, 퀴즈의 질문 부분을 작성하는 동안 로봇의 뇌 (내부 코드) 를 들여다보았습니다.
발견: 그들은 로봇의 뇌 안에 "수정구"를 발견했습니다.
로봇이 단순히 질문 줄 (예: "프랑스의 수도는 무엇입니까?") 을 작성하는 동안에도, 그 내부 코드는 이미 정답이 어디로 갈지 "결정"해 놓았습니다. 마치 로봇이 "B"라는 단어를 쓰기 전에 스스로에게 속삭이는 것처럼, *"나는 정답을 슬롯 B 에 넣을 거야"*라고 말한 것입니다.
이는 편향이 단순한 표면적 실수가 아니라, 사고 과정 초기에 형성된 깊은 암묵적 계획임을 시사합니다.
3. "리모컨" (해결책)
로봇의 뇌 안에 이 "계획"을 발견했기 때문에, 연구진은 로봇의 마음을 바꾸기 위해 "리모컨"을 사용해 보았습니다. 그들은 **활성화 조정 (Activation Steering)**이라는 기법을 사용했습니다.
로봇의 뇌를 특정 목적지 (예: 슬롯 A) 로 흐르는 강으로 생각하세요. 연구진은 작은 댐이나 노를 만들어 강을 약간 다른 목적지 (예: 슬롯 B) 로 밀어내는 방법을 찾았습니다.
발견:
- 성공했습니다! 내부 코드를 밀어냄으로써 로봇이 더 자주 다른 슬롯을 선택하도록 강요할 수 있었습니다.
- 타이밍이 중요합니다: 질문이 끝나는 직전 ("최종 직전") 에 로봇을 밀어내는 것이 끝날 때 밀어내는 것보다 훨씬 효과적이었습니다. 마치 마지막 코너를 치기 전에 핸들을 조작하는 것이 벽에 부딪힌 후에 하는 것보다 쉽기 때문입니다.
- 트레이드오프: 그들은 슬롯을 바꿀 수는 있었지만, 때로는 로봇이 혼란을 겪었습니다. 올바른 슬롯을 선택할 수는 있지만 질문의 의미를 바꾸거나 정답을 틀리게 만들 수도 있었습니다. 마치 로봇에게 바닐라 몰드에 초콜릿 케이크를 굽도록 강요하는 것과 같습니다; 모양은 변하지만 맛은 이상해질 수 있습니다.
4. "라벨 함정" (놀라운 반전)
연구진은 로봇에게 A, B, C, D 글자 없이 정답을 쓰도록 지시하면 어떻게 되는지도 테스트했습니다. 이렇게 하면 더 무작위해질 것이라고 생각할 수 있습니다.
발견: 실제로는 편향이 더 심해졌습니다. 안내할 글자가 없자 로봇들은 생성한 첫 번째 위치에 정답을 넣는 것에 더욱 집착하게 되었습니다. 사실 A, B, C, D 글자들은 로봇이 왼쪽으로 너무 치우치지 않도록 막아주는 가드레일 역할을 하여 오히려 더 균형을 잡는 데 도움이 되었습니다.
요약
- LLM 은 무작위가 아닙니다: 그들은 퀴즈에서 정답을 어디에 배치할지에 대해 강력하고 예측 가능한 습관을 가지고 있습니다.
- 그들은 미리 계획합니다: 옵션을 작성하기 전에 사고 과정 초기에 정답의 위치를 결정합니다.
- 우리는 그들을 밀어낼 수 있습니다: 내부 "조정"을 사용하여 이러한 습관을 바꿀 수 있지만, 이는 때로는 질문의 논리를 깨뜨릴 수 있는 섬세한 작업입니다.
- 라벨이 도움이 됩니다: 놀랍게도 옵션에 라벨 (A, B, C, D) 을 부여하면 편향을 줄이는 데 도움이 되지만, 이를 제거하면 로봇들이 첫 번째 옵션을 선택하는 데 더욱 고집을 부리게 됩니다.
핵심 결론: AI 를 사용하여 시험지를 생성할 때, 그것이 공정할 것이라고 단순히 신뢰할 수는 없습니다. AI 는 자체적인 숨겨진 선호도를 가지고 있으며, 진정한 무작위 퀴즈를 원한다면 적극적으로 개입하거나 특정 프롬프트를 사용하여 습관을 깨뜨리게 해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.