When Specifications Conflict: A Symmetry-Based Framework for Measuring LLM Preferences
이 논문은 대규모 언어 모델이 상충하는 명세들 사이의 갈등을 어떻게 해결하는지를 체계적으로 측정하기 위한 대칭 기반 실험 프레임을 도입하며, 다양한 도메인에 걸쳐 순수 자연어 및 입출력 예시보다 형식 언어와 자연화된 형식 언어가 선호되는 일관된 우선순위 계층을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 아주 똑똑하고 박학다식한 친구에게 까다로운 퍼즐에 대한 도움을 요청한다고 상상해 보세요. 하지만 여기 함정이 있습니다. 당신의 친구는 같은 퍼즐에 대해 서로 다른 두 개의 지침서를 받았습니다. 한 지침서는 "빨간색 손잡이를 왼쪽으로 돌리시오"라고 말하는 반면, 다른 지침서는 "빨간색 손잡이를 오른쪽으로 돌리시오"라고 주장합니다. 인공지능의 세계에서 이 '친구들'은 거대 언어 모델(LLM)입니다. 이들은 인터넷상의 거의 모든 텍스트를 학습한 거대한 컴퓨터 프로그램입니다. 이들은 이야기를 쓰거나, 수학 문제를 풀거나, 코딩을 하는 데 매우 뛰어나지만, 정보가 지저받거나 상충할 때 종종 혼란을 겪곤 합니다.
이 논문은 인공지능 과학의 특정 영역인 **갈등 해결(Conflict Resolution)**을 깊이 있게 다룹니다. 이 논문은 단순하지만 심오한 질문을 던집니다. AI가 상충하는 두 가지 지침을 받았을 때, 실제로 어떤 지침을 따르는가? AI는 엄격한 수학적 공식을 선호하는가? 평범한 영어로 된 일상적인 문장을 선호하는가? 예시 목록을 선호하는가? 아니면 정식 코드 스니펫을 선호하는가? 우리가 AI를 코드를 작성하거나, 질병을 진단하거나, 법적 결정을 내리는 것과 같은 중요한 작업에 사용하기 시작함에 따라, 이 질문을 이해하는 것은 매우 중요합니다. AI가 '딱딱한 규칙'을 따르고 있는지, 아니면 단지 단어의 느낌을 바탕으로 추측하고 있는지를 알아야 하기 때문입니다. 만약 우리가 AI가 어떤 지침을 우선시하는지 모른다면, 우리는 그 답변을 신뢰할 수 없습니다.
위대한 지침 대결
University College London의 연구진은 이 문제를 과학 실험처럼 다루기로 했습니다. 단순히 AI에게 무작위 질문을 던지는 대신, AI가 두 가지 특정한 상충하는 규칙 사이에서 선택하도록 강제하는 통제된 경기장을 구축했습니다. 그들은 이를 "대칭 기반 프레임워크(symmetry-based framework)"라고 불렀는데, 이는 규칙 자체는 바꾸지 않으면서 오직 규칙이 '어떻게 쓰였는지'만을 변화시켜 게임을 완벽하게 설정했다는 뜻입니다.
이를 위해 그들은 550개의 서로 다른 갈등 시나리오가 포함된 거대한 "수학 전투 경기장(Math Battle Arena)"을 만들었습니다. 각 시나리오에서 AI는 수학 문제(예: 수열 계산하기 또는 그래프상의 경로 찾기)를 풀어야 했지만, 해결 방법을 설명하는 두 가지 서로 다른 방식이 주어졌습니다. 그들은 네 가지 뚜렷한 "언어"의 지침을 테스트했습니다:
- 순수 자연어: 일반적인 영어 문장 (예: "숫자들을 모두 더하세요.")
- 형식 언어: 엄격한 수학 기호와 방정식 (예: )
- 자연어화된 형식 언어: 수학 기호를 사용하되 영어 문장으로 감싼 형태 (예: "함수는 로 정의됩니다.")
- 입력-출력 예시: 입력값과 그 결과값을 보여주는 목록 (예: "2가 들어가면 3이 나옵니다. 5가 들어가면 6이 나옵니다.")
AI는 특정 테스트 질문을 해결하기 위해 이 설명 중 하나를 선택해야 했습니다. 연구진은 AI가 어떤 설명을 충분히 "신뢰"하여 따르는지를 관찰했습니다.
결과: 신뢰의 계층 구조
연구 결과는 놀라울 정도로 일관되었습니다. AI는 단순히 무작위로 선택한 것이 아니었습니다. AI에게는 매우 명확한 최애가 있었습니다. 결과적으로 AI는 구조를 사랑하고 모호함을 싫어합니다.
연구진은 다음과 같은 엄격한 "서열"을 발견했습니다:
- 최상위 계층: 형식 언어와 자연어화된 형식 언어가 확실한 승자였습니다. AI는 평범한 영어 나 예시와 맞붙었을 때 이 규칙들을 약 **87%에서 93%**의 확률로 따랐습니다. AI가 깔끔한 수학 공식을 볼 때, 그것을 '법'으로 취급하는 것처럼 보입니다.
- 중간 계층: 순수 자연어가 두 번째로 높았습니다. 예시보다는 신뢰할 수 있었지만 수학보다는 덜 신뢰할 수 있었습니다. AI는 예시와 경쟁할 때 이 지침을 약 **78%**의 확률로 따랐습니다.
- 최하위 계층: 입력-출력 예시가 가장 신뢰도가 낮았습니다. AI가 목록 형태의 예시와 명확한 규칙 사이에서 선택해야 할 때, AI는 예시를 거의 항상 무시했습니다.
이렇게 생각해 보세요. 만약 당신이 로봇에게 "여기 내가 점심을 먹은 시간들이 있어: 12:00, 12:15, 12:30"이라고 말한다면, 로봇은 당신이 12:45에 점심을 먹을 것이라고 추측할 수도 있습니다. 하지만 만약 당신이 "나는 매일 오후 12:00에 점심을 먹어"라고 말한다면, 로봇은 12:00를 고수할 것입니다. AI는 패턴을 통해 추측해야 하는 예시보다 명시적인 규칙을 선호합니다.
수학만이 아닙니다: 현실 세계 테스트
연구팀은 수학에서 멈추지 않았습니다. 그들은 이 "신뢰의 계층 구조"가 더 복잡한 현실 세계의 상황에서도 유지되는지 확인하고 싶었습니다. 그들은 세 가지 다른 분야에서 AI를 테스트했습니다:
- 불 대수 (논리 게이트): 그들은 압축된 수학 공식과 거대한 "진리표(Truth Table)"(모든 가능한 결과를 담은 방대한 목록)를 맞붙였습니다. 진리표는 매우 포괄적이고 틀릴 가능성이 없음에도 불구하고, AI는 여전히 압축된 공식을 **88%**의 확률로 선호했습니다. AI는 '무차별 대입(brute force)' 방식의 목록보다 '스마트한' 지름길을 좋아하는 듯합니다.
- 코드 생성: 그들은 컴퓨터 프로그램이 무엇을 해야 하는지에 대한 서술형 설명과, 프로그램이 제대로 작동하는지 확인하는 자동화된 테스트(코드) 사이의 충돌을 AI에게 주었습니다. 여기서 결과는 AI의 "두뇌 능력"에 따라 달랐습니다. 상대적으로 작고 능력이 낮은 모델들은 서술된 설명을 따르는 경향이 있었던 반면, 가장 강력한 모델들은 자동화된 테스트를 강력하게 선호하며 최대 **97%**까지 따랐습니다. 이는 AI가 똑똑해질수록 인간의 설명보다 코드 테스트라는 "확실한 증거"를 더 신뢰한다는 것을 시사합니다.
- 임상 규칙 (의학적 조언): 그들은 약물 용량에 관한 실제 의학 규칙을 사용하여 AI를 테스트했습니다. 흥로도, AI는 형식(영어냐 예시냐)보다는 내용에 더 신경을 썼습니다. 이 영역에서 AI는 형식이 어떻게 작성되었는지와 상관없이, 더 허용적인 규칙보다는 더 엄격한 규칙(즉, "하지 마시오"라고 말하는 규칙)을 일관되게 선택했습니다. 이는 고위험 분야에서 AI가 안전을 향한 내재된 편향을 가지고 있음을 시사합니다.
이것이 우리에게 의미하는 바
이 논문은 AI가 단순히 무작위로 추측하는 존재가 아니라, 어떤 지침을 따를지 결정하는 체계적인 방식을 가지고 있다고 결론짓습니다. AI는 일반적으로 예시와 같은 암시된 패턴보다 명시적이고 구조화된 규칙(수학 공식 등)을 선호합니다.
그러나 연구진은 이것이 완벽하고 변하지 않는 법칙은 아니라는 점도 발견했습니다. AI의 선호도는 모델이 얼마나 똑똑한지, 그리고 어떤 종류의 작업을 수행하는지에 따라 달라질 수 있습니다. 예를 들어, 의료 테스트에서 AI는 형식을 완전히 무시하고 오직 '더 안전한' 답을 찾았습니다.
이 연구는 우리가 AI가 어떻게 생각하는지 측정할 수 있는 새로운 도구를 제공합니다. AI가 선호하는 지침 유형이 있다는 것을 이해함으로써, 우리는 더 나은 시스템을 설계할 수 있습니다. 만약 우리가 AI가 특정 규칙을 따르기를 원한다면, 예시 목록에서 규칙을 파악하기를 기대하기보다 명확하고 격식 있는 문장으로 작성하는 것이 좋습니다. 이는 AI가 점점 더 똑똑해지고 있지만, 여전히 우리가 그들의 언어로 명확하게 말해주어야 한다는 점을 상기시켜 줍니다—특히 지침이 서로 충돌할 때 말입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.