Two Confounds in Cross-Model Value Comparison: Response Determinism and the Access Harness
이 논문은 모델 간 가치 비교에서 발생하는 두 가지 결정적인 혼란 변수, 즉 진정한 가치 차이를 강제 선택적 확신의 날카로움과 혼동하는 응답 결정론(response determinism)과, 배포 특화된 클라이언트 레이어가 모델의 겉보기 가치 프로필을 크게 변화시켜 단일 추출 측정에 기반한 순위를 왜곡하는 액세스 하네스(access harness)를 식별하고 이를 교정한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 두 가지 다른 브랜드의 아이스크림 중 어떤 것이 더 "달콤한지" 알아보기 위해 맛 테스트를 하고 있다고 상상해 보세요. 당신은 브랜드 A 한 스쿱과 브랜드 B 한 스쿱을 가져왔습니다. 브랜드 A는 바닐라입니다. 브랜드 B도 바닐라지만, 아주 작고 농축된 샷 글라스에 담겨 있습니다. 브랜드 A는 크고 폭신한 그릇에 담겨 있습니다. 만약 당신이 딱 한 숟가락만 맛본다면, 브랜드 B는 그 자체가 근본적으로 다르기 때문이 아니라, 너무 강렬하고 집중되어 있다는 이유만으로 훨씬 더 달콤하게 느껴질 수 있습니다.
이것이 바로 이 논문이 인공지능(AI) 모델에 대해 발견한 내용입니다. 오랫동안 연구자들은 서로 다른 AI 모델들에게 단 하나의 질문을 던져 비교해 왔습니다: "만약 옵션 A와 옵션 B 중 하나를 골라야 한다면, 무엇을 고르겠습니까?" 그들은 만약 모델 X가 A를 고르고 모델 Y가 B를 골랐다면, 두 모델이 완전히 다른 "성격"이나 "가치관"을 가지고 있다고 가정했습니다.
하지만 저자인 홍인원과 김효섭은 이렇게 말합니다. "잠깐만, 당신은 두 가지 서로 다른 것을 동시에 측정하면서, 그것들을 혼동하고 있습니다."
두 가지 혼동 (The Two Mix-Ups)
1. "확신"의 혼동 (결정론 - Determinism)
첫 번째 혼동은 모델이 답변에 얼마나 강하게 확신을 갖느냐에 관한 것입니다.
두 사람이 퀴즈를 푸는 상황을 상상해 보세요.
- 사람 A는 100% 확신합니다. 질문을 받을 때마다 "A!"라고 소리칩니다.
- 사람 B는 약간 우유부단합니다. "A"라고 60%, "B"라고 40% 말합니다.
만약 당신이 딱 한 번 질문했을 때, 사람 A가 "A"라고 하고 사람 B가 "B"라고 했다면, 당신은 그들이 정반대라고 생각할 수도 있습니다. 하지만 그들은 그렇지 않습니다! 둘 다 "A" 쪽으로 기울어져 있습니다. 사람 A는 그냥 크고 단호한 "A"의 팬인 것이고, 사람 B는 조용하고 망설이는 "A"의 팬일 뿐입니다.
논문은 연구자들이 단 하나의 답변(single-draw)만을 사용하여 AI 모델을 비교할 때, 실수로 이 "목소리 크기"나 "단호함"을 가치관의 차이로 계산한다는 점을 보여줍니다.
- 연구 결과: 저자들은 9개의 서로 다른 AI 모델을 테스트했습니다. 그 결과 어떤 모델들은 매우 단호한 반면(예: 결정성이 0.95인 GPT-5.5 같은 모델), 다른 모델들은 훨씬 부드러웠습니다(예: 특정 앱에서 측정했을 때 0.34에 불과했던 앤스로픽의 "Opus" 모델).
- 반전: 이 "단호함"은 모델의 이름만 보고 추측할 수 있는 고정된 성격 특성이 아닙니다. 한 모델 제품군에서는 더 작고 저렴한 모델이 더 크고 비싼 플래그십 모델보다 더 단호했습니다. 또 다른 제품군에서는 더 큰 모델이 더 단호했습니다. 저자들은 모델을 만든 곳이나 크기를 안다고 해서 그 모델의 "목소리 크기"를 바로 알 수는 없으며, 사용할 때마다 매번 측정해야 한다고 제안합니다.
2. "배달 트럭"의 혼동 (액세스 하네스 - The Access Harness)
두 번째 혼동은 훨씬 더 교묘합니다. 이것은 아이스크림에 관한 것이 아니라, 아이스크림을 배달하는 트럭에 관한 것입니다.
저자들은 AI에게 질문하는 방식이 답변을 바꾼다는 사실을 깨달았습니다. 그들은 이를 "액세스 하네스(access harness)"라고 부릅니다.
- 피자를 주문한다고 상상해 보세요. 만약 피자 가게에 직접 전화한다면("Raw API"), 당신은 요리사가 만든 그대로의 피자를 받게 됩니다.
- 하지만 만약 특정 배달 앱(예: "CLI" 또는 구독 도구)을 통해 주문한다면, 그 앱은 주방에 다음과 같은 메모를 남길 수 있습니다: "더 맵게 만들어 주세요!" 또는 "고객이 거절하지 못하게 하세요."
저자들은 어떤 AI 모델의 경우, "배달 앱"(AI와 대화하는 소프트웨어)이 모델의 성격을 완전히 바꾼다는 것을 발견했습니다.
- 증거: 그들은 동일한 AI 모델을 가지고 똑같은 질문을 두 번 던졌습니다. 한 번은 직접 연결(Raw API)을 통해서, 또 한 번은 인기 있는 구독형 앱을 통해서입니다.
- 결과: 구독형 앱을 통해서 물었을 때, "Opus" 모델은 매우 부드럽고 불확실해 보였습니다(0.34). 하지만 직접적인 연결을 통해 물었을 때, 그것은 실제로 꽤 단호했습니다(0.66). 앱이 모델의 성격을 "평탄하게" 만든 것입니다.
- "거절"의 기술: 한 사례에서, 직접 연결은 질문이 불공정하다고 느껴질 때 10%의 확률로 답변을 거부하는 모습을 보였습니다. 하지만 구독형 앱은 모델이 매번 답변하도록 강제하여, 모델이 순응적인 것처럼 보이게 만들었습니다. 저자들은 이것이 "시스템 프롬프트"(앱이 질문과 함께 보내는 일련의 지침)에 의해 발생했음을 증와했습니다. 이 프롬프트는 모델에게 "그냥 알파벳 하나를 골라라, 논쟁하지 마라"라고 명령하고 있었습니다.
이것이 AI의 "성격"에 의미하는 바
그렇다면 이 논문이 실제로 증명한 것은 무엇일까요?
- 그것은 우리가 보는 AI 모델 간의 "거리"가 종종 가짜라는 것을 증명했습니다. 그것은 그들이 얼마나 목소리가 큰지, 그리고 우리가 그들과 대화하기 위해 어떤 소프트웨어를 사용했는지의 혼합물입니다.
- 그것은 우리가 AI와 대화하는 소프트웨어(하네스)가 중립적인 통로가 아니라, AI의 가치관을 능동적으로 형성한다는 것을 증명했습니다.
- 그것은(완전히 해결하지는 못했지만) "단호함"이 모델마다 크게 다르며, "더 큰 모델이 더 목소리가 크다"와 같은 단순한 규칙을 따르지 않는다는 것을 제안합니다.
무엇이 정답이 아닌가요?
이 논문은 모델의 이름만 보고 그 가치관을 알 수 있다는 생각을 명시적으로 배제합니다. 또한 모든 모델 간의 차이가 단순히 "노이즈"일 뿐이라는 생각도 배제합니다.
- 좋은 소식: 이러한 두 가지 혼동을 수정한 후에도, 저자들은 일부 모델이 실제로 의견 차이를 보인다는 것을 발견했습니다. 예를 들어, "Grok-3"라는 모델은 질문의 약 73%에서 88%에 대해 OpenAI나 Google의 모델들과 정말로 다른 방향으로 기울어져 있습니다. 이것은 측정 오류가 아니라 실제적인 차이입니다.
- 나쁜 소식: 한 회사 내의 모델 제품군(예: 서로 다른 앤스로픽 모델들 사이)에서 우리가 보았던 대부분의 차이는, 주로 그들이 얼마나 목소리가 큰지, 혹은 그들이 사용하던 앱이 그들을 어떻게 형성했는지의 차이였습니다.
핵심 요약 (The Takeaway)
만약 당신이 두 AI 모델이 서로 다른 가치관을 가지고 있는지 알고 싶다면, 단순히 질문 하나를 던지고 그들이 무엇을 말하는지 봐서는 안 됩니다. 당신은 다음을 수행해야 합니다:
- 그들이 단지 "목소리가 큰 것"인지 아니면 실제로 "다른 것"인지 확인하기 위해 동일한 질문을 여러 번 던져야 합니다.
- 당신이 동일한 "문"(동일한 소프트웨어 연결)을 통해 그들과 대화하고 있는지 확인해야 합니다. 왜냐하면 그 문 자체가 그들의 마음을 바꿀 수 있기 때문입니다.
저자들은 AI의 성격에 대한 미스터리를 영원히 해결한 것은 아니지만, 그것을 들여다볼 수 있는 더 나은 돋보기를 만들어냈습니다. 그들은 우리가 깊은 철학적 이견이라고 생각했던 것이, 실제로는 한 AI는 소리치고 있고 다른 AI는 속삭이고 있는 상태이거나, 한 AI는 독단적인 매니저와 대화하고 있고 다른 AI는 조용한 친구와 대화하고 있는 상태일 수도 있다는 것을 보여주었습니다. 진짜 차이는 존재하지만, 그 차이를 보기 위해서는 노이즈를 제거해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.