← 최신 논문
🤖 machine learning

Rashomon Alignment

이 논문은 관찰된 데이터뿐만 아니라 전체 입력 공간에 걸쳐 머신러닝 모델 간의 기능적 유사성을 평가하는 새로운 기하학적 척도인 라쇼몽 정렬(Rashomon Alignment, RA)을 소개하며, 이는 모델 선택 및 해석 가능성과 같은 응용 분야를 위한 분포 기반 방식에 대한 보완적인 관점을 제공한다.

원저자: Moisés Santos, Peter van der Putten, Bernhard Pfahringer, Carlos Soares

게시일 2026-07-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Moisés Santos, Peter van der Putten, Bernhard Pfahringer, Carlos Soares

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 고양이를 인식하는 법을 가르치고 있다고 상상해 보십시오. 당신은 로봇에게 수천 장의 사진을 보여주고, 로봇은 수염과 뾰족한 귀를 포착하는 법을 배웁니다. 하지만 여기서 까다로운 점이 있습니다. 두 로봇 모두 사진의 90%를 정확히 맞힐 수 있지만, 그들이 '생각하는' 방식은 완전히 다를 수 있다는 것입니다. 한 로봇은 배경을 보고 있는 반면, 다른 로봇은 귀에 집중하고 있을 수도 있습니다. 머신러닝의 세계에서 이것은 매우 중요한 문제입니다. 만약 당신이 최종 점수(정확도)만 본다면, 두 로봇이 쌍둥이처럼 똑같다고 생각할 수도 있지만, 실제로는 그저 당신이 준 테스트에서 우연히 일치했을 뿐인 타인일 수도 있습니다. 이 논문은 '모델 유사성(model similarity)'이라는 컴퓨터 과학의 특정 분야을 깊이 파고듭니다. 이 논문은 다음과 같은 단순하지만 심오한 질문을 던집니다. "두 AI 모델이 실제로 세상을 같은 방식으로 보고 있는 것인가, 아니면 그저 운 좋은 우연인가?" 저자들은 단순히 테스트 점수를 확인하는 것을 넘어, 모델들이 마음속에 그리는 하나의 카테고리를 다른 카테고리와 구분 짓는 보이지 않는 선인 '결정 경계(decision boundaries)'를 매핑하고자 합니다.

이 논문의 저자인 모이세스 산토스(Moisés Santos)와 그의 팀은 **라쇼몽 정렬(Rashomon Alignment)**이라 불리는 새로운 유사성 측정 방법을 제 제안합니다. 이것을 이렇게 생각해 보십시오. 두 명의 지도 제작자가 신비로운 섬의 지도를 그리고 있다고 가정해 봅시다. 한 지도 제작자는 관광객들이 주로 가는 곳(유명한 해변과 호텔)만을 그립니다. 다른 지도 제작자는 울창하고 탐험되지 않은 정글과 숨겨진 동굴을 포함한 섬 전체를 그립니다. 만약 관광 지역만 본다면 그들의 지도는 동일해 보일 수 있습니다. 하지만 시야를 넓혀 섬 전체를 본다면, 한 지도 제작자가 산을 그린 곳에 다른 지도 제작자는 호수를 그렸다는 사실을 발견할 수도 있습니다.

이 논문은 이 지도 확인 도구의 두 가지 버전을 소개합니다. 첫 번째는 **분포적 라쇼MON 정렬(Distributional Rashomon Alignment, dRA)**입니다. 이것은 첫 번째 지도 제작자와 같습니다. 모델이 실제로 본 데이터(관광 명소)에 대해 얼마나 동의하는지를 확인합니다. 두 번째이자 이 논문의 주인공은 **기하학적 라쇼몽 정렬(Geometric Rashomon Alignment, gRA)**입니다. 이것은 두 번째 지도 제작자입니다. 이 방식은 실제 데이터가 어디에 있는지에 구애받지 않고, 대신 가능한 모든 공간을 덮는 완벽하게 균일한 격자 위에서 모델들에게 추측을 요구합니다. 이는 모델들이 이전에 본 적 없는 영역에서도 실력을 드러내게 함으로써, 그들의 내부 논리가 진정으로 유사한지 아니면 훈련된 특정 데이터의 우연한 결과인지를 밝혀냅니다.

이를 테스트하기 위해, 팀은 UCI 머신러닝 저장소92개 서로 다른 데이터셋을 사용하여 대규모 실험을 수행했습니다. 그들은 두 종류의 결정 트리(decision trees)를 서로 맞붙였습니다. 하나는 "언프루닝(unpruned)" 트리(모든 세세한 부분까지 기억하도록 야생 상태로 자라도록 허용된 복잡한 트리)이고, 다른 하나는 "프루닝(pruned)" 트리(더 단순하고 일반적이 되도록 다듬어진 트리)입니다. 그들은 정확도만 보는 것이 종종 오해를 불러일으킬 수 있다는 것을 발견했습니다. 많은 경우, 두 트리는 매우 유사한 점수를 가졌지만, gRA는 그들이 전체 공간에 걸쳐 완전히 다른 방식으로 결정을 내리고 있음을 드러냈습니다.

결과는 놀라웠습니다. 연구는 gRAdRA가 서로 다르면서도 상호 보완적인 관점을 제공한다는 것을 보여주었습니다. 때때로 모델들은 보이는 데이터에 대해서는 완벽하게 동의했지만(높은 dRA), 그 외의 모든 곳에서는 격렬하게 불일치했습니다(낮은 gRA). 이는 위험한 상황입니다. 즉, 모델이 취약하며 데이터가 조금만 변해도 처참하게 실패할 수 있음을 의미합니다. 저자들은 약 92개의 데이터셋에서 기하학적 정렬(gRA)은 0에서 1 사이의 전체 범위에 걸쳐 넓게 퍼져 있는 반면, 분포적 정렬(dRA)은 높은 값에 밀집되어 있다는 것을 발견했습니다. 이는 모델들이 전체 섬보다는 '관광 명소'에서 더 많이 동의하는 경향이 있음을 시사합니다.

결정적으로, 이 논문은 정확도나 데이터 기반의 합의에만 의존하는 것이 기만적일 수 있다고 제안합니다. 예를 들어, 그들은 두 모델이 정확히 같은 정확도를 가졌지만 구조적으로 매우 달랐던 경우(낮은 gRA)와, 구조적으로 거의 동일했지만(높은 gRA) 테스트 데이터가 까다로운 지점에 위치했기 때문에 정확도가 달랐던 경우를 식별했습니다. 저자들은 기하학적 라쇼몽 정렬이 강력한 새로운 도구라고 결론짓습니다. 이것은 정확도를 대체하는 것이 아니라, 두 모델의 논리가 진정으로 정렬되어 있는지 아니면 우리가 가진 특정 데이터에서 속임수를 쓰고 있는 것인지를 파악할 수 있게 해주는 필수적인 이해의 층위를 더해줍니다. 이는 엔지니어들이 더 나은 AI 팀(앙상블)을 구축하고, 모델이 왜 실수를 하는지뿐만 아니라 모델이 실수를 하는 이유를 이해하는 데 도움을 줄 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →