Gated Against One Model, Open to the Next: Option-Only Solvability in Legal Multiple-Choice Benchmarks
이 논문은 UA-JudgeExam과 같은 법률 다지선다형 벤치마크가 악용 가능한 선택지 위치 편향 및 오답 패턴으로 인해 모델들이 질문을 읽지 않고 오직 선택지만을 사용하여 해결할 수 있는 경우가 많음을 밝히며, 이는 진정한 법률적 추론 능력을 정확하게 평가하기 위해 엄격한 게이팅과 디바이아싱(debiasing)이 필요함을 시사한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능의 세계에서 연구자들은 컴퓨터가 얼마나 똑똑한지 테스트하기 위해, 마치 학생이 표준화된 시험을 치르는 것처럼 여러 가지 객관식 질문을 던지곤 합니다. 이러한 테스트를 채점하는 일반적인 방식은 간단합니다. 컴퓨터가 정답을 맞히면 점수를 1점 주는 식입니다. 하지만 이 방법에는 숨겨진 결함이 있습니다. 컴퓨터는 정답을 맞히기 위해 반드시 질문을 이해할 필요는 없습니다. 때로는 가능한 답변 목록 자체가 질문이 완전히 숨겨져 있더라도 정답을 드러낼 만큼 충분한 단서를 포함하고 있을 때가 있습니다. 이는 오답이 서투르게 작성되었거나, 정답만이 유일하게 제대로 된 완전한 문장처럼 보일 때 발생합니다. 만약 기계가 질문을 보지 않고도 선택지만 보고 정답인 알파벳을 맞힐 수 있다면, 그 테스트는 지능을 측정하는 것이 아니라 기계가 선택지 속의 패턴을 얼마나 잘 포착하는지를 측정하는 것이 됩니다. 이는 법률 AI를 평가하려는 사람들에게 심각한 문제입니다. 왜냐하면 테스트에 결함이 있다면 그 결과는 오해의 소지가 있기 때문입니다.
한 연구자가 우크라이나의 실제 법률 질문들을 대량으로 활용하여 이 문제를 조사했습니다. 이 질문들은 판사들이 치르는 고위험 자격 시험을 위해 작성되었으며, 공식적으로 검증된 정답이 함께 제공됩니다. 연구자는 현대의 AI 모델들이 질문 자체를 전혀 보지 않고도 이 질문들을 해결할 수 있는지 확인하고자 했습니다. 연구자는 이 수천 개의 항목 중 질문은 완전히 숨긴 채, 오직 네 가지 가능한 답변만을 AI에게 보여주었습니다. 연구 결과, AI는 질문을 보지 않고도 무작위 확률보다 훨씬 더 자주 정답을 맞힐 수 있었습니다. 실제로 한 모델은 선택지만 보고도 정답을 거의 38%의 확률로 맞혔는데, 이는 아무런 정보 없이 추측했을 때 기대되는 25%보다 훨씬 높은 수치입니다. 이는 정답들이 종종 그 자체로 완결된 법률 문장이었던 반면, 오답들은 미묘한 오류를 포함하거나 부자연스러웠기 때문에 발생했습니다. AI는 무엇을 묻고 있는지에 대한 지식 없이도 '정답처럼 들리는' 법률을 인식하는 법을 배운 것입니다.
연구자는 이를 해결하기 위한 흔한 방법인 필터링을 시도했습니다. 즉, AI가 눈먼 상태로 답을 맞힐 수 있었던 질문들을 걸러내고, AI가 실패한 질문들만 남기는 방식이었습니다. 연구자는 이를 통해 진정한 추론 능력을 테스트할 수 있는 깨끗한 질문 세트를 얻을 수 있기를 희망했습니다. 그러나 실험 결과는 놀라운 진실을 드러냈습니다. 이 해결책은 작동하지 않았습니다. 연구자는 특정 하나의 AI 모델을 사용하여 필터를 만들었지만, 더 강력한 다른 모델로 남은 질문들을 테스트했을 때, 그 새로운 모델 역시 여전히 높은 정확도로 정답을 눈먼 상태로 맞힐 수 있었습니다. 그 필터는 첫 번째 모델이 이용하기 쉬운 질문들만 제거했을 뿐, 더 똑똑한 모델이 이용하기 쉬운 질문들은 제거하지 못했던 것입니다. 연구는 AI 모델이 발전할수록 선택지에 숨겨진 단서들을 포착하는 능력이 더 좋아진다는 것을 보여주었으며, 이는 한 모델을 위해 정제된 테스트가 더 나은 모델에게는 즉시 무용지물이 된다는 것을 의미합니다.
또한 연구자는 이 문제가 법률이라는 주제 자체의 문제가 아니라, 질문이 어떻게 작성되었는지의 문제라는 것을 발견했습니다. 연구자는 우크라이나 시험 질문을 형식이 다른 LEXam이라는 다른 법률 테스트와 비교했습니다. LEXam 테스트에서는 선택지가 완전한 문장이 아니라, 질문에 있는 목록을 참조하는 "문장 1과 3"과 같은 짧은 지시어 형태를 취합니다. 이러한 선택지들은 그 자체로는 아무런 의미를 갖지 않기 때문에, AI는 질문을 읽지 않고서는 정답을 맞힐 수 없습니다. 연구자가 이 다른 형식의 테스트에 AI 모델들을 투입했을 때, 모델들은 더 이상 눈먼 상태로 정답을 맞히지 못했으며, 정확히 무작위 확률 수준의 점수를 기록했습니다. 이는 결함이 AI의 추론 능력에 있는 것이 아니라, 테스트 질문의 설계에 있다는 것을 입증했습니다. 선택지가 완전하고 독립적인 문장일 때는 테스트가 취약해지지만, 선택지가 단순히 지시어 형태일 때는 테스트가 안전하게 유지됩니다.
연구는 단순히 '나쁜' 질문을 걸러내는 것만으로는 해결책이 될 수 없다고 결론짓습니다. 왜냐에는 '나쁜' 질문의 정의가 AI가 얼마나 똑똑한지에 따라 달라지기 때문입니다. AI의 능력을 진정으로 측정하기 위해서 연구자들은 두 가지 수치를 보고해야 합니다. 즉, 전체 질문을 보았을 때의 성적과 질문을 숨겼을 때의 성적입니다. 또한 특정 알파벳(예를 들어 항상 'A'를 선택하는 습관)을 고르는 경향이 점수를 인위적으로 높일 수 있다는 점도 고려해야 합니다. 이 논문은 법률 시험 및 유사한 전문 테스트의 경우, 답변 선택지의 형식이 가장 결정적인 요소라고 제안합니다. 만약 답변이 완전한 명제로 작성된다면, 그 테스트는 옵션만 읽어도 답을 알 수 있는 AI에 의해 타협될 가능성이 큽니다. 만약 답변이 지시어 형태로 설계된다면, 테스트는 추론을 측정하는 유효한 도구로 남을 것입니다. 연구자는 자신의 전체 데이터셋과 테스트 결과를 공개하여, 어떤 질문이 정보를 유출했는지와 그렇지 않은지를 다른 이들이 확인할 수 있도록 함으로써, 더 나은, 더 정직한 인공지능 평가를 구축하기 위한 명확한 길을 제시했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.