On Measuring Semantic Preservation in Legal Ontology Learning
본 논문은 원본 문서와 구조화된 표현 간의 LLM 태스크 성능을 비교함으로써 법률 온톨로지 학습에서의 의미론적 손실을 정량화하고, 이러한 의미론적 보존이 특정 언어 모델과 온톨로지 학습 방법의 결합에 따라 크게 달라짐을 밝히는 새로운 평가 프레임워크를 제안하고 검증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 복잡한 법률 계약을 이해하도록 가르치려 한다고 상상해 보십시오. 당신에게는 두 가지 선택지가 있습니다. 로봇에게 원래의 무질서하고 인간이 작성한 텍스트를 그대로 입력하거나, 그 텍스트를 '온톨로지(ontology)'라고 불리는 매우 체계적이고 구조화된 지도 형태로 번역하여 입력하는 것입니다. 온톨로지는 모든 개념이 서랍이고 모든 관계가 명확한 라벨로 붙여진, 거대하고 완벽하게 분류된 파일 캐비닛과 같다고 생각하면 됩니다. 이 구조화된 지도는 로봇이 무질서한 텍스트를 읽을 때보다 더 잘 추론할 수 있도록 도울 것이라는 아이디어입니다. 하지만 여기에는 함정이 있습니다. 아주 풍부하고 미묘한 이야기를 강제로 딱딱한 파일 캐비닛에 집어넣으려 할 때, 당신은 의도치 않게 가장 중요한 '풍미'를 버리게 될 수도 있습니다. 이것이 바로 '의미 손실(semantic loss)'의 문제입니다. 즉, 구조는 유지하되 의미를 잃어버리는 것이죠. 과학자들은 파일 캐비닛이 제대로 만들어졌는지(서랍 라벨이 제대로 붙었는지?)를 확인하는 데는 뛰어난 성과를 보여왔지만, 그 서랍의 내용물이 실제 문제를 해결하기에 여전히 충분히 '맛있는지'를 확인하는 좋은 방법은 갖추지 못했습니다. 이 논문은 그 간극에 발을 들여놓으며, 다음과 같은 단순하지만 매우 중요한 질문을 던집니다. "텍스트를 구조화된 지도로 바꾸는 것이 실제로 로봇에게 도움이 되는가, 아니면 로봇이 필요로 하는 세부 사항들을 제거함으로써 오히려 로봇을 더 멍청하게 만드는가?"
이 논문의 저자인 알버트 사도프스키(Albert Sadowski)와 야로스와프 A. 추드지아크(Jarosław A. Chudziak)는 매우 구체적이고 까다로운 놀이터를 사용하여 이 아이디어를 테스트하기로 했습니다. 바로 법률 합병 계약서입니다. 이는 기업들이 서로를 인수할 때 서명하는 거대하고 복잡한 계약서로, 세부 조항과 미묘한 법적 조건들로 가득 차 있습니다. 저자들은 이 계약서들을 온톨로지로 변환하는 것이 오늘날 우리가 사용하는 초스마트 AI 챗봇인 대규모 언어 모델(LLM)이 관련 질문에 답하는 데 도움이 되는지 확인하고 싶었습니다.
이를 위해 그들은 영리한 실험을 설계했습니다. 먼저, 여섯 가지 서로 다른 AI 모델이 원래의 무질서한 계약서를 읽고 34가지 유형의 법률 질문에 답하게 했습니다. 이것은 원본 텍계에서 AI가 이해할 수 있는 정보의 최대치를 나타내는 '기준점(baseline)' 점수가 되었습니다. 그다음, 동일한 계약서들을 세 가지 서로 다른 '온톨로지 학습(ontology learning)' 방식(LLMs4OL, NeOn-GPT, NeOn-CoT)을 통해 구조화된 지도로 변환했습니다. 마지막으로, 동일한 AI 모델들에게 똑같은 질문을 던지되, 이번에는 원본 텍스트가 아닌 오직 구조화된 지도만을 보고 답변하게 했습니다.
결과는 다소 충격적이었습니다. 논문에 따르면, AI 모델들이 구조화된 지도 대신 원본 텍스트를 사용했을 때보다 성능이 저하되는 경우가 거의 모든 경우에서 발견되었습니다. 이는 마치 맛있는 복합적인 스튜를 가져다가 국물과 향신료를 모두 걸러내어 깔끔한 식재료 목록으로 만든 뒤, 요리사에게 그 목록만을 가지고 스튜의 맛을 재현해 보라고 요구하는 것과 같습니다. '의미 손실'은 실재했으며 측정 가능했습니다. 어떤 방식을 사용했느냐에 따라 AI 모델들의 정확도는 평균적으로 8.4에서 27.4 퍼센트 포인트까지 하락했습니다. LLMs4OL 방식이 가장 심각한 가해자였으며, 가장 많은 정보를 사라지게 만들었습니다. 반면 NeOn-GPT는 의미를 가장 많이 보존한, 그나마 '덜 나쁜' 방식이었습니다.
하지만 이야기는 어떤 AI 모델이 읽고 있느냐를 살펴볼 때 더욱 흥러워집니다. 논문은 이 손실이 모두에게 동일하게 나타나지 않는다는 것을 발견했습니다. 즉, AI 모델의 '성격'과 지도를 만드는 데 사용된 방식에 따라 결과가 크게 달라졌습니다. 예를 들어, Gemini라고 불리는 한 모델은 특정 방식인 NeOn-CoT와 결합했을 때 어려운 과제에서도 원래 의미의 약 86~88%를 유지하며 놀라운 성능을 보여주었습니다. 하지만 동일한 방식을 다른 모델과 짝지었을 때는 성능이 급락했습니다. 이는 이러한 법률 지도를 만드는 데 있어 단 하나의 '최선'의 방법은 없으며, 대신 AI의 두뇌와 지도를 만드는 도구 사이의 완벽한 궁합을 찾아야 한다는 점을 시사합니다.
저자들은 또한 질문의 유형도 중요하다는 점을 주목했습니다. 만약 "예 또는 아니오"와 같이 단순한 질문이라면, 구조화된 지도는 거의 완벽하게 작동하며 정보 손실이 거의 없었습니다. 하지만 "아닐 가능성이 높다"와 "합리적으로 가능성이 있다"의 차이와 같은 미묘한 법적 뉘앙스를 이해해야 하는 질문의 경우, 구조화된 지도는 처참하게 실패했습니다. 종종 의미의 최대 65%까지 손실되었습니다. 온톨로지의 경직된 구조는 변호사들이 의존하는 확률의 섬세한 색조를 포착하지 못했습니다.
결론적으로, 이 논문은 온톨로지 사용을 중단해야 한다고 말하는 것이 아닙니다. 대신, 무언가를 구조화한다고 해서 그것이 자동으로 더 좋아질 것이라고 가정하지 말라고 경고합니다. 저자들은 AI가 법적 결정을 내리는 데 도움을 줄 수 있도록 구조화된 지도를 신뢰하기 전에, 그것이 우리가 중요하게 여기는 의미를 실제로 보존하는지 먼저 테스트해야 한다고 제안합니다. 그들은 복잡한 법적 추론을 위해 텍스트를 구조화된 지도로 변환하는 과정이 종로 정답을 결정짓는 바로 그 세부 사항들을 흔히 제거한다는 것을 발견했습니다. 따라서 온톨로지는 여전히 데이터를 정리하는 데 유용하지만, 특히 그 '아기'가 수십억 달러 규모의 거래 결과를 바꿀 수 있는 미묘한 법적 논거일 때는, 목욕물을 버리려다 아기까지 함께 버리지 않도록 주의해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.