Figurative Justice: Detecting metaphors in Hindi judgements with qualitative assessment and transformers
이 논문은 저자원 힌디어 법률 텍스트에 대한 은유 분석의 부족을 해결하기 위해 힌디어 법률 은유 코퍼스(HiLeMe)와 트랜스포머 기반 탐지 모델을 소개하며, 사법적 의사결정을 해독하고 자동화된 법률 담론 도구를 다른 인도 언어로 확장하는 것을 목표로 한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
법정에서의 언어는 단순히 사실을 나열하기 위한 중립적인 도구인 경우가 드뭅다. 법은 흔-히 검은 잉크로 쓰인 엄격한 규칙의 집합으로 상상되곤 하지만, 법을 쓰고 해석하는 사람들—판사, 변호사, 입법가들—은 추상적인 아이디어를 이해하기 위해 빈번하게 비유적 언어에 의존한다. 그들은 정교와 정치를 가르는 "벽", 정의를 저울질하는 "저울", 또는 계약의 "뿌리"에 대해 말한다. 이것들은 단순한 장식적 수사가 아니다; 그것들은 법적 개념이 어떻게 이해되고, 논쟁되며, 결정되는지를 형성하는 강력한 인지적 도구이다. 판사가 어떤 상황을 "전쟁"으로 묘사하거나 권리를 하나의 "객체"로 묘사할 때, 그들은 단순히 화려한 문구를 사용하는 것이 아니라, 사건의 실체를 프레이밍하고 있으며, 이는 처벌의 엄중함이나 인권의 해석에 잠재적인 영향을 미칠 수 있다. 이는 힌디어와 같은 언어에서 특히 중요한데, 이러한 은유의 뉘란스가 법적 논거의 전체 의미를 바꿀 수 있음에도 불구하고, 지금까지 컴퓨터가 인도 법원 문서에서 이를 자동으로 포착할 수 있는 방법을 구축한 사람은 없었다.
에스토니아와 인도의 연구진은 힌디어 법률 판결문에서 은유를 찾아내도록 설계된 특화된 데이터셋과 컴퓨터 모델을 제작함으로써 이 문제를 해결하기 위한 첫걸음을 내디뎠다. "피규러티브 저스티스(Figurative Justice)"라는 제목의 이들의 연구는 인공지능 분야의 중요한 공백을 다룬다. 컴퓨터는 영어, 스페인어 및 기타 주요 언어를 읽고 이해하는 데 매우 능숙해졌지만, 힌디어와 같이 "저자원(low-resource)" 언어가 법률이라는 복잡하고 이해관계가 걸린 환경에서 사용될 때는 어려움을 겪는다. 연구진은 인도 우타르프데시 주의 실제 지방 법원 판결문에서 수천 개의 문장을 수집하는 것으로 시작했다. 이 문서들은 전적으로 힌디어로 작성되었으며 법적 추론의 원재료를 담고 있었다. 이 텍텍스트를 이해하기 위해, 연구팀은 여섯 명의 법률 전문가를 컴퓨터를 위한 인간 교사로 고용했다. 이 전문가들은 문장들을 읽으며 단어가 은유적인 의미가 아닌 문자 그대로의 의미로 사용된 모든 사례를 표시했으며, 은유를 식별하기 위한 확립된 엄격한 방법론을 따랐다. 이 과정은 연구진이 '힌디어 법률 은유 코퍼스(Hindi Legal Metaphor Corpus)'라고 명명한, 7,000개 이상의 문장과 약 162,000개의 단어를 포함하는 새로운 데이터 모음의 결과로 이어졌다.
이 정교하게 라벨링된 데이터를 바탕으로, 연구진은 문자 그대로의 언어와 비유적 언어의 차이를 인식하도록 정교한 컴퓨터 모델을 훈련시켰다. 그들은 문장 전체 내에서 단어의 맥락을 이해할 수 있는 시스템인 '트랜스포머(transformer)'라고 알려진 유형의 인공지능을 사용했다. 모델에는 힌디어 문장들이 입력되었고, 텍-스트의 특정 부분이 은유를 포함하고 있는지 예측하도록 학습되었다. 결과에 따르면, 컴퓨터는 약 72퍼센트의 전체 정확도로 문자 그대로의 언어와 비유적 언어를 구별할 수 있었다. 이는 기계에게 힌디어 법률 텍스트에 숨겨진 의미의 층위를 보는 법을 가르치는 것이 가능하다는 것을 입증하는 유망한 시작이다. 그러나 이 연구는 과업의 난이도 또한 드러냈다. 모델이 은유를 구체적으로 찾으려고 했을 때, 모델은 추측할 때마다 약 절반 정도만 맞혔으며, 텍스트에 존재하는 실제 은유의 3분의 2 이상을 놓쳤다. 이는 컴퓨터가 명백한 사례들은 포착할 수 있지만, 법적 논거에서 자주 등장하는 미묘하고, 정교하며, 고도로 맥락적인 은유를 파악하는 데는 여전히 어려움을 겪고 있음을 시사한다.
연구진은 그 도전 과제가 부분적으로 법률 언어 자체의 본질, 즉 은유가 눈에 띄는 비교로서 두드라지기보다는 논거의 구조 속에 깊숙이 박혀 있는 특성 때문이라는 것을 발견했다. 모델이 저지른 실수들을 분석하면서, 그들은 컴퓨터가 표준적인 법률 용어를 은유와 혼동하기도 하고, 때로는 맥락이 너무 복잡하여 은유를 인식하지 못하기도 한다는 것을 확인했다. 이 연구는 힌디어 법률의 은유 탐지 문제를 해결했다고 주장하는 것이 아니라, 오히려 지형의 신뢰할 만한 첫 번째 지도를 만들었다고 주장한다. 이 데이터셋을 구축하고 컴퓨터 모델이 기초적인 수준의 성공을 달可以 수 있음을 입증함으로써, 팀은 향후 연구를 위한 토대를 마련했다. 그들의 연구 결과는 힌디어로 된 사법 결정을 진정으로 이해하고, 판사가 사용하는 비유적 언어가 의도치 않게 결과에 편향을 주지 않도록 하기 위해서는 행간을 읽을 수 있는 도구가 필요하다는 점을 시사한다. 이 연구는 유사한 기술을 인도의 다른 21개 지정 언어에 적용하여, 법률적 은유의 숨겨진 힘을 가시화하고 비판적 검토에 개방하는 길을 열어준다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.