← 최신 논문
💻 computer science

Sense-Augmented Corpus for Sanskrit-English Machine Translation: Corpus Construction, Model Fine-Tuning, and Evaluation

이 논문은 LLM과 맞춤형 의미 목록을 사용하여 의미가 보강된 병렬 코퍼스를 구축함으로써 산스크리트어-영어 기계 번역의 어휘적 모호성 문제를 다루며, 단어 의미 정보를 명시적으로 포함하는 것이 다양한 모델 아키텍처 전반에서 번역 품질을 유의미하게 향상시킨다는 것을 입증한다.

원저자: Anagha Pradeep, Sriram Krishnan, Ketaki Shetye, Bassam Adnan, Radhika Mamidi

게시일 2026-09-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Anagha Pradeep, Sriram Krishnan, Ketaki Shetye, Bassam Adnan, Radhika Mamidi

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

언어는 단순히 단어들의 집합 그 이상입니다. 그것은 단어가 어떤 동료와 함께 있느냐에 따라 의미가 변화하는 살아있는 체계입니다. 언어 연구에서 하나의 단어는 여러 가지 다른 역할을 수행할 수 있는데, 이를 다의성(polysemy)이라는 개념으로 알고 있습니다. 인간 독자에게 문맥은 가이드 역할을 하여, 단어가 물리적 대상, 추상적 개념, 또는 동작 중 무엇을 지칭하는지 즉각적으로 명확하게 해줍니다. 그러나 컴퓨터에게 이 작업은 매우 어려운 일입니다. 기계는 이러한 서로 다른 의미들을 구별하는 데 종종 어려움을 겪으며, 이는 문법적으로는 올바르지만 의미론적으로는 혼란스러운 번역으로 이어집니다. 이 문제는 단일 용어가 수 세기에 걸친 미묘한 의미를 담을 수 있고 디지털 자원이 부족한 산스크리트어와 같은 고대 언어에서 특히 심각합니다. 기계가 단어의 의도된 의미를 파악하지 못하면, 그 결과로 나오는 번로은 원문의 본질을 잃어버리고 심오한 철학적 진술을 터무로한 단어의 나열로 바꾸어 놓을 수 있습니다.

IIIT 하이데라바드와 중앙 산스크리트 대학교의 연구진들은 기계가 번역을 시도하기 전에 단어의 구체적인 의미에 더 주의를 기울이도록 가르침으로써 이 과제에 맞섰습니다. 그들의 연구는 산스크리트어-영어 번역을 위한 새로운 종류의 학습 데이터를 만드는 데 집중하고 있습니다. 연구진은 단순히 컴퓨터에 산스크리트어 문장과 그에 대응하는 영어 문장 쌍을 입력하는 대신, 문장의 모든 단어에 대한 정확한 의미(sense)를 식별하는 명시적인 라벨을 더해 이 쌍들을 풍부하게 만들었습니다. 그들은 강력한 인공지능 도구를 사용하여 디지털 사전 편찬가처럼 작동하게 함으로써, 각 산스크리트어 문장을 읽고 방대한 사전으로부터 모든 단어에 대한 올바른 정의를 선택하도록 했습니다. 이 과정은 컴퓨터가 단어만을 보여주는 것이 아니라, 그 단어들이 특정 문맥에서 정확히 무엇을 의미하는지도 함께 알려주는 '의미 증강(sense-augmented)' 코퍼스를 만들어냈습니다.

연구진은 특화된 번역 엔진과 범용 대규모 언어 모델을 포함한 여러 가지 번역 모델을 사용하여 이 접근 방식을 테스트했습니다. 그들은 먼저 모델들이 추가적인 학습 없이 수행 능력을 어떻게 보이는지 확인했는데, 이를 제로샷 추론(zero-shot inference) 상태라고 합니다. 예상대로 모델들은 어려움을 겪었으며, 종종 파편화되거나 원문의 요점을 완전히 놓친 번역을 내놓았습니다. 예를 들어, 전사들이 공포에 질려 도망치는 문장을 번역할 때, 기본적인 모델은 '산악 요새'를 뜻하는 단어를 단순히 '숲'으로 번역하여 원전의 중요한 이미지를 놓칠 수 있습니다. 이후 연구진이 표준 병렬 문장을 사용하여 이 모델들을 미세 조정(fine-tuning)했을 때, 번역은 훨씬 더 일관성 있고 유창해지며 개선되었습니다. 그러나 가장 극적인 품질의 도약은 모델들이 새로운 의미 증강 데이터로 학습되었을 때 일어났습니다.

결과는 명시적인 의미 정보를 제공하는 것이 테스트된 모든 모델에서 번역의 품질을 일관되게 향상시킨다는 것을 보여주었습니다. 기계는 적절한 상황에 적절한 단어를 선택하는 데 훨씬 더 능숙해졌습니다. 한 가지 구체적인 사례로, '대군(large army)'을 묘사하는 구절을 학습된 모델은 '군대'로 올바르게 번역한 반면, 표준 데이터로만 학습된 동일한 모델은 이를 '천(cloth)'으로 잘못 번역하여 장면의 의미를 완전히 바꾸어 놓았습니다. 또 다른 예로, '파티(party)' 또는 '원인(cause)'을 의미할 수 있는 단어가 있었는데, 강화된 모델은 사람들의 집단을 지칭하는 '파티'를 올려 선택한 반면, 표준 모델은 문맥에 맞지 않는 '원인'을 선택했습니다. 이러한 개선은 단순한 미세한 조정이 아니었습니다. 이는 모델이 텍스트를 이해하는 방식의 근본적인 변화를 의미하며, 이전에는 실패를 일으켰던 모호성을 해결할 수 있게 해주었습니다.

이 연구는 또한 이 방법이 번역을 위해 설계되지 않은 범용 인공지능 모델에서도 잘 작동한다는 점을 강조했습니다. 일반적으로 특정 언어 쌍에서 어려움을 겪는 범용 모델이 의미 증강 데이터로 학습된 후에는 전용 번역 엔진에 필적하는 성능 수준에 도달할 수 있었습니다. 이는 더 나은 번역의 핵심이 단순히 더 많은 데이터를 갖는 것이 아니라, 의미론적으로 풍부한 데이터를 갖는 데 있음을 시사합니다. 연구진은 모델들이 문맥에 적절한 선택을 하는 법을 배우며, 결과적으로 문구를 반복하거나 엉뚱한 내용을 생성하는 기계 번역의 흔한 오류를 효과적으로 줄인다는 것을 발견했습니다. 이 풍부한 데이터셋을 만드는 과정에는 상당한 계산 능력과 시간이 필요했지만, 그 보상은 명시적인 의미 구별 학습이 번역을 더 정확할 뿐만 아니라 원문의 정신에 더 충실하게 만든다는 것을 명확히 입증했습니다.

이 연구는 기계 번역의 모든 문제를 해결했다고 주장하거나 현재의 방법이 완벽하다고 제안하는 것은 아닙니다. 연구진은 자신들의 의미 목록(sense inventory)이 매우 상세하여 때때로 모델이 매우 유사한 의미들 사이에서 선택하는 것을 어렵게 만들었다고 언급했습니다. 또한 초기 의미 할당 과정에서의 오류가 최종 번역에 영향을 미칠 수 있다는 점도 인정했습니다. 그러나 이 연구 결과는 특히 데이터가 부족한 저자원 언어에 유망한 경로를 제시합니다. 명시적인 의미 정보가 인간의 이해와 기계의 처리 사이의 간극을 메울 수 있음을 보여줌으로써, 이 연구는 컴퓨터가 인간 언어의 복잡하고 층위적인 의미와 상호작용하는 방식을 개선하는 청사진을 제공합니다. 궁극적인 목표는 단순히 단어를 번역하는 것이 아니라 화자의 정확한 의도와 뉘앙스를 전달하는 것이며, 이는 세심한 의미 인식 학습만이 제공할 수 있는 수준의 이해를 요구하는 작업입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →