← 최신 논문
💬 NLP

The Annotation Bottleneck in Persian Text NLP: Persian as an Annotation-Scarce Language

이 논문은 페르시아어가 단순히 전 세계적으로 저자원 언어라기보다 '주석 결핍형(annotation-scarce)' 언어로 특징지어져야 한다고 주장하며, 페르시아어의 NLP 과제가 단순히 레이블링된 데이터 양의 부족이 아니라 불균형한 태스크 커버리지, 호환되지 않는 스킴, 그리고 접근 장벽에서 기인함을 밝히고 있다.

원저자: MohammadHossein Mortazavi, Mostafa Salehi, Hadi Veisi

게시일 2026-08-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: MohammadHossein Mortazavi, Mostafa Salehi, Hadi Veisi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인간의 언어를 이해하는 컴퓨터의 세계에는 어떤 언어는 다른 언어보다 가르치기가 단순히 더 어렵다는 지속적인 믿음이 존재한다. 이러한 어려움은 흔히 디지털 텍스트의 부족 탓으로 돌려지며, 마치 어떤 언어가 기능하기 위해서는 방대한 양의 라벨링되지 않은 책들이 필요하다는 식이다. 하지만 인공지능에게 있어 진정한 과제는 단순히 단어를 갖는 것이 아니라, 그 단어들에 지침(instructions)이 정교하게 표시되어 있는가 하는 점이다. 모든 책이 외국어로 쓰인 도서관을 상상해 보라. 만약 컴퓨터가 그 책들로부터 학습하게 하고 싶다면, 단순히 가공되지 않은 텍스트만을 제공해서는 안 된다. 문장이 무엇을 의미하는지, 누가 말하고 있는지, 그리고 감정은 어떠한지를 설명하는 가이드를 함께 제공해야 한다. 이처럼 지침을 추가하는 과정을 '어노테이션(annotation, 주석 달기)'이라고 부른다. 많은 언어의 경우 이 가이드가 풍부하게 존재한다. 그러나 다른 언어들의 경우, 이 가이드가 누락되어 있어, 설령 가공되지 않은 텍스트가 풍부하더라도 신뢰할 수 있는 시스템을 훈련하는 것이 거의 불가능해진다.

이것이 바로 테헤란의 연구자들이 페르시아어(파르시라고도 알려진)와 관련하여 조사해 온 구체적인 퍼즐이다. 수년간 컴퓨터 과학 분야에서 페르시아어에 대한 표준적인 설명은 이 언어가 '저자원(low-resource)' 언어라는 것이었으며, 이 라벨은 이 언어가 근본적으로 데이터가 부족하다는 암시를 담고 있었다. 하지만 새로운 분석은 이 라벨이 너무 투박한 도구라고 주장한다. 연구자들은 페르시아어가 원재료가 부족한 것이 아니라고 주장한다. 사실 페르시아어는 전 세계 알려진 웹사이트의 거의 1%에서 나타나며, 방대한 뉴스, 블로그, 문학 컬렉션 속에 등장하는 등 거대한 디지털 발자국을 가지고 있다. 그들이 발견한 진짜 문제는 단어가 부족한 것이 아니라, 사용할 수 있는 가이드가 부족하다는 것이다. 가용 가능한 지침들이 흩어져 있거나, 일관성이 없거나, 혹은 특정 유형의 과업에 대해 완전히 누락되어 있어, 컴퓨터가 언어는 알지만 의료 보고서, 일상적인 대화, 또는 복잡한 논리적 논증의 미묘한 차이를 신뢰성 있게 이해하지 못하는 병목 현상을 만들어내고 있다.

이 결론에 도달하기 위해, 테헤란 대학교의 팀은 단순히 데이터셋을 세는 것에 그치지 않았다. 대신 그들은 2026년 중반 기준 사용 가능한 34개의 뚜렷한 텍text 자원을 목록화하며 페르시아 디지털 환경의 상세한 지도를 구축했다. 그들은 고대 시집부터 현대 소셜 미디어 피드에 이르기까지, 그리고 뉴스 아카이브에서 음성 녹음까지 모든 것을 살펴보았다. 또한 독립적인 도구를 사용하여 수백만 페이지를 스캔함으로써, 오픈 웹상에 실제로 얼마나 많은 페르시아어가 존재하는지 측정하며 학술적 영역 밖으로 나갔다. 그들의 목표는 라벨링된 데이터의 양이 가용한 텍스트의 총량과 일치하는지 확인하는 것이었다. 그들은 그 관계가 결코 균등하지 않다는 것을 발견했다. 뉴스 기사에서 이름을 식별하거나 표준 문장의 문법을 파싱하는 것과 같은 일부 영역에서는, 영어와 비교했을 때도 라벨링된 데이터의 양이 놀라울 정도로 높았다. 이러한 특정 섬(islands) 지역에서 페르시아어는 충분한 지원을 받고 있다.

하지만 연구자들이 다른 과업들을 살펴보았을 때 그림은 극적으로 변한다. 논리적 논증을 이해하거나 맥락으로부터 의미를 추론하는 과업을 조사했을 때, 라벨링된 데이터의 양은 웹상에서의 언어적 존재감을 고려할 때 기대되는 수준보다 훨씬 낮게 떨어졌다. 또한 연구는 존재하는 데이터조차 마찰(friction)을 겪는 경우가 많다는 점을 강조했다. 서로 다른 프로젝트들이 텍스트를 마킹하는 데 서로 다른 규칙을 사용하기 때문에, 이를 결합하는 것이 어렵다. 어떤 자원들은 불분명한 라이선스 뒤에 잠겨 있고, 다른 것들은 올바르게 사용하기 위한 필수적인 문서가 부족하다. 이는 설령 데이터셋이 존재하더라도, 법률 계약을 분석하거나 지역 방언을 이해하는 것과 같은 다른 목적의 시스템을 구축하려는 새로운 연구자에게는 사용 불가능할 수 있음을 의미한다.

연구자들은 이 패턴이 오디오에서도 유지되는지 확인하기 위해 음성 언어로 조사를 확장했다. 그들은 유사한 이야기를 발견했다. 현재 수천 시간의 페르시아어 음성 녹음이 사용 가능하지만, 그에 부착된 지침의 깊이는 매우 다양하다. 어떤 녹음은 상세한 음성학적 분해를 포함하고 있는 반면, 어떤 것은 기본적인 전사(transcript)만을 가지고 있다. 이는 문제가 데이터의 완전한 부재가 아니라, 다양한 작업에 필요한 구체적이고 고품질인 감독(supervision)의 불균형한 분포에 있음을 확인시켜 준다. 이 연구는 페르시아어가 전 세계적으로 라벨링된 볼륨이 결핍되어 있다는 아이디어를 명시적으로 거부한다. 대신, 더 정밀한 진단을 제안한다. 페르시아어는 '어노테이션 결핍(annotation-scarce)' 언어라는 것이다. 이 용어는 결핍이 총 단어 수에 있는 것이 아니라, 컴퓨터가 수행해야 할 전체 범위의 과업에 걸쳐 일관되고 접근 가능하며 잘 문서화된 지침의 가용성에 있다는 상황을 설명한다.

이 발견의 함의는 이 분야가 앞으로 나아가는 방식에 있어 매우 중요하다. 만약 문제가 단순히 텍스트의 부족이라면, 해결책은 더 많은 웹사이트를 긁어모으는(scrape) 것이 될 것이다. 하지만 문제가 사용 가능한 가이드의 부재라면, 해결책은 전략의 전환을 요구한다. 연구자들은 커뮤니티가 모든 새로운 데이터셋을 개별적인 승리로 취급하는 것을 멈추고, 기존의 자원들을 더 쉽게 찾고, 결합하고, 신뢰할 수 있도록 만드는 데 집중해야 한다고 제안한다. 그들은 데이터셋의 크기뿐만 아니라 라이선스, 구체적인 규칙, 그리고 다른 자원과의 중첩 정도를 추적하는 공공 레지스트리를 호출한다. 또한 그들은 데이터가 단일 표준 방언만을 반영하는 것이 아니라 언어의 다양성을 반영할 수 있도록, 더 나은 문서화와 이 어노테이션을 만드는 사람들에 대한 보호를 강조한다.

궁극적으로, 이 논문은 오랫동안 유지되어 온 가설에 대한 교정 역할을 한다. 그것은 페르시아어가 디지털 시대에 자신의 목소리를 찾는 데 어려움을 겪고 있는 언어가 아니라, 이미 크고 눈에 띄는 존재감을 가지고 있으나 현재 파편화된 지침 인프라에 의해 제약을 받고 있는 언어임을 명확히 한다. 앞으로의 길은 단순히 가공되지 않은 데이터를 더 많이 수집하는 것이 아니라, 이미 존재하는 데이터를 조직하고, 지침이 누락된 특정 격차를 채우며, 우리가 구축하는 가이드가 인간 의사소통의 복잡성을 다룰 수 있을 만큼 견고하도록 보장하는 것이다. 양(quantity)에서 질(quality)과 사용성(usability)으로 초점을 전환함으로써, 이 분야는 병목 현상을 넘어 페르시아어의 풍요로움을 진정으로 이해하는 시스템을 구축할 수 있을 것이다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →