← 최신 논문
💬 NLP

Naamah: A Large Scale Synthetic Sanskrit NER Corpus via DBpedia Seeding and LLM Generation

본 논문은 DBpedia 개체 추출과 24B 파라미터 하이브리드 추론 모델을 결합하여 생성된 10 만 개 이상의 문장으로 구성된 대규모 합성 산스크리트어 개체명 인식 코퍼스인 Naamah 를 소개하며, 이는 다국어 및 인도어 특화 트랜스포머 아키텍처를 평가하는 데 사용됩니다.

원저자: Akhil Rajeev P, Annarao Kulkarni

게시일 2026-04-30
📖 3 분 읽기☕ 가벼운 읽기

원저자: Akhil Rajeev P, Annarao Kulkarni

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

고대 산스크리트어 책들로 가득 찬 거대한 도서관을 상상해 보세요. 이 책들은 신, 왕, 도시, 조직의 이름으로 가득 차 있습니다. 컴퓨터에게 이 책들을 이해하도록 가르치려면, 이러한 이름들이 강조되고 라벨이 붙은 수천 개의 예시 (예: "이것은 사람이다", "이것은 장소다") 를 보여줘야 합니다.

문제점은 무엇일까요? 아직 아무도 그 라벨을 작성하지 않았습니다. 고대 텍스트를 직접 읽고 라벨을 붙이는 것은 눈가리개를 한 채 건초더미에서 바늘을 찾는 것과 같습니다; 전문가들이 수 년을 보내고 막대한 비용이 듭니다.

이 논문은 Naamah라는 솔루션을 소개합니다 (산스크리트 문학의 한 인물에서 이름을 따왔으나, 논문은 이름의 의미를 명시적으로 설명하지는 않습니다. 이는 프로젝트의 제목으로 사용됩니다). 그들이 이를 어떻게 구축했고 무엇을 발견했는지 간단히 설명하겠습니다:

1. 레시피: 데이터를 만든 방법

사람들을 고용하여 책에 라벨을 붙이는 대신, 저자들은 데이터를 요리할 "로봇 요리사"를 구축했습니다.

  • 재료 (DBpedia): 그들은 DBpedia 라는 거대한 디지털 백과사전에서 시작했습니다. 실제 이름들—사람, 장소, 조직—의 목록을 추출했습니다. 로봇이 유명한 이름들을 단순히 암기하지 않도록 하기 위해, 산스크리트 문자로 쓰인 현대 외국 이름 (예: "Giacomo Libera") 을 섞었습니다. 이는 컴퓨터가 유명한 얼굴을 인식하는 것이 아니라 산스크리트 문법의 규칙을 배우도록 강요했습니다.
  • 요리사 (AI 모델): 그들은 인도 언어를 이해하도록 특별히 훈련된 매우 똑똑한 240 억 파라미터 AI 모델 ("하이브리드 추론 모델") 을 사용했습니다.
  • 요리 과정: "라마는 숲으로 갔다"와 같은 경직된 사전 작성 문장 템플릿을 AI 에게 강요하는 대신, 저자들은 AI 에게 자연스럽게 이러한 이름들을 문장에 엮어 넣도록 요청했습니다. 이를 통해 AI 는 이름들이 다양한 문법적 형태로 나타나는 수천 개의 고유하고 문법적으로 정확한 문장을 생성할 수 있었습니다 (이는 산스크리트어에서 매우 흔한 현상입니다).
  • 품질 관리: 그들은 명백한 실수를 잡아내기 위해 출력을 필터에 통과시켰습니다. 결과는 무엇일까요? 102,942 개의 문장으로 구성된 "실버 표준" 데이터입니다. "실버"는 완벽하지는 않지만 (골드처럼), 컴퓨터를 효과적으로 훈련시키기에 충분히 고품질임을 의미합니다.

2. 실험: 두 명의 다른 학생

이 새로운 데이터셋이 작동하는지 테스트하기 위해, 그들은 두 개의 다른 컴퓨터 모델에게 이러한 이름들을 찾도록 가르쳤습니다:

  1. 거대 다국어 학생 (XLM-RoBERTa): 이는 많은 언어를 구사하는 거대한 모델입니다. 모든 것을 조금씩 읽은 학생과 같지만, 산스크리트어 전문가는 아닙니다.
  2. 소형 전문가 (IndicBERTv2): 이는 인도 언어를 위해 특별히 설계된 더 작고 가벼운 모델입니다. 평생 동안 해당 지역의 특정 방언과 문자를 연구한 학생과 같습니다.

3. 결과: 크기가 전부는 아님

그들이 두 학생을 새로운 데이터셋으로 테스트했을 때, 전문가 (IndicBERTv2) 가 승리했습니다. 비록 훨씬 작았음에도 불구하고요.

  • 점수: 전문가는 0.96의 점수를 받았고, 거대 다국어 학생은 0.95를 받았습니다.
  • 실제 이유 ("균열" 문제): 논문은 거대 모델이 패배한 흥미로운 이유를 발견했습니다. 산스크리트어 단어들은 종종 접착제처럼 붙어 있습니다 (sandhi라고 불리는 특징).
    • "쿠루크셰트라에서"라는 단어가 하나의 길고 융합된 단어라고 상상해 보세요.
    • 전문가는 전체 단어를 보고 정확하게 "이것은 장소다"라고 말했습니다.
    • 거대 모델은 산스크리트어에 맞춰 구축되지 않은 사전 때문에 단어를 조각내려 했습니다. 그것은 단어의 첫 부분을 "장소"로 보았지만, 작은 끝부분을 별도의 혼란스러운 단어로 보아, 잘못 추측하여 "조직"이라고 판단했습니다.

비유: 단어 사이의 공백이 지워진 문장을 읽으려 하는 것과 같습니다. 전문가는 언어를 잘 알고 있어 단어가 어디서 끊어지는지 추측할 수 있습니다. 반면, 영어 공백에 익숙한 거대 모델은 혼란을 겪어 단어를 잘못된 곳에서 분리함으로써 실수를 저지릅니다.

4. 교훈

이 논문은 산스크리트어와 같은 고대 복잡 언어에 대해 다음과 같이 결론 내립니다:

  • 합성 데이터가 작동합니다: 신중하게 수행한다면 AI 를 사용하여 훈련 데이터를 생성할 수 있으며, 수천 시간의 수동 인간 라벨링이 필요하지 않습니다.
  • 가장 큰 도구보다 올바른 도구가 더 중요합니다: 특정 문자와 문법을 이해하는 더 작은 모델 (IndicBERTv2) 은 단어를 잘못 분리하지 않았기 때문에 거대하고 일반적인 모델 (XLM-RoBERTa) 보다 더 잘 수행했습니다.

간단히 말해, 그들은 산스크리트어 이름 찾기를 위한 거대한 AI 생성 훈련 매뉴얼을 구축했고, 거대하고 일반적인 것보다 특화된 더 작은 컴퓨터 두뇌가 이 고대 언어를 읽는 데 더 뛰어나다는 것을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →