← 최신 논문
💬 NLP

Paramanu: Compact and Competitive Monolingual Language Models for Low-Resource Morphologically Rich Indian Languages

이 논문은 5개의 주요 인도 언어를 위해 오픈 소스 데이터로부터 처음부터 학습된 컴팩트하고 비용 효율적인 단일 언어 모델 제품군인 Paramanu를 소개하며, 이는 특화된 토크나이저와 학습 기술을 활용하여 작은 크기와 단일 GPU 학습 예산에도 불구하고 더 큰 다국어 모델보다 뛰어난 성능을 발휘한다.

원저자: Mitodru Niyogi, Eric Gaussier, Arnab Bhattacharya

게시일 2026-01-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mitodru Niyogi, Eric Gaussier, Arnab Bhattacharya

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계를 거대하고 북적이는 도서관이라고 상상해 보세요. 오랫동안 이 도서관은 거의 전적으로 영어로 쓰인 책들로 가득 차 있었습니다. 다른 언어로 된 책들이 일부 있기는 하지만, 대개 영어 책을 번역한 것이거나 독자가 영어식으로 사고한다고 가정하는 방식으로 쓰여 있습니다. 만약 당신이 이 도서관에서 인도 언어에 관한 책을 읽으려 한다면, 페이지가 찢겨 있거나, 단어들이 잘게 부서져 혼란스럽거나, 혹은 이야기가 전혀 말이 되지 않는 상황을 마주하게 될 것입니다.

당신이 묻고 있는 논문은 PARAMANU라고 불리는 새로운 전문 컬렉션을 소개합니다. 여기에는 이들이 어떻게 이 컬렉션을 구축했는지, 그리고 이것이 왜 중요한지에 대한 이야기를 알기 쉽게 설명해 두었습니다.

문제점: "모두에게 맞는" 옷은 맞지 않는다

현재의 거대 AI 모델들은 영어 사용자들을 위해 만들어진 거대하고 무거운 정장과 같습니다. 연구자들이 이 정장을 인도 언어(힌디어, 타밀어, 벵골어 등) 사용자들에게 억지로 입히려고 하면, 옷이 제대로 맞지 않습니다.

  • "부서진 단어" 문제: 인도 언어는 "형태론적으로 풍부"합니다. 즉, 의미를 더하기 위해 단어의 형태가 매우 다양하게 변한다는 뜻입니다(예를 들어 복수형을 위해 's'를 붙이거나 과거형을 위해 'ed'를 붙이는 것보다 훨씬 더 복잡합니다). 거대 모델들은 종종 이러한 단어들을 쓸모없는 작은 조각들로 쪼개버리는데, 이는 마치 사과 전체를 먹으려 하면서 껍질만 베어 물려는 것과 같습니다. 이 때문에 AI는 느려지고 비효율적이 됩니다.
  • "영어 뇌" 문제: 이 모델들이 인도 언어를 말할 때조차, 그 밑바닥에서는 영어로 "생각"하는 경우가 많아 어색한 문장이나 편향된 표현이 나타납니다.
  • "너무 비싼 비용" 문제: 처음부터 새로운 AI를 만드는 것은 수백만 달러가 들며 슈퍼컴퓨터를 필요로 합니다. 이 때문에 인도 현지 연구자들이나 예산이 적은 이들은 자신들만의 도구를 만들 수 없습니다.

해결책: PARAMANU의 "맞춤 제작" 정장

저자들은 다섯 가지의 작고 맞춤 제작된 AI 모델 제품군인 PARAMUANU를 만들었습니다. 각 모델은 하나의 주요 인도 언어(벵골어, 힌디어, 마라티어, 타밀어, 텔루구어)를 위해 특별히 설계되었습니다.

이들을 거대하고 무거운 정장이 아니라, 그것을 입는 사람들에게 딱 맞게 제작된 가볍고 맞춤화된 유니폼이라고 생각하십시오.

1. 덧댄 것이 아닌, 기초부터 쌓아 올린 설계

영어 모델을 가져와서 인도 언어를 "가르치는" 방식(이는 프랑스어 화자에게 프랑스어 단어만을 사용하여 힌디어를 가르치려는 것과 같습니다) 대신, 그들은 오직 인도 데이터만을 사용하여 기초부터 이 모델들을 구축했습니다. 이는 수입된 재료를 사용하는 대신, 현지의 기후에 맞는 현지의 벽돌과 나무만을 사용하여 집을 짓는 것과 같습니다.

2. "스마트한 파쇄기" (토크나이저)

가장 큰 혁신 중 하나는 **토크나이저(tokenizer)**라고 불리는 새로운 방식의 단어 분해법입니다.

  • 기존 방식: "unbelievable"이라는 단어를 "un", "believ", "able"로 잘라버리는 파쇄기를 상상해 보세요. 핵심적인 의미를 놓치게 됩니다.
  • PARAMANU 방식: 그들은 인도 언어의 문법을 이해하는 "스마트한 파쇄기"를 만들었습니다. 이 파쇄기는 단어의 뿌리(root)를 온전하게 유지하고(예: "unbeliev") 접미사만을 분리합니다. 이를 통해 AI는 단어를 더 빠르게, 더 적은 "조각"으로 이해할 수 있습니다. 이를 **저비용성(low-fertility)**이라 하며, 이는 불필요한 파편을 덜 생성함을 의미합니다.

3. "예산 친화적" 구축

가장 놀라운 부분은 비용입니다. 보통 AI를 훈련시키는 것은 로켓을 발사하는 것과 같아서 막대한 예산이 필요합니다.

  • PARAMANU의 비결: 그들은 단 하나의 그래픽 카드(표준 컴퓨터 부품)와 1,000달러 미만의 예산으로 이 모델들을 훈련시키는 데 성공했습니다.
  • 비유: 이는 거대한 공장과 백만 달러의 예산 대신, 일반적인 렌치와 몇 백 달러를 사용하여 차고에서 고성능 레이싱 카를 만드는 것과 같습니다. 이를 통해 제한된 자원을 가진 연구자들도 경쟁력 있는 도구를 구축할 수 있게 됩니다.

4. 기억력 확장 (컨텍스트 스케일링)

AI 모델에는 한 번에 읽을 수 있는 텍텍스트 양의 "기억 한계"(컨텍스트 윈도우)가 있습니다. 보통 더 긴 책을 읽고 싶다면 더 큰 컴퓨터가 필요합니다.

  • 혁신: 저자들은 모델의 기억력을 "늘릴 수 있는" 수학적 기법(RoPE 보간법 사용)을 개발했습니다.
  • 비유: 짧은 자를 가지고 있다고 상상해 보세요. 더 긴 자를 사는 대신, 그들은 짧은 자의 매 인치가 지도의 1마일을 나타내도록 자에 표시를 남기는 방법을 발명했습니다. 이를 통해 모델은 더 비싼 하드웨어 없이도 더 긴 텍스트 시퀀스를 읽을 수 있습니다.

결과: 작지만 강력함

이 작은 모델들(파라미터/매개변수 수가 1억 8백만 개에서 3억 6천 7백만 개 사이—이것을 모델의 뇌세포라고 생각하세요)을 훨씬 더 큰 모델들(수십억 개의 뇌세포를 가진 모델들)과 테스트했을 때:

  • 언더독의 승리: 작은 PARAMANU 모델들이 특정 언어에서 거대하고 비싼 다국어 모델들보다 더 나은 성능을 보이는 경우가 많았습니다.
  • 효율성: 그들은 성능과 비용 사이에서 더 나은 균형을 달성했습니다. 이들은 연료를 많이 소비하는 리무진보다 연비가 좋은 컴팩트하고 효율적인 자동차와 같습니다.

"지시사항" 라이브러리

모델이 실제 작업(질문에 답하거나 명령을 따르는 등)에 도움이 되도록, 팀은 벵골어로 된 "지시사항(instruction)" 예시 세트를 만들었습니다. 그런 다음 이를 다른 네 가지 언어로 정교하게 번역했습니다. 이는 AI에게 그들의 모국어로 레시피를 주어, 자신이 서빙해야 할 요리를 정확하게 요리하는 법을 가르치는 것과 같습니다.

요약

이 논문은 문법이 풍부하고 디지털 자원이 적은 언어의 경우, 더 크고 비싼 모델을 만드는 것이 최선이 아니라고 주장합니다. 대신, 가장 좋은 전략은 다음과 같은 작고 특화된 모델을 만드는 것입니다:

  1. 네이티브(Native): 해당 특정 언어로만 훈련됨.
  2. 스마트(Smart): 언어의 구조를 이해하는 토크나이저를 사용함.
  3. 접근 가능함(Accessible): 적절한 예산으로 누구나 훈련 가능함.

그들은 인도 언어를 위한 훌륭한 AI를 만드는 데 꼭 10억 달러의 예산이 필요한 것이 아니라, 올바른 도구와 언어의 구체적인 요구 사항에 대한 집중이 필요하다는 것을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →