← 최신 논문
💬 NLP

TFD: A Comprehensive Structured Tibetan Foundation Dataset for Low-Resource Language Processing and Large-Scale Modeling

본 논문은 티베트어 대규모 언어 모델 개발의 모든 단계를 포괄하는 최초의 종합적이고 구조화된 전문가 큐레이션 데이터셋인 TFD 를 소개하며, 이를 통해 기존 베이스라인을 이해, 안전성, 추론 및 생성 측면에서 크게 능가하는 Sun-Shine 계열 모델의 개발이 가능해졌습니다.

원저자: Cheng Huang, Fan Gao, Nyima Tashi, Yutong Liu, Yadi Liu, Wenbin Wei, Xiangxiang Wang, Yongbin Yu

게시일 2026-05-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Cheng Huang, Fan Gao, Nyima Tashi, Yutong Liu, Yadi Liu, Wenbin Wei, Xiangxiang Wang, Yongbin Yu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능 (AI) 의 세계를 거대한 도서관으로 상상해 보세요. 영어나 중국어와 같은 언어의 경우, 이 도서관은 책, 잡지, 손글씨 메모로 넘쳐납니다. AI 모델은 이러한 페이지 수백만 장을 읽어 말하고, 쓰고, 생각하는 법을 배웁니다.

하지만 티베트어의 경우, 이 도서관은 거의 비어 있었습니다. 연구자들이 최근 책장 채우기를 위해 일부 원본 책 (텍스트 데이터) 을 가져오기 시작했지만, 결정적으로 빠진 부분이 있었습니다: 완전한 교육 과정입니다.

스마트 AI 를 구축하는 것을 학생을 훈련시키는 것과 같다고 생각해 보세요. 단순히 백과사전 더미 (사전 학습) 를 건네주고 현실 세계에 준비되었다고 기대할 수는 없습니다. 그들은 또한 다음이 필요합니다:

  1. 사용 설명서 (특정 명령을 따르는 방법).
  2. 안전 훈련 (해로운 말을 피하는 방법).
  3. 윤리 수업 (두 가지 좋은 답변이 있을 때 '최고의' 답변을 선택하는 방법).
  4. 논리 퍼즐 (어려운 문제를 해결하기 위해 단계별로 생각하는 방법).

지금까지 티베트어 AI 에는 백과사전은 있었지만 나머지 교육 과정은 부족했습니다.

해결책: TFD(티베트어 기초 데이터셋)

이 논문의 저자들은 티베트어 AI 를 위한 완전하고 전문가가 설계한 "학교 키트"와 같은 TFD를 소개했습니다. 이는 처음부터 AI 를 훈련시키는 모든 단계를 포괄하는 최초의 자원입니다.

이 키트는 두 가지 주요 부분으로 구성됩니다:

1. TIBSTC: "교과서 및 워크북" 컬렉션
이는 고대 철학과 의학부터 일상 대화 및 법률에 이르기까지 모든 것을 다루는 **110 억 개 이상의 단어 (토큰)**로 구성된 거대한 도서관입니다. 하지만 이는 단순한 텍스트 더미가 아닙니다. 구체적인 "워크북"으로 조직되어 있습니다:

  • 지시 미세 조정 (Alpaca-Ti): "시를 쓰세요", "이 문장을 번역하세요"와 같이 교사가 구체적인 숙제를 주는 것과 같습니다.
  • 안전 정렬 (Safety-Prompts-Ti): "하지 말아야 할 것" 목록과 같아 AI 에게 어떤 주제가 위험하거나 모욕적인지, 그리고 어떻게 정중히 거절할지 가르칩니다.
  • 선호도 최적화 (CValues-Ti 및 hh-rlhf-Ti): "최고의 답변" 가이드와 같습니다. AI 가 두 가지 가능한 답변을 제시할 때, 이 데이터는 인간이 선호하는 답변 (예: 도움이 되고 해롭지 않은 답변) 이 무엇인지 가르칩니다.

2. TIBSTC-CoT: "논리 퍼즐" 책
이는 티베트어 "연쇄 사고 (Chain-of-Thought)" 데이터의 첫 번째 대규모 컬렉션입니다. 학생이 단순히 답을 쓰는 것이 아니라 사고 과정의 모든 단계를 적어내는 수학 문제를 상상해 보세요. 이 데이터셋은 AI 가 단순히 결과를 추측하는 것이 아니라 복잡한 문제를 단계별로 어떻게 사고하는지 티베트어 AI 에게 가르칩니다.

결과: "Sun-Shine" 패밀리

이 "학교 키트"가 작동함을 증명하기 위해 연구자들은 Sun-Shine이라는 새로운 AI 모델 패밀리를 구축했습니다.

  • Sun-Shine 1.0은 전체 키트로 훈련된 범용 모델입니다.
  • Sun-Shine 2.0은 논리 퍼즐에 집중적으로 훈련된 전문 "사고" 모델입니다.

큰 승리:
이 논문은 상대적으로 작은 모델 (80 억 파라미터 모델 등) 일지라도 이러한 모델들이 수백억 개의 파라미터를 가진 거대하고 비싼 AI 거인들보다 티베트어 작업에서 더 뛰어난 성과를 낼 수 있음을 보여줍니다.

왜 그럴까요? 왜냐하면 그들은 무작위 텍스트를 공급받은 것이 아니라 구조화된 교육을 받았기 때문입니다.

  • 그들은 언어를 더 잘 이해합니다.
  • 그들은 더 안전하며 모욕적인 말을 할 가능성이 적습니다.
  • 그들은 복잡한 추론 문제를 해결할 수 있습니다.
  • 그들은 다른 모델들보다 고전 티베트어(고대 텍스트) 를 훨씬 잘 처리하여 현대적이거나 로봇처럼 들리게 만드는 대신 문화의 전통적인 스타일을 보존합니다.

결론

이 논문은 티베트어와 같은 저자원 언어의 경우 크기가 모든 것이 아님을 주장합니다. 단순히 더 많은 데이터가 필요한 것이 아니라, 완전한 파이프라인으로 조직된 올바른 유형의 데이터가 필요합니다. 이 최초의 "풀스택" 데이터셋을 제공함으로써 저자들은 티베트어 화자에게 지성뿐만 아니라 문화적으로 존중받고 안전한 AI 를 구축하는 데 도움이 되기를 바랍니다.

그들은 이 "학교 키트"(데이터셋) 와 "졸업생"(모델) 을 공개하여 다른 사람들이 이 기초 위에 구축할 수 있도록 했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →