← 최신 논문
💻 computer science

Swa-bhasha Resource Hub: Romanized Sinhala to Sinhala Transliteration Systems and Data Resources

본 논문은 2020 년부터 2025 년까지 개발된 로마자 스리랑카어에서 스리랑카어 전사를 위한 포괄적인 데이터 및 알고리즘 컬렉션을 제공하는 공개 플랫폼인 스와바샤 리소스 허브를 소개하고, 스리랑카어 자연어 처리를 발전시키기 위해 기존 도구들의 비교 분석을 제시한다.

원저자: Deshan Sumanathilaka, Sameera Perera, Sachithya Dharmasiri, Maneesha Athukorala, Anuja Dilrukshi Herath, Rukshan Dias, Pasindu Gamage, Ruvan Weerasinghe, Y. H. P. P. Priyadarshana

게시일 2026-04-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Deshan Sumanathilaka, Sameera Perera, Sachithya Dharmasiri, Maneesha Athukorala, Anuja Dilrukshi Herath, Rukshan Dias, Pasindu Gamage, Ruvan Weerasinghe, Y. H. P. P. Priyadarshana

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

싱할라어를 아름답고 정교한 정원으로 상상해 보세요. 스리랑카 사람들은 수십 년 동안 이 정원에 들어가기 위해 다른 열쇠, 즉 영어 키보드를 사용해 왔습니다. 싱할라 키보드가 손에 readily 없었기 때문에, 그들은 영어 알파벳으로 싱할라 발음을 타이핑하기 시작했습니다. 이를 '싱글리시'(로마자 표기된 싱할라어) 라고 불렀습니다.

싱글리시를 비밀 코드오타의 방언으로 생각하세요. 빠르고 편리하지만, 다소 지저분합니다. 'Adaraya'로 입력된 한 단어가 문맥에 따라 '사랑' 또는 '구호'를 의미할 수 있습니다. 마치 'bat'을 입력했을 때 그것이 동물, 스포츠 용기, 아니면 동사를 의미하는지 컴퓨터가 문장 전체를 읽지 않고는 어떤 의미인지 알 수 없는 것과 같습니다.

이 논문은 수년 동안 컴퓨터가 이 지저분한 코드를 이해하고 다시 올바른 아름다운 싱할라어로 변환할 수 있도록 다리를 건설한 연구팀 (Swa-bhasha 팀) 의 보고서이자 도구상자입니다.

다음은 그들이 구축한 것을 간단히 설명한 것입니다:

1. 문제: "번역 중 분실" 게임

팀원들은 컴퓨터가 영어를 프랑스어로 번역하는 데는 뛰어나지만, '싱글리시'를 싱할라어로 번역하는 데는 어려움을 겪는다는 점을 발견했습니다.

  • 지저분함: 사람들은 다르게 입력합니다. 어떤 이들은 모음을 생략하고 ('kalana' 대신 'klna'로 작성), 어떤 이들은 영어 철자 규칙을 사용하며, 어떤 이들은 같은 문장 안에 영어와 싱할라어를 섞어 씁니다.
  • 모호함: 가장 큰 골치 아픈 점은 하나의 입력된 단어가 여러 가지 의미를 가질 수 있다는 것입니다. 컴퓨터는 어떤 의미가 이야기에 적합한지 파악하기 위해 탐정이 되어야 합니다.

2. 도구상자: 그들이 어떻게 해결했는지

팀은 단순히 하나의 도구만 만든 것이 아니라, 세대가 거듭될수록 더 똑똑해지는 다양한 기계들이 있는 전체 작업장을 구축했습니다.

  • 규칙서 로봇 (Swa Bhasha 1.0):

    • 작동 원리: 엄격한 지침서를 따르는 로봇을 상상해 보세요. 만약 'k'를 보면, 다음에 모음이 필요하다는 것을 압니다. 이는 사전에서 가장 가까운 일치 항목을 찾기 위해 '퍼지'(spell-checker 가 추측하는 것과 같은) 검색을 사용합니다.
    • 결과: 나쁘지 않았지만, 사람들이 규칙을 어길 때 (예: 모음 생략) 어려움을 겪었습니다.
  • 하이브리드 탐정 (Swa Bhasha 2.0 및 N-gram 모델):

    • 작동 원리: 규칙서 로봇을 '통계적 탐정'과 결합했습니다. 이 탐정은 수백만 개의 문장을 분석하여 패턴을 학습했습니다. 이는 스마트폰의 자동 완성 기능과 유사하지만 싱할라어용인 'Trie'(지능형 트리 구조) 를 사용하여 단어를 제안했습니다.
    • 결과: 올바른 단어를 추측하는 능력이 훨씬 향상되었지만, 매우 까다로운 문장에서는 여전히 혼란을 겪었습니다.
  • 슈퍼 리더 (BERT 및 Transformers):

    • 작동 원리: 이는 팀의 '슈퍼 리더'입니다. 개별 단어만 보는 것이 아니라, 인간처럼 문맥을 이해하며 문장 전체를 한 번에 읽습니다. 그들은 싱할라어 텍스트 전체를 읽은 뇌와 같은 강력한 AI 모델인 BERT 를 사용했습니다.
    • 기법: AI 가 혼란스러운 단어를 보았을 때, 그 위에 '마스크'를 씌우고 "이 단어 앞뒤의 단어들을 바탕으로, 여기에 가장 잘 맞는 단어는 무엇인가?"라고 물었습니다.
    • 결과: 이것이 우승자였습니다. 이전 어떤 방법보다 모호성 문제를 더 잘 해결하여 테스트에서 거의 완벽한 정확도를 달성했습니다.
  • 코드 혼합 전문가:

    • 작동 원리: 사람들은 종종 한 문장 안에 영어와 싱할라어를 섞어 씁니다 (예: "I went to the kade [shop]"). 팀은 혼란 없이 혼합을 처리하는 두 언어를 유창하게 구사하는 통역사처럼 작동하는 특수 모델을 구축했습니다.

3. 도서관: 그들이 수집한 데이터

아이에게 책을 없이 읽는 법을 가르칠 수 없듯이, AI 에게 데이터 없이 가르칠 수 없습니다. 팀은 싱글리시를 위한 좋은 '교과서'가 없다는 것을 깨닫고 직접 작성했습니다.

  • 'Swa-Bhasha' 도서관: 그들은 실제 생활 (유튜브 댓글 및 소셜 미디어 등) 에서 700 만 개 이상의 단어와 수천 개의 문장을 수집했습니다. 이는 컴퓨터가 실제 사람들이 어떻게 입력하는지 배우도록 스리랑카 사람들이 쓴 모든 지저분한 메모를 모으는 것과 같습니다.
  • '모호성' 테스트: 그들은 한 단어가 두 가지 의미를 갖는 특별한 퀴즈를 만들었습니다. 그리고 AI 가 이야기에 기반하여 올바른 의미를 선택할 수 있는지 테스트했습니다.
  • '코드 혼합' 컬렉션: 그들은 연구원들이 이전에 무시했던 매우 흔한 습관인 영어와 싱할라어를 섞어 쓰는 사람들의 예시를 수집했습니다.

4. 결과: 누가 경주에서 이겼는가?

팀은 그들의 도구를 구글의 도구나 이전의 규칙 기반 시스템과 같은 다른 방법들과 비교하여 테스트했습니다.

  • 구식 방법: 이전의 규칙 기반 시스템은 융통성 없는 교사처럼 행동했습니다. 학생들이 규칙을 어길 때 실패했습니다.
  • 신식 방법: 새로운 '슈퍼 리더'(BERT 기반) 모델은 현명한 멘토와 같았습니다. 그들은 문맥을 이해하고 거의 매번 올바른 답을 얻었습니다.
  • 점수: 테스트에서 그들의 최상위 모델은 91% (BLEU 점수) 의 점수를 받았으며 매우 적은 실수를 범한 반면, 이전 모델들은 훨씬 더 많은 오류를 범했습니다.

5. 다음 단계는 무엇인가?

팀은 현재 예측 텍스트 기능을 개발 중입니다. 단순히 입력한 내용을 번역하는 것이 아니라, 지저분하고 개인적인 스타일로 입력하더라도 다음에 무엇을 입력할지 추측하는 키보드를 상상해 보세요. 그들은 메타러닝 (Meta-Learning) 이라는 특수 학습 기법을 사용하여 키보드가 서버에 사용자의 개인 데이터를 저장할 필요 없이 사용자의 특정 입력 습관을 빠르게 학습할 수 있도록 하고 있습니다.

요약

Swa-bhasha 팀은 스리랑카 사람들이 영어 키보드로 입력하는 지저분하고 비공식적인 방식과 공식적이고 아름다운 싱할라어 문자 사이의 다리를 구축했습니다. 그들은 간단한 규칙서에서 시작하여 통계적 탐정으로 이동했고, 결국 문맥을 이해하는 '슈퍼 리더' AI 를 구축했습니다. 또한 이러한 AI 를 가르치는 데 필요한 방대한 데이터 도서관도 구축했습니다. 그들의 작업은 적절한 도구를 사용하면, 사람들이 서둘러 입력하더라도 싱할라어와 같은 저자원 언어조차도 컴퓨터가 완벽하게 이해할 수 있음을 증명합니다.

중요 참고사항: 이 논문은 텍스트 번역 기술과 이를 훈련하는 데 사용된 데이터에 엄격히 초점을 맞추고 있습니다. 의료 응용, 임상적 용도, 또는 그들이 출시한 연구 도구와 오픈 소스 코드를 넘어선 구체적인 미래 제품에 대한 주장은 포함하지 않습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →