← 최신 논문
💬 NLP

DIETA: A Decoder-only transformer-based model for Italian-English machine TrAnslation

이 논문은 엄선된 2억 7백만 문장의 이탈리아어-영어 코퍼스와 역번역 데이터를 통해 학습된 0.5-빌리언 파라미터 디코더 전용 트랜스포머 모델인 DIETA를 소개하며, 이 모델은 벤치마크에서 경쟁력 있는 성능을 달성함과 동시에 학습 스크립트, 모델, 데이터 및 새로운 평가 세트의 공개를 동반한다.

원저자: Pranav Kasela, Marco Braga, Alessandro Ghiotto, Andrea Pilzer, Marco Viviani, Alessandro Raganato

게시일 2026-01-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Pranav Kasela, Marco Braga, Alessandro Ghiotto, Andrea Pilzer, Marco Viviani, Alessandro Raganato

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 이탈리아어와 영어 딱 두 가지 언어만 말하는 번역기를 만들고 싶다고 상상해 보세요. 대부분의 거대 IT 기업들은 한 번에 100개의 언어를 말하려고 노력하는 "범용 번역기"를 만듭니다. 이것들은 세상의 모든 사전을 담고 있는 거대하고 무거운 배낭과 같습니다. 강력하긴 하지만, 너무 거대하고 운영 비용이 많이 들며, 너무 많은 것을 기억하려다 보니 때때로 혼란을 겪기도 합니다.

이 논문의 저자들은 이와는 다른 것을 만들기로 했습니다. 바로 DIETA라고 불리는 특화된 경량 번역기입니다.

다음은 이들이 어떻게 이를 구축했는지에 대한 이야기를 쉬운 비유를 들어 설명한 것입니다.

1. 목표: 마라톤 선수가 아닌 전문 단거리 선수

모든 거리의 마라톤을 뛰려는 마라톤 선수처럼 모든 언어를 말하도록 거대 모델을 훈련시키는 대신, 팀은 단 0.5-빌리언 파라미터(0.5-billion-parameter) 규모의 작은 모델이 오직 이탈리아어와 영어에서 최고가 되도록 훈련시켰습니다.

  • 비유: DIETA를 단거리 스프린터라고 생각하세요. 이 모델은 100개의 언어를 짊어질 필요가 없습니다. 그저 이탈리아어-영어 트랙을 믿을 수 없이 빠르고 정확하게 달리기만 하면 됩니다.

2. 학습 데이터: "체육관"

무엇인가를 잘하기 위해서는 연습이 필요합니다. 팀은 단순히 몇 권의 교과서를 사용한 것이 아니라, 7억 6,800만 개의 연습 문장으로 구성된 거대한 체육관을 구축했습니다.

  • 실제 자료: 이들은 의회 기록, 법률 문서, 뉴스, 영화(자막), 도서 등에서 약 2억 700만 개의 실제 문장 쌍을 수집했습니다.
  • "유령" 연습 (역번역): 더 많은 연습이 필요했기에, 이들은 "역번역(back-translation)"이라는 영리한 기술을 사용했습니다. 예를 들어, 이탈리아어 뉴스 기사를 컴퓨터로 영어로 번역한 다음, 그 영어를 다시 이탈리아어로 번역하게 하는 방식입니다. 이를 통해 새로운 "합성(synthetic)" 연습 쌍을 만들어냅니다. 이들은 이 과정을 수백만 번 반복하여 3억 5,200만 개의 추가 문장으로 이루어진 거대한 라이브러리를 구축했습니다.
  • 결과: 모델은 실제 인간의 글과 이 거대한 양의 컴퓨터 생성 연습 데이터를 혼합하여 연습했습니다.

려 3. 새로운 테스트: "최신 뉴스" 시험

보통 번역 모델은 오래되고 정적인 데이터로 테스트됩니다. 저자들은 이것이 모델이 오늘의 뉴스를 처리할 수 있는지 알려주지 못한다는 점을 깨달았습니다.

  • 혁신: 이들은 2025년 기사를 기반으로 한 WikiNews-25라는 새로운 테스트 세트를 만들었습니다.
  • 함정: 이들은 아무 문장이나 사용하지 않았습니다. 구글이 만든 번역본을 가져와서 틀린 부분을 찾아낸 뒤, 사람이 직접 수정하게 했습니다. 이를 통해 모델이 현재의 실제 뉴스 상황을 얼마나 잘 처리하는지 테스트하기 위해 설계된 "골드 스탠다드(gold standard)" 시험지를 만들었습니다.

4. 결과: 체급을 뛰어넘는 활약

그들은 DIETA를 아주 작은 모델부터 9-빌리언 파라미터(9-billion parameters) 규모의 거대 모델(앞서 언급한 무거운 배낭 같은 모델들)에 이르기까지 32개의 다른 번역기와 경쟁시켰습니다.

  • 성능: DIETA는 매우 작음에도 불구하고(단 0.5 빌리언 파라미터), 일관되게 두 번째 그룹(상위 2분위) 내에 안착했습니다.
  • 비교: DIETA는 3 빌리언 파라미터보다 작은 거의 모든 모델을 이겼습니다. 실제로 다섯 가지 서로 다른 테스트 중 네 가지에서 다른 거의 모든 소형 모델보다 뛰어난 성능을 보였습니다.
  • 트레이드오프(절충): 거대 모델(이른바 "슈퍼 운동선수")만큼 완벽하지는 않았지만, 놀라울 정도로 근접했습니다. 거대 모델들이 여전히 우위를 점한 주요 분야는 "참조 없는(reference-free)" 점수 산정(정답지 없이 품질을 추측하는 것)이었지만, 그 외의 모든 부분에서 DIETA는 충분히 제 몫을 해냈습니다.

5. 이것이 중요한 이유

이 논문은 훌륭한 번역 결과를 얻기 위해 항상 거대하고 비싼 슈퍼컴퓨터가 필요한 것은 아니라고 주장합니다.

  • 핵럼 요점: 학습 데이터를 특정 두 언어에 집중시키고 스마트한 합성 연습 데이터를 많이 사용한다면, 훨씬 더 크고 무거운 모델이 수행할 수 있는 일을 작고 가벼운 모델도 해낼 수 있습니다.
  • 접근성: DIETA는 매우 작기 때문에, 거대 모델들이 대규모 데이터 센터를 필요로 하는 것과 달리, 고사양 게이밍 PC와 같은 일반 소비자용 그래픽 카드 한 장에서도 실행할 수 있습니다.

요약

저자들은 이탈리아어와 영어에 특화된 작은 번역기인 DIETA를 만들었습니다. 이들은 실제 문서와 컴퓨터가 생성한 연습 문장을 혼합하여 모델을 훈련시켰습니다. 결과는 어떠했을까요? 거대 모델만큼이나 잘 수행하는 작은 모델이 탄생했으며, 이는 특화된 훈련과 스마트한 데이터가 **단순한 규모(size)**를 이길 수 있음을 증명했습니다.

그들은 다른 사람들이 이를 통해 배우고 더 나은 도구를 만들 수 있도록 모델, 학습 데이터, 그리고 새로운 테스트 세트를 모두 공개했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →