BabyLM Turns 4 and Goes Multilingual: Call for Papers for the 2026 BabyLM Workshop
2026 년 베이비엘엠 (BabyLM) 워크숍은 인지 모델링과 언어 모델 사전 훈련 간의 연구 연계를 촉진하기 위해 영문, 네덜란드어, 중국어 등 다국어 트랙을 포함한 제 4 회 챌린지를 개최하며, 효율적인 훈련, 소규모 데이터셋, 인지 모델링, 모델 평가 및 아키텍처 혁신 등 관련 주제에 대한 논문 투고를 환영합니다.
원저자:Leshem Choshen, Ryan Cotterell, Mustafa Omer Gul, Jaap Jumelet, Tal Linzen, Aaron Mueller, Suchir Salhan, Raj Sanjay Shah, Alex Warstadt, Ethan Gotlieb Wilcox
이 논문은 인공지능(AI) 연구자들이 모여 **"아기처럼 적은 양의 말만 듣고도 언어를 배울 수 있을까?"**라는 질문을 탐구하는 '베이비 LM' 워크숍과 대회에 대한 초대장입니다.
마치 아이가 부모님의 말을 듣고 자라듯, AI 모델도 엄청난 데이터가 아니라 유아기 수준의 작은 데이터로 언어를 배우는 실험을 하는 것이죠. 이번에는 4 번째 대회이자, 영어뿐만 아니라 여러 언어를 함께 배우는 새로운 도전이 시작됩니다.
🌟 핵심 내용: 이번 대회는 무엇이 다를까요?
1. 🗣️ "영어만 배우지 마세요!" (다국어 트랙 등장)
과거에는 AI 아기들이 오직 영어만 배웠다면, 이번에는 영어, 네덜란드어, 중국어를 섞어서 배우게 됩니다.
비유: 마치 다문화 가정의 아기가 엄마(영어), 아빠(네덜란드어), 할머니(중국어)의 말을 동시에 듣고 자라나는 상황입니다.
목표: 서로 다른 언어 구조 (문법, 글자 모양) 를 가진 언어들을 어떻게 하면 적은 데이터로 효율적으로 배울 수 있는지 연구합니다.
2. 📏 "엄청난 양이 아니라, '아기'가 먹을 만큼만!" (데이터 제한)
이 대회의 핵심 규칙은 **'데이터 양 제한'**입니다.
STRICT 트랙: 1 억 단어 이하 (약 100M 단어)
STRICT-SMALL 트랙: 1 천만 단어 이하 (약 10M 단어)
비유: 성인이 평생 읽는 책 100 권을 한 번에 읽게 하는 게 아니라, 유아용 그림책 10 권만 주고 그걸로 얼마나 잘 배우는지 보는 것입니다.
중요한 점: 데이터 양이 적을수록 AI 가 더 똑똑하게 (효율적으로) 학습하는 방법을 찾아야 합니다.
3. 🧩 "혼자 배우지 말고, 친구와 대화해요!" (상호작용 허용)
이전에는 AI 가 혼자 책을 읽는 방식이 주였는데, 이번에는 다른 AI(선생님) 와 대화하며 배우는 것이 허용됩니다.
비유: 아이가 혼자 책을 읽는 것도 좋지만, 부모님이 책을 읽어주거나 (Teacher Model), 아이가 말하면 부모님이 "아, 그렇지!"라고 반응해주는 (Feedback) 과정을 통해 배우는 것입니다.
규칙: 하지만 이 '선생님 AI'가 만들어낸 말도 모두 아기 AI 의 학습 데이터 (1 억 단어 한도) 에 포함됩니다. 즉, 선생님이 너무 많이 말해주면 아기 AI 가 배울 시간이 부족해지는 셈입니다.
4. 🚫 "나쁜 말은 금지!" (데이터 정화)
지난해 데이터에는 욕설이나 혐오 표현이 섞여 있어 문제가 있었습니다.
해결: 이번에는 유아용 교재처럼 깨끗하게 정제된 데이터를 제공합니다. 아이들이 배울 때는 나쁜 말은 들어가지 않도록 철저히 걸러낸 것입니다.
🏆 대회는 어떻게 진행되나요?
모델 훈련: 참가자들은 정해진 양의 데이터 (1 억 단어 이하) 로 AI 모델을 훈련시킵니다.
중간 점검: 학습이 끝난 결과뿐만 아니라, 학습 과정 중에도 중간중간 상태를 저장해서 제출해야 합니다.
이유: 아이가 처음 말을 할 때와 1 년 뒤, 2 년 뒤의 성장 과정을 모두 지켜보듯, AI 가 어떻게 배우는지 그 **성장 과정 (학습 궤적)**을 분석하기 위함입니다.
평가: 훈련된 모델이 영어, 네덜란드어, 중국어로 문장을 이해하고 생성하는 능력을 테스트합니다. (빈칸 채우기, 문법 검사 등)
💡 왜 이 연구가 중요할까요?
인간의 뇌를 이해하기 위해: 인간은 어릴 때 엄청난 데이터를 보지 않고도 언어를 배웁니다. AI 가 적은 데이터로 배우는 방법을 연구하면, 인간이 어떻게 언어를 배우는지에 대한 과학적 통찰을 얻을 수 있습니다.
환경과 비용 절감: 거대한 AI 를 훈련시키려면 엄청난 전기와 돈이 듭니다. 적은 데이터로 똑똑한 AI 를 만드는 기술은 에너지 효율적이고 누구나 접근 가능한 AI를 만드는 길입니다.
모든 언어를 위한 AI: 영어 중심의 AI 에서 벗어나, 한국어, 스페인어 등 다양한 언어를 가진 사람들도 혜택을 볼 수 있는 공정한 AI 를 만드는 첫걸음입니다.
📅 일정 요약 (2026 년)
2 월: 대회 시작 및 데이터 공개
5 월: 논문 제출 마감
10 월: 헝가리 부다페스트에서 열리는 EMNLP 컨퍼런스에서 워크숍 개최
한 줄 요약:
"이번 베이비 LM 대회는 작은 데이터로 여러 언어를 배우는 'AI 아기'를 키우는 실험으로, 인공지능이 인간처럼 효율적으로 배우고, 더 공정하고 다양한 세상을 만들 수 있는 길을 찾는 여정입니다."
BabyLM 2026 워크숍 및 챌린지: 다국어 확장 및 기술적 요약
1. 문제 정의 (Problem)
핵심 질문: 제한된 입력 데이터로부터 어떻게 계산 시스템이 언어를 학습할 수 있는가? (인지 과학적 관점: 아동의 언어 습득 vs. 컴퓨터 과학적 관점: 데이터 효율적인 머신러닝 시스템 구축)
기존 한계:
이전 BabyLM 챌린지 (1~3 회) 는 주로 영어 (English) 만을 대상으로 하여 언어적 다양성을 반영하지 못함.
대규모 언어 모델 (LLM) 의 발전으로 인해 계산 자원 (Compute) 과 데이터 양이 과도하게 증가하여, 소규모 데이터로 학습하는 효율성 연구가 뒷전으로 밀림.
기존 학습 데이터 (BabyLM 코퍼스) 에 독성 (Toxic) 및 혐오 발언 (Hate speech) 이 포함되어 있어, 다중 턴 대화나 상호작용 학습 시 지속 가능성에 문제 발생.
멀티모달 및 상호작용 트랙이 별도의 트랙으로 운영되었으나 참여가 부족하고 베이스라인 성능을 넘지 못함.
2. 방법론 및 규칙 (Methodology & Rules)
2026 년 챌린지는 다음과 같은 새로운 규칙과 트랙을 도입하여 문제를 해결하고자 합니다.
새로운 트랙 도입 (Multilingual Track):
목표: 영어, 네덜란드어, 중국어 (3 개 언어) 를 포함한 다국어 데이터로 모델을 학습시킴.
데이터:BABYBABELLM (Jumelet et al., 2025) 에서 파생된 인지적으로 타당한 (cognitively plausible) 학습 데이터 사용.
데이터 혼합 규칙: 참가자는 3 개 언어의 사용자 정의 혼합 데이터를 사용할 수 있으나, 총 토큰 수는 1 억 (100M) 단어를 초과할 수 없음.
Byte Premium 보정: 언어별 자형 (Orthography) 과 형태론적 구조의 차이를 보정하기 위해 Byte Premium (UTF-8 인코딩 크기 기반) 을 적용하여 단어 수를 조정함 (영어: 1.0, 네덜란드어: 1.0516, 중국어: 0.9894).
기존 트랙 유지 및 통합 (STRICT & STRICT-SMALL):
STRICT: 최대 1 억 (100M) 단어 학습.
STRICT-SMALL: 최대 1 천만 (10M) 단어 학습.
트랙 통합: 기존 MULTIMODAL 및 INTERACTION 트랙을 STRICT/STRICT-SMALL 트랙에 통합. 참가자는 이미지 - 텍스트 쌍 데이터나 외부 교사 모델 (Teacher Model) 의 피드백을 사용할 수 있으나, 이는 STRICT/STRICT-SMALL 의 데이터 제한 (100M/10M 단어) 을 준수해야 함.
외부 모델 사용: 학습 과정에서 외부 모델을 사용할 수 있으나 (예: 합성 데이터 생성, RL 을 위한 스칼라 보상 제공), 지식 증류 (Distillation) 는 금지됨 (토크나이저, 가중치, 출력 분포 노출 불가).
학습 제한 사항 (Training Constraints):
에포크 제한: 학습 데이터에 대한 최대 10 회 반복 노출 (10 epochs) 제한. 이는 아동의 학습 궤적과 유사성을 유지하고 계산 자원의 민주화를 위해 설정됨.
중간 체크포인트 제출: 학습 효율성과 동역학을 분석하기 위해 1M 단어, 10M 단어, 100M 단어 등 특정 구간별 모델 체크포인트를 HuggingFace 에 제출해야 함.
데이터 정제 (Detoxification):
기존 코퍼스의 독성 및 혐오 발언 문제를 해결하기 위해, Trhlik et al. (2026) 의 분석을 바탕으로 정제된 (Detoxified) 학습 데이터셋을 새로 배포함.
3. 주요 기여 (Key Contributions)
이 문서 (초청 논문) 는 다음과 같은 새로운 기여를 제시합니다:
다국어 BabyLM 의 시작: 영어 중심의 연구에서 벗어나, 네덜란드어 (영어와 유사) 와 중국어 (영어와 이질적) 를 포함한 다국어 언어 습득 연구의 기반을 마련함.
트랙 구조의 최적화: 참여도가 낮았던 멀티모달/상호작용 트랙을 주 트랙에 통합하여 경쟁 구조를 단순화하고, 상호작용 학습을 보다 유연하게 허용함.
윤리적 데이터 제공: 기존 데이터셋의 독성 문제를 해결한 정제된 데이터셋을 공개하여, 안전하고 지속 가능한 언어 모델 학습 환경을 조성함.
인지 과학과 AI 의 교량: 제한된 데이터 (1 억 단어 이하) 와 에포크 제한을 통해, 인간의 아동기 언어 습득 과정을 더 잘 모사하는 효율적인 모델 아키텍처와 학습 전략을 탐구하도록 유도함.
4. 결과 (Results)
참고: 이 문서는 2026 년 2 월에 발표된 초청 논문이므로, 챌린지 참가자들의 최종 모델 성능이나 실험 결과는 아직 존재하지 않습니다.
제공된 베이스라인:
STRICT/STRICT-SMALL 트랙: GPT-BERT (Charpentier and Samuel, 2024), SimPO 기반 선호도 최적화 모델, GPT-2 Small.
Multilingual 트랙: 위 베이스라인을 다국어 데이터에 맞게 단순 조정 (Naive adaptation) 한 모델이 베이스라인으로 제공될 예정.
평가 체계: 제로샷 (Zero-shot) 및 파인튜닝 (Fine-tuning) 기반의 기능적/형식적 언어 능력 평가가 수행될 예정이며, 제출 직전에 숨겨진 테스트 (Hidden tasks) 를 통해 일반화 능력을 검증함.
5. 의의 및 중요성 (Significance)
언어 다양성 확보: 소수 언어 및 저자원 언어 (Low-resource languages) 에 대한 연구 촉진을 통해, 언어 모델의 보편성과 포용성을 높이는 데 기여함.
효율성 연구의 부활: 막대한 컴퓨팅 자원에 의존하는 대형 모델 트렌드와 달리, 제한된 데이터와 계산 자원으로도 효과적인 학습이 가능한 '작은 언어 모델 (Small Language Models)'의 한계를 탐구함.
인지 과학적 통찰: 아동의 언어 습득 과정 (제한된 입력, 반복 노출의 부재, 상호작용) 을 시뮬레이션함으로써, 인간 학습 메커니즘에 대한 새로운 가설을 검증할 수 있는 실험적 환경을 제공함.
윤리적 AI: 학습 데이터의 독성 제거를 통해, 실제 적용 가능한 안전하고 건전한 언어 기술 개발의 토대를 마련함.
요약: 이 문서는 2026 년 BabyLM 챌린지가 다국어 (영어, 네덜란드어, 중국어) 로 확장되고, 데이터 정제가 이루어지며, 상호작용 학습이 주 트랙에 통합되는 등 새로운 패러다임을 제시함을 알리는 기술적 가이드라인입니다. 이는 제한된 자원 하에서 인간과 유사한 언어 습득을 달성하는 효율적인 AI 를 개발하려는 연구 커뮤니티의 방향성을 제시합니다.