BidirLM: From Text to Omnimodal Bidirectional Encoders by Adapting and Composing Causal LLMs
이 논문은 Gemma3 와 Qwen3 계열의 인과적 생성 언어 모델을 사전 마스킹 단계와 선형 가중치 병합 전략을 통해 적응시켜, BERT 스타일 아키텍처를 대체하고 텍스트·시각·오디오 등 다양한 도메인에서 우수한 성능을 보이는 양방향 인코더 'BidirLM'을 제안합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
BidirLM: "양방향 독서"를 배우는 AI 의 새로운 비법
이 논문은 인공지능 (AI) 이 글을 읽고 이해하는 방식을 혁신하는 새로운 방법, BidirLM을 소개합니다.
기존의 AI 는 주로 ** causal **(인과적) 방식으로 작동합니다. 마치 책을 한 장씩 오른쪽으로 넘기며 읽는 사람처럼, 앞의 글만 보고 뒤의 글은 아직 모르기 때문에 "다음에 어떤 단어가 올지"를 예측하는 데 특화되어 있습니다. 하지만 글을 완전히 이해하려면 (예: "이 문장의 주체가 누구일까?"를 파악하려면 앞뒤 문맥을 모두 봐야 하죠), **양방향 **(Bidirectional)으로 읽을 수 있어야 합니다.
이 연구는 이미 잘 훈련된 "앞으로만 읽는 AI"를, "앞뒤를 모두 보는 AI"로 바꾸는 완벽한 레시피를 공개했습니다.
1. 문제: 왜 기존 방식은 부족할까?
기존에 양방향 AI 를 만들려면 처음부터 다시 큰 비용을 들여 훈련해야 했습니다. 하지만 최근에는 "앞으로만 읽는 AI"를 조금만 수정해서 양방향으로 바꾸려는 시도가 있었습니다.
그런데 문제는 세 가지였습니다:
- 어떻게 가르쳐야 할지 합의가 안 됨: 어떤 학습 방법을 써야 좋은지 의견이 분분했습니다.
- **기억 상실 **(Catastrophic Forgetting) 새로운 것을 배우다가, 원래 알고 있던 지식을 다 까먹는 현상이 발생했습니다. (새로운 언어를 배우다가 모국어를 잊어버리는 것처럼요.)
- 특화된 능력과 연결 안 됨: "안전한 답변만 하는 AI", "음악을 이해하는 AI" 같은 특수한 AI 들과 연결하지 못해, 그들만의 훌륭한 능력을 활용하지 못했습니다.
2. 해결책: BidirLM 의 3 단계 비법
이 연구팀은 Gemma3와 Qwen3라는 두 가지 유명한 AI 모델을 실험하며 다음과 같은 3 단계 전략을 찾아냈습니다.
1 단계: "숨은 글자 찾기" 훈련 (마스크링)
가장 중요한 발견은, AI 를 양방향으로 바꾸기 전에 **"숨은 글자 찾기" **(Masked Next-Token Prediction) 훈련을 시켜야 한다는 것입니다.
- 비유: AI 에게 "사과를 먹었다"라는 문장에서 "먹었다"를 가리고, "사과를 [?]했다"라고 했을 때 빈칸을 채우게 하는 훈련입니다.
- 효과: 이 훈련을 통해 AI 는 앞뒤 문맥을 동시에 보며 문장을 이해하는 근육을 키우게 됩니다. 최근 많은 연구가 이 단계를 건너뛰었는데, 이 연구는 **"이 단계가 없으면 AI 가 제대로 이해하지 못한다"**고 증명했습니다.
2 단계: "기억 지키기" 전략 (머지 + 데이터 믹스)
새로운 것을 배우다 원래 지식을 잃는 것을 막기 위해 두 가지 방법을 섞었습니다.
- 가벼운 데이터 믹스: AI 에게 원래 훈련 데이터가 없어도, 다양한 주제 (수학, 코드, 여러 언어) 를 섞은 아주 적은 양의 데이터만 보여줘도 기억을 유지할 수 있습니다.
- **모델 머지 **(Weight Merging) 이는 마치 두 명의 전문가를 합치는 것과 같습니다.
- A: "양방향 읽기"를 잘하는 AI
- B: "원래 지식을 잘 기억하는" 원래 AI
- 이 두 AI 의 두뇌 (가중치) 를 50:50 으로 섞어주면, 새로운 능력을 얻으면서도 원래 지식을 잃지 않는 완벽한 AI 가 됩니다.
3 단계: "특수 능력 합체" (오mnimodal)
가장 멋진 부분은, 이 양방향 AI 에 다른 특수 AI 들을 붙여 만능 AI를 만든다는 점입니다.
- 안전 전문가 AI와 합치면 -> 유해한 내용을 걸러내는 능력이 생깁니다.
- 이미지 이해 AI와 합치면 -> 그림을 보고 설명할 수 있습니다.
- 음성 인식 AI와 합치면 -> 목소리를 듣고 내용을 파악합니다.
- 비유: 마치 레고 블록처럼, 이미 만들어진 특수 기능 블록들을 양방향 AI 라는 기본 몸체에 끼워 넣으면, 별도의 복잡한 훈련 없이도 모든 기능을 갖춘 슈퍼 AI가 탄생합니다.
3. 결과: 무엇이 달라졌나요?
이 방법으로 만든 BidirLM은 다음과 같은 성과를 냈습니다:
- 텍스트, 이미지, 소리를 모두 이해하는 만능 AI를 만들었습니다.
- 기존에 공개된 다른 오픈소스 모델들보다 성능이 훨씬 뛰어납니다.
- 특히, **25 억 **(2.5B)이라는 상대적으로 작은 크기임에도 불구하고, 훨씬 큰 모델들보다 더 좋은 성능을 보여줍니다. (효율성 극대화!)
4. 요약: 한 문장으로 정리하면?
"이미 잘 훈련된 AI 에게 '앞뒤를 동시에 보는 훈련'을 시키고, 기억을 잃지 않도록 '기존 AI 와 두뇌를 섞으며', 특수 기능 AI 들을 '레고처럼 붙여' 만능 AI 를 저렴하고 빠르게 만드는 새로운 방법론을 제시했다."
이 연구는 AI 개발자들에게 "처음부터 다시 만들지 말고, 기존 자원을 잘 조합하고 훈련 방식을 조금만 고치면 훨씬 더 강력한 AI 를 만들 수 있다"는 희망을 주는 오픈소스 레시피입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.