← 최신 논문
💬 NLP

Leviathan: Decoupling Input and Output Representations in Language Models

이 논문은 표준 결속 임베딩 행렬을 학습된 임베딩 벡터화 (LEV) 로 대체하여 입력 및 출력 표현을 분리하는 Leviathan 이라는 트랜스포머 아키텍처를 소개하며, 이는 최소한의 파라미터 오버헤드로 언어 모델링 성능과 하류 벤치마크에서 상당한 개선을 달성합니다.

원저자: Reza T. Batley, Sourav Saha

게시일 2026-05-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Reza T. Batley, Sourav Saha

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"리바이어던" 논문에 대한 설명을 일상적인 언어와 창의적인 비유로 번역한 것입니다.

문제: "일률적" 사전

로봇에게 말하기를 가르친다고 상상해 보세요. 이를 위해 로봇은 두 가지 매우 다른 역할을 수행하는 사전이 필요합니다:

  1. 읽기: 단어의 의미를 이해하기 위해 단어를 찾아봅니다 (입력).
  2. 쓰기: 다음에 무엇이 올지 예측하기 위해 단어를 찾아봅니다 (출력).

대부분의 현대 AI 모델에서 로봇은 두 가지 역할 모두를 위해 단일 거대한 물리적 사전을 사용합니다. 이를 "가중치 공유 (weight tying)"라고 합니다. 이 논문은 이것이 정밀한 외과 의사의 메스와 중장비용 해머를 동시에 수행하도록 스위스 아미 나이프를 강요하는 것과 같다고 주장합니다. 두 가지 모두 시도하지만, 요구 사항이 다르기 때문에 어느 것에도 뛰어나지 못합니다.

  • 읽기는 매끄러움이 필요합니다: "고양이"와 "고양이 새끼"처럼 의미가 비슷한 단어들은 로봇의 마음속에서 서로 가까이 있어야 합니다.
  • 쓰기는 날카로움이 필요합니다: 로봇은 사전의 모든 단어를, 심지어 이상한 단어까지 명확하게 구분해야 합니다.

한 가지 도구를 두 가지 역할 모두에 강요하면 로봇은 타협을 강요받습니다. 결과적으로 두 가지 모두에서 "그럭저럭"은 하지만 어느 것에도 "뛰어난" 실력을 갖추지 못하게 됩니다.

실패한 해결책: 사전 두 개 사기

분명한 해결책은 다음과 같아 보입니다: "로봇에게 읽기용과 쓰기용 두 개의 별도의 사전만 주어라."
연구자들은 이를 시도했습니다. 그들은 로봇에게 읽기용의 거대하고 완전히 별도의 사전을 제공했습니다. 하지만 작동하지 않았습니다. 로봇은 혼란을 겪었고, 학습 속도가 느려졌으며, 오히려 단일 사전 버전보다 더 나쁜 성능을 보였습니다. 이는 50% 더 많은 메모리 (매개변수) 를 가지고 있었음에도 불구하고, 학생에게 교과서 두 권은 주되 학습 가이드는 주지 않은 것과 같았습니다. 추가 정보는 단순히 노이즈가 되었습니다.

해결책: 리바이어던 ("스마트 생성기")

이 논문은 로봇의 뇌를 구축하는 새로운 방법인 리바이어던을 소개합니다. 읽기용 거대한 물리적 사전 대신, 리바이어던은 스마트하고 소형화된 생성기를 사용합니다.

비유: 레시피 책 vs 식료품점

  • 옛 방식 (결합 임베딩): 모든 단일 항목 (모든 단어) 이 고유한 선반을 가진 거대한 식료품점을 상상해 보세요. "사과"를 원하면 A 선반으로 가고, "살구"를 원하면 B 선반으로 갑니다. "두리안"과 같은 희귀 과일을 원하면 그 고유하고 작은 선반을 찾아야 합니다. 가게가 거대하다면 그 희귀 선반을 찾는 것은 어렵고, 로봇은 종종 그 위치를 잊어버립니다.
  • 리바이어던 방식 (LEV): 모든 단일 단어에 대한 선반 대신, 리바이어던은 레시피 책을 가지고 있습니다.
    • "사과"를 만들기 위해 로봇은 선반을 찾아보지 않습니다. 대신 레시피를 따릅니다: 과일 1 부분, 빨간색 2 부분을 넣고, 달콤함과 섞으세요.
    • "두리안"(희귀 단어) 을 만들기 위해 비슷한 레시피를 따릅니다: 과일 1 부분, 가시 2 부분을 넣고, 강한 냄새와 섞으세요.

로봇이 선반 대신 **레시피 (수학적 함수)**를 사용하기 때문에, "사과"나 "두리안"을 즉석에서 완벽하게 만들어낼 수 있습니다.

  • 마법: 로봇이 "사과"의 맛을 배우면, 레시피가 재료를 공유하기 때문에 자동으로 "배"를 이해하는 능력도 향상됩니다. 이를 **매끄러움 (smoothness)**이라고 합니다.
  • 효율성: 레시피 책은 거대한 식료품점에 비해 매우 작습니다. 이는 로봇이 추가 메모리 없이도 거대하고 별도의 "쓰기 사전"(출력 헤드) 을 유지할 수 있음을 의미합니다. 즉, 작고 지능적인 읽기 시스템과 거대하고 강력한 쓰기 시스템이라는 두 가지 장점을 모두 얻게 됩니다.

실험에서 무슨 일이 있었나요?

연구자들은 이 새로운 "리바이어던" 로봇을 세 가지 다른 크기 (소형, 중형, 대형) 에서 기존의 "단일 사전" 로봇과 비교하여 테스트했습니다.

  1. 더 빠르게 학습했습니다: 리바이어던 로봇은 기존 로봇보다 2.1 배 적은 학습 단어로 동일한 수준의 기술을 달성했습니다.
  2. 더 똑똑해졌습니다: 가장 큰 크기에서 리바이어던 로봇은 다음 단어를 예측하는 능력 (퍼플렉시티라는 지표) 에서 9% 더 뛰어났습니다.
  3. "희귀 단어" 초능력: 가장 큰 놀라움은 개선이 발생한 이었습니다.
    • "the"나 "and"와 같은 일반적인 단어의 경우 두 로봇 모두 비슷했습니다.
    • 희귀 단어(백만 번 중 한 번만 보는 단어)의 경우, 리바이어던 로봇은 81% 더 뛰어났습니다.
    • 왜? 기존 시스템에서는 단어가 희귀하면 로봇이 그 "선반 위치"를 배울 기회가 거의 없어 잊어버립니다. 반면 리바이어던에서는 단어가 공유된 부분으로 구성된 레시피이기 때문에, 로봇이 단어를 한 번만 보더라도 여전히 그것을 알아낼 수 있습니다.

결론

이 논문은 AI 의 "읽기"와 "쓰기" 부분을 연결하는 방식이 중요하다는 것을 증명합니다. 단순히 문제에 더 많은 메모리를 투입할 필요는 없습니다. 대신, 거대한 조회 테이블에서 소형화된 매끄러운 레시피 생성기로 전환함으로써, 거의 동일한 양의 컴퓨팅 파워를 사용하면서도 AI 모델을 더 똑똑하고 빠르게 만들며, 희귀하고 어려운 단어를 이해하는 능력을 크게 향상시킬 수 있습니다.

요약하자면: 리바이어던은 AI 가 거대한 전화번호부를 암기하도록 하는 것을 멈추게 하고, 단어가 어떻게 구성되는지 그 문법을 배우도록 하여, 훨씬 더 효율적이고 유능한 학습자가 되도록 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →