← 최신 논문
💬 NLP

MARS: Enabling Autoregressive Models Multi-Token Generation

이 논문은 아키텍처 변경 없이 기존 지시 튜닝된 autoregressive 모델을 다중 토큰 생성이 가능하도록 미세 조정하는 경량화 방법인 MARS 를 제안하여, 정확도 저하 없이 처리량을 1.5~1.7 배 향상시키고 실시간 부하 조절이 가능한 효율적인 배포 솔루션을 제시합니다.

원저자: Ziqi Jin, Lei Wang, Ziwei Luo, Aixin Sun

게시일 2026-04-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ziqi Jin, Lei Wang, Ziwei Luo, Aixin Sun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🚀 MARS: AI 가 한 번에 여러 단어를 말하는 마법

안녕하세요! 오늘 소개해 드릴 논문은 인공지능 (AI) 이 글을 쓸 때, 한 번에 단 하나씩만 내뱉던 습관을 버리고, 한 번에 여러 단어를 동시에 뿜어낼 수 있게 해주는 획기적인 기술인 MARS에 대한 이야기입니다.

기존의 AI 는 글을 쓸 때 마치 한 글자씩 타자기 치듯 천천히 글을 썼습니다. "사과"를 쓸 때, "사"를 쓰고, "과"를 쓰고, "를"을 쓰는 식이죠. 하지만 "사과"라는 단어가 너무 뻔히 예상되는 상황에서도 AI 는 여전히 한 글자씩만 내뱉으며 시간을 낭비했습니다.

이제 MARS가 그 문제를 해결해 줍니다. 마치 마법처럼요!


🍕 1. 기존 방식 vs MARS: 피자를 어떻게 먹나요?

기존의 AI(autoregressive model) 는 피자를 한 조각씩만 뜯어 먹는 사람과 같습니다.

  • "피자 한 조각을 먹어봐"라고 하면, AI 는 한 조각을 먹고, 다시 "다음 조각을 먹어봐"라고 해야만 다음 조각을 먹습니다.
  • 비록 다음 조각이 뭘지 100% 확신하더라도, 한 번에 한 조각씩만 먹습니다. 이 과정은 계산 비용이 많이 들고 느립니다.

반면, MARS한 입에 여러 조각을 동시에 씹어 먹는 사람입니다.

  • "다음 피자가 뭐야?"라고 물으면, AI 는 "아, 이건 '치즈'고 그다음은 '토마토'고 그다음은 '바질'이겠구나!"라고 한 번에 세 단어를 동시에 예측해서 내뱉습니다.
  • 하지만 만약 다음 단어가 너무 어렵거나 헷갈린다면? MARS 는 다시 한 글자씩 천천히 씹는 방식으로 돌아갑니다.

🎓 2. 어떻게 가능한가요? (단순한 '재학습'의 마법)

다른 기술들은 AI 의 머리에 새로운 부속품을 달거나, 별도의 조력자를 고용해야 했습니다.

  • 기존 방식 1 (Speculative Decoding): AI 가 글을 쓰게 할 때, 옆에 **조력자 (Draft Model)**를 하나 더 둡니다. 조력자가 "다음 글자는 A 일 거야!"라고 추측하면, 메인 AI 가 "그래, 맞아!"라고 확인합니다. 하지만 조력자를 유지하려면 메모리도 두 배로 필요하고 관리가 복잡합니다.
  • 기존 방식 2 (Medusa 등): AI 의 머리에 **여러 개의 눈 (추가 헤드)**을 더 붙입니다. 하지만 이 경우 AI 의 크기가 커지고, 새로운 부속품을 훈련시켜야 합니다.

MARS 는 어떨까요?

  • 부속품 추가? NO.
  • 조력자 고용? NO.
  • 기존 AI 와 똑같은 모습? YES.

MARS 는 기존에 훈련된 AI 에 **약간의 새로운 훈련 (Fine-tuning)**만 시켜줍니다. 마치 유능한 요리사에게 "앞으로 요리를 할 때, 재료가 뻔한 건 한 번에 여러 개를 준비해봐"라고 가르치는 것과 같습니다. AI 의 본질은 그대로지만, 더 똑똑해지고 빨라진 상태가 됩니다.

🛡️ 3. 왜 기존 방식들은 실패했을까요? (MARS 의 핵심 비결)

과거에 비슷한 시도를 한 기술들은 AI 가 이해할 수 없는 방식으로 훈련시켰기 때문에, AI 가 멍청해지거나 논리력을 잃는 경우가 많았습니다.

MARS 는 AI 가 원래 가지고 있던 세 가지 본능을 해치지 않도록 아주 세심하게 설계했습니다.

  1. 방향성 유지: AI 는 항상 왼쪽에서 오른쪽으로 글을 씁니다. (뒤에서 앞으로 읽지 않음)
  2. 예측 방식 유지: "다음 단어가 뭐지?"라고 묻는 방식은 그대로 둡니다.
  3. 신뢰도 조절: AI 가 "다음 단어가 99% 확실해!"라고 생각하면 한 번에 여러 단어를 내뱉고, "음... 좀 헷갈리는데?"라고 생각하면 한 글자씩 다시 천천히 씹습니다.

이렇게 해서 MARS 는 논리력 (수학 문제 풀기 등) 을 잃지 않으면서 속도를 높일 수 있었습니다.

⚡ 4. 실제 효과: 속도와 품질의 완벽한 조화

  • 품질은 그대로: 한 번에 한 글자만 내뱉게 하더라도, 기존 AI 보다 더 똑똑해졌습니다. (수학 문제나 코딩 실력이 향상됨)
  • 속도는 1.5~1.7 배 빨라짐: AI 가 자신 있을 때는 한 번에 여러 단어를 내뱉으므로, 전체적인 응답 속도가 1.7 배까지 빨라집니다.
  • 실시간 조절: 서버가 바쁠 때는 "속도 우선! 조금 더 빨리 내놔!"라고 설정하면 AI 가 더 많은 단어를 한 번에 내뱉고, 중요한 질문이 오면 "정확도 우선! 천천히 꼼꼼하게 써줘"라고 설정하면 한 글자씩 꼼꼼하게 씁니다. 모델을 갈아타거나 재시작할 필요 없이 실시간으로 조절 가능합니다.

🎬 요약: MARS 는 어떤 존재일까요?

MARS 는 기존의 AI 를 해체하거나 개조하지 않고, 그 AI 가 가진 잠재력을 깨우는 훈련법입니다.

비유하자면:
기존 AI 는 한 걸음씩만 걷는 사람이었습니다.
MARS 는 그 사람에게 **"달릴 수 있는 능력"**을 가르쳐 준 것입니다.

  • 달릴 때 (자신 있을 때): 한 번에 여러 걸음을 내딛습니다.
  • 걷을 때 (어려울 때): 한 걸음씩 꼼꼼하게 걷습니다.
  • 그리고 달리기를 하더라도, 걷는 능력은 그대로 유지됩니다.

이 기술 덕분에 우리는 앞으로 더 빠르고, 더 똑똑하며, 더 유연한 AI를 만날 수 있게 되었습니다. 마치 AI 가 이제 마음대로 속도를 조절하며 글을 쓰는 마법사가 된 것과 같습니다! 🪄✨

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →