← 최신 논문
🤖 machine learning

Compositional Generalization in Autoregressive Models via Logit Composition

이 논문은 확산 방법에서 영감을 받아 autoregressive 모델을 위한 원칙적인 로그트 조합 전략을 제시하며, 이는 출력 부분 공간에 대한 투영 제어를 보장하고 인수화된 조건부 가정 하에서 길이 일반화를 유지합니다.

원저자: Aakash Kumar, Maria Sofia Bucarelli, Emanuele Natale

게시일 2026-05-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Aakash Kumar, Maria Sofia Bucarelli, Emanuele Natale

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

세 명의 매우 구체적인 셰프가 부엌에서 일한다고 상상해 보세요.

  • 베이스 셰프 (배경): 이 셰프는 레시피를 그대로 정확히 따르는 데 탁월합니다. 만약 간단한 샌드위치를 요청하면, 완벽한 간단한 샌드위치를 만듭니다. 그들은 아무것도 추가하지 않습니다.
  • 수학 셰프: 이 셰프는 레시피에 요구될 때만 치즈와 향신료를 추가하는 마법사입니다. 레시피에 "치즈를 추가하라"고 적혀 있으면, 완벽하게 수행합니다. 그렇지 않다면 샌드위치는 건드리지 않습니다.
  • 코드 셰프: 이 셰프는 레시피가 요청할 때만 상추와 토마토를 추가하는 전문가입니다.

문제점:
보통 치즈와 상추를 모두 넣은 샌드위치를 원한다면, 한 번에 모든 일을 할 줄 아는 거대한 셰프 한 명을 고용해야 합니다. 아니면 세 셰프의 앞치마 (가중치) 를 섞거나 교대로 일하게 하려 시도합니다. 하지만 종종 이는 혼란을 초래합니다. 수학 셰프가 치즈를 추가하려 할 때 코드 셰프가 상추를 추가하려 하거나, 샌드위치를 어떻게 마무리할지 논쟁을 벌여 먹지 못할 정도로 지저분한 음식 더미가 만들어질 수 있습니다.

이 논문의 해결책: "로그이트 조합 (Logit Composition)"
이 논문의 저자들은 이러한 셰프들을 결합하는 새로운 방식을 제안합니다. 앞치마를 섞거나 교대로 일하게 하는 대신, 세 셰프 모두 다음 재료를 제안할 때 동시에 외치되 특별한 규칙을 적용합니다.

  1. 규칙: 수학 셰프의 제안을 가져와 코드 셰프의 제안을 더한 후, 베이스 셰프의 제안을 빼는 것입니다.
  2. 마법: 베이스 셰프는 단순히 "간단한" 버전이므로, 그들의 목소리를 빼면 소음이 상쇄됩니다.
    • 레시피에 치즈가 필요할 때, 수학 셰프는 크게 외치고, 코드 셰프는 (치즈에 대해 알지 못하므로) 조용하며, 베이스 셰프는 중립적입니다. 수학적으로 계산되어 최종 결정이 "치즈 추가"가 됩니다.
    • 레시피에 상추가 필요할 때, 코드 셰프는 크게 외치고, 수학 셰프는 조용하며, 베이스 셰프는 중립적입니다. 최종 결정은 "상추 추가"가 됩니다.
    • 레시피에 특별한 것이 필요 없을 때, 모두 조용해지고 샌드위치는 간단하게 유지됩니다.

왜 이것이 작동하는지 (불연속 "Disjoint" 비밀)
이 논문은 이 방식이 셰프들이 불연속적인 (disjoint) 업무를 수행할 때만 완벽하게 작동한다고 주장합니다.

  • 수학 셰프는 "치즈 단계"만 건듭니다.
  • 코드 셰프는 "상추 단계"만 건듭니다.
  • 그들은 절대 동시에 상대방의 일을 시도하지 않습니다.

만약 수학 셰프가 코드 셰프가 상추를 추가하는 동안 치즈를 추가하려 한다면, 서로 충돌할 수 있습니다. 하지만 그들이 정확히 언제 행동해야 하는지 알고 있다면 (예: "나는 3 단계에서만 행동하고, 너는 5 단계에서만 행동해"), 싸움 없이 매끄럽게 협력할 수 있습니다. 논문은 이를 **"분해된 조건부 (Factorized Conditionals)"**라고 부릅니다.

"투사 (Projective)" 보장
이 논문은 셰프들이 자신의 특정 영역에 머무른다면, 최종 샌드위치 (출력) 는 두 가지 기술을 모두 완벽하게 아는 슈퍼 셰프를 고용했을 때 얻는 것과 정확히 같음을 증명합니다.

  • 샌드위치의 "치즈" 부분은 100% 수학 셰프에서 나옵니다.
  • "상추" 부분은 100% 코드 셰프에서 나옵니다.
  • "빵" 부분은 100% 베이스 셰프에서 나옵니다.

그들은 서로 간섭하지 않습니다. 이는 투사와 같습니다. 치즈 부분만 보면 수학 셰프가 만든 것과 정확히 같고, 상추를 보면 코드 셰프가 만든 것과 정확히 같습니다.

긴 레시피에도 작동할까요? (길이 일반화)
이 논문은 셰프들이 아직 본 적이 없는 매우 긴 레시피 (예: 100 페이지 요리책) 에 대해서도 이 방식이 작동하는지 확인했습니다. 그들은 셰프들이 자신의 특정 "영역" (예: "나는 10~20 단계를 처리한다") 을 알고 있고 레시피가 동일한 패턴을 따르는 한, 결합된 팀이 짧은 레시피만큼이나 긴 레시피도 잘 처리할 수 있음을 발견했습니다. 책이 두꺼워졌다고 해서 혼란을 겪지 않습니다.

실제 세계 테스트
저자들은 실제 AI 모델 (대규모 언어 모델) 로 이를 테스트했습니다.

  • 베이스 모델 (Gemma 2) 을 가져왔습니다.
  • 수학을 위해 파인튜닝된 버전을 가져왔습니다.
  • 코딩을 위해 파인튜닝된 버전을 가져왔습니다.
  • 그들의 "외침" 규칙을 사용하여 이를 결합했습니다.

결과:
새로운 결합된 모델은 코딩 전문가 단독보다 코딩 능력이 향상되었고, 수학 전문가의 기술 대부분을 유지했습니다. 코딩을 배웠다고 해서 수학 능력을 잃지 않았습니다. 팀 전체를 처음부터 다시 훈련시킬 필요 없이 "양쪽 세계의 장점을 모두 누리는" 상황이었습니다.

주의점
이 논문은 이 방식이 작업이 명확하게 분리되어 있을 때 가장 잘 작동한다고 인정합니다. 너무 많은 전문가를 결합하려 하면 (예: "시" 셰프와 "역사" 셰프를 섞는 경우), 팀이 언제 말을 멈춰야 할지 혼란을 겪어 말도 안 되는 소리를 할 수 있습니다. 하지만 명확하고 분리된 기술의 경우, 이 "로그이트 조합"은 모듈형 AI 시스템을 구축하는 강력하고 원칙적인 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →