← 최신 논문
🤖 machine learning

Supplement Generation Training for Enhancing Agentic Task Performance

이 논문은 대규모 모델의 재학습 비용과 비효율성을 해결하기 위해, 작은 모델이 생성한 보충 텍스트를 입력에 추가하여 기존 대형 모델의 에이전트 성능을 향상시키는 '보충 생성 학습 (SGT)' 전략을 제안합니다.

원저자: Young Min Cho, Daniele Bonadiman, Divya Bhargavi, Tamer Alkhouli, Salvatore Romeo, Dongwei Jiang, Khushbu Pahwa, Yubin Ge, Etsuko Ishii, Monica Sunkara, Yi Zhang

게시일 2026-04-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Young Min Cho, Daniele Bonadiman, Divya Bhargavi, Tamer Alkhouli, Salvatore Romeo, Dongwei Jiang, Khushbu Pahwa, Yubin Ge, Etsuko Ishii, Monica Sunkara, Yi Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎩 비유: 천재 CEO 와 똑똑한 비서

이 논문의 상황을 상상해 보세요.

  1. 천재 CEO (Actor Model, πA):

    • 이분은 세상에서 가장 똑똑한 사람입니다. 하지만 이미 정해진 역할을 하고 있고, 재교육을 시킬 수 없습니다 (모델의 가중치를 바꿀 수 없음). 또한, 이분을 고용하는 비용이 매우 비싸고, 새로운 업무를 배울 때마다 다시 훈련시키는 것은 불가능합니다.
    • 문제는 이 CEO 가 가끔은 "어떻게 시작해야 할지" 막히거나, "중요한 맥락을 놓치는" 경우가 있다는 점입니다.
  2. 똑똑한 비서 (Supplement Generator, πS):

    • 이분은 CEO 보다 훨씬 작고 가벼운 모델입니다. 훈련 비용도 저렴하고 빠르게 바꿀 수 있습니다.
    • 이 비서의 임무는 직접 문제를 해결하는 것이 아닙니다. 대신, CEO 가 문제를 풀기 전에 **"문제 해결을 돕는 메모 (보조 자료)"**를 작성하는 것입니다.

💡 이 논문이 제안하는 방법: '보조 자료 생성 훈련 (SGT)'

기존의 방법들은 CEO 가 할 수 있는 일을 늘리려고 노력하거나, CEO 에게 "이렇게 해봐"라는 지시문 (프롬프트) 만을 바꾸는 데 그쳤습니다. 하지만 이 논문은 **"비서가 CEO 가 문제를 풀기 직전에 필요한 '맞춤형 메모'를 만들어서 CEO 에게 건네주는 방식"**을 제안합니다.

1. 비서는 무엇을 쓸까요? (8 가지 보조 자료 유형)

비서는 상황에 따라 CEO 에게 다양한 메모를 작성합니다. 예를 들어:

  • 배경 지식: "이 문제는 이런 역사적 맥락이 있어요."
  • 실수 경고: "여기서 사람들이 자주 틀리는 실수가 있어요."
  • 단계별 생각: "먼저 A 를 하고, 그다음 B 를 생각해보세요."
  • 비교 예시: "올바른 답과 틀린 답을 비교해봤어요."

2. 비서는 어떻게 배울까요? (시행착오 학습)

비서는 처음엔 막연하게 메모를 씁니다. 하지만 CEO 가 그 메모를 보고 문제를 잘 풀면, 비서는 **"아, 이 방식이 좋구나!"**라고 배웁니다. CEO 가 실패하면 **"아, 이 메모는 도움이 안 됐구나"**라고 배웁니다.
이 과정을 반복하며 비서는 어떤 상황에서 어떤 메모를 써야 CEO 가 가장 잘 풀 수 있는지를 스스로 터득하게 됩니다.


🚀 이 방법이 왜 대단한가요?

  1. 비용 절감 (가장 큰 장점):

    • 거대한 CEO(수천억 개의 파라미터) 를 다시 훈련시키는 것은 상상할 수 없을 정도로 비싸고 느립니다.
    • 대신, 작은 비서(17 억 파라미터) 만 훈련시키면 되므로 비용과 시간이 획기적으로 줄어듭니다.
  2. 유연성:

    • 새로운 업무가 생기면 CEO 를 다시 교육할 필요 없이, 비서만 새로운 메모 작성법을 배우면 됩니다. CEO 는 그대로 두면서 성능만 끌어올릴 수 있습니다.
  3. 실제 효과:

    • 실험 결과, 이 방법을 쓰면 기존 방식보다 약 21% 더 높은 성능을 보였습니다. 특히 복잡한 논리 문제나 코드 작성 같은 작업에서 비서의 메모가 CEO 의 사고 과정을 명확하게 정리해 주어 큰 도움이 되었습니다.

📝 요약

이 논문은 **"거대한 AI 를 다시 가르치지 말고, 그 AI 가 문제를 풀기 직전에 필요한 '맞춤형 힌트'를 만들어주는 작은 AI(비서) 를 훈련시켜라"**라고 말합니다.

이 작은 비서 (보조 자료 생성기) 는 CEO(주요 모델) 가 가장 잘할 수 있도록 상황을 정리하고, 실수를 경고하며, 사고의 길을 안내합니다. 그 결과, 거창한 재교육 없이도 AI 의 성능을 획기적으로 높일 수 있는 지속 가능하고 효율적인 방법을 제시한 것입니다.

한 줄 요약:

"거인 (거대 AI) 을 다시 키우지 말고, 거인의 눈앞에 필요한 '요리 레시피 (보조 자료)'를 써주는 작은 요리사 (작은 AI) 를 훈련시켜 거인의 능력을 극대화하자!"

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →