← 최신 논문
🤖 AI

From Monolithic to Modular: Segment-level Automatic Prompt Optimization

이 논문은 프롬프트를 특정 약점을 겨냥한 별개의 구성 요소로 분해하여 다양한 벤치마크에서 기존의 단일 구조적 접근 방식보다 뛰어난 성능을 보이는 세그먼트 수준의 자동 프롬프트 최적화 방법인 SAPO를 소개한다.

원저자: Nikita Kulin, Viktor Zhuravlev, Artur Khairullin, Sergey Muravyov, Ilya Makarov, Daniil Sukhorukov, Ekaterina Averkova

게시일 2026-08-13
📖 5 분 읽기🧠 심층 분석

원저자: Nikita Kulin, Viktor Zhuravlev, Artur Khairullin, Sergey Muravyov, Ilya Makarov, Daniil Sukhorukov, Ekaterina Averkova

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 슈퍼 인텔리전트 로봇에게 이야기를 쓰거나, 수학 문제를 풀거나, 뉴스 기사를 요약하는 법을 가르치려 한다고 상상해 보세요. 당신은 이 로봇에게 일련의 지침을 제공함으로써 이를 수행하게 하는데, 과학자들은 이를 "프롬프트(prompt)"라고 부릅니다. 프롬프트를 레시피라고 생각하면 쉽습니다. 만약 지침이 모호하거나 엉망이라면, 로봇은 초콜릿 케이크 대신 비누 맛이 나는 케이크를 구울 수도 있습니다. 오랫동안 연구자들은 로봇이 실수를 할 때마다 레시피 전체를 처음부터 다시 쓰는 방식으로 이 문제를 해결하려 노력했습니다. 이는 마치 프로스팅이 약간 잘못되었다는 이유로 케이크 전체를 버리고, 다음번에는 완벽한 결과가 나오기를 바라며 다시 만드는 것과 같았습니다. "모놀리식(monolithic)" 최적화라고 알려진 이 방식은 특정 작업의 한 부분에서는 잘 작동할 수 있었지만, 의도치 않게 다른 부분을 망가뜨려 로봇을 혼란스럽게 만들고 결과를 일관되지 않게 만드는 경우가 많았습니다.

이제 여러분이 읽게 될 논문은 SAPO(Segment-level Automatic Prompt Optimization, 세그먼트 단위 자동 프롬프트 최적화)라는 새로운 접근 방식으로 이 문제를 다룹니다. SAPO는 전체 레시피를 통째로 버리는 대신, 숙련된 셰프처럼 케이크를 주의 깊게 맛보고 정확히 어떤 재료가 잘못되었는지(예를 들어 소금이 너무 많거나 설탕이 부족한지)를 찾아낸 뒤, 완벽한 부분은 그대로 두고 문제가 된 부분만 수정합니다. 저자들은 독해 질문 답변부터 복잡한 수학 문제 풀이까지 다섯 가지 유형의 작업에 이 방법을 테스트했으며, 두 가지 서로 다른 로봇 두뇌(GPT-3.5-Turbo 및 GPT-4o-mini)를 사용했습니다. 그들은 지침을 작고 관리 가능한 조각으로 나누고 약한 부분만을 수정함으로써 이전 방식보다 훨씬 더 나은 결과를 얻을 수 있었으며, 일부 작업에서는 성능을 최대 7.25%까지 향상시켰음을 발견했습니다.

더 나은 로봇을 위한 레시피

이것이 어떻게 작동하는지 자세히 살펴보겠습니다. 여러분이 로봇에게 매우 길고 복잡한 설명서를 주고 있다고 상상해 보세요. 과거에는 로봇이 답을 틀리면, 자동 최적화 도구가 한 번에 전체 설명서를 다시 쓰려고 시도했습니다. 이는 고장 난 자동차 엔진을 고치기 위해 자동차 전체를 교체하려는 것과 같습니다. 때때로 이 새로운 자동차는 운전하기에는 아주 좋지만 주차하기에는 끔찍할 수도 있습니다. 기존 방식은 로봇을 한 가지 일에는 더 능숙하게 만들었지만, 다른 일에는 더 서툴게 만드는 경우가 많았는데, 저자들은 이를 "프롬프트 표류(prompt drifting)"라고 부릅니다.

저자들인 니키타 쿨린(Nikita Kulin)과 그의 팀은 더 똑똑한 방법을 제안합니다. 그들은 좋은 설명서가 단순히 하나의 커다란 텍스트 덩어리가 아니라, 책의 장(chapter)처럼 다양한 섹션으로 구성되어 있다는 점을 깨달았습니다. 그들은 프롬프트를 네 가지 특정 "세그먼트(segment)"로 나눕니다:

  1. 역할(Role): 로봇이 누구여야 하는가? (예: "당신은 유능한 역사학자입니다.")
  2. 맥락(Context): 배경 이야기나 상황은 무엇인가? (예: "당신은 학생과 대화하고 있습니다.")
  3. 작업(Tasks): 로봇이 정확히 무엇을 해야 하는가? (예: "이 텍�를 세 문장으로 요약하세요.")
  4. 출력 형식(Output Format): 답변이 어떤 형태여야 하는가? (예: "글머리 기호를 사용하여 목록 형태로 제시하세요.")

SAPO 탐정 게임

새로운 방법인 SAPO는 이 네 가지 세그먼트를 탐정 게임의 단서처럼 취급합니다. 여기에서 사용하는 단계별 프로세스는 다음과 같습니다.

먼저, 시스템은 여러 예시를 통해 로봇을 훈련 세션에 통과시킵니다. 시스템은 결과를 살펴보고 가장 잘 된 상위 5개의 예시(로봇이 맞춘 경우)와 가장 못한 하위 5개의 예시(로봇이 틀린 경우)를 골라냅니다.

다음으로, 시스템은 탐정 놀이를 합니다. 시스템은 두 번째의 더 똑똑한 로봇(판사 역할)에게 상위 5개와 하위 5개 예시를 검토하게 하여, 로봇이 왜 성공했는지 혹은 왜 실패했는지 그 이유를 찾아내게 합니다. "역할" 섹션이 로봇을 혼란스럽게 했나요? "작업"이 너무 모호했나요? 판사는 어떤 세그먼트가 "강점"(좋은 예시에서 잘 작동함)이었고, 어떤 세그먼트가 "약점"(나쁜 예시에서 문제를 일으킴)이었는지를 식별합니다.

그다음은 마법 같은 부분인 제약 조건이 있는 합성(Constrained Synthesis) 단계입니다. 전체 설명서를 다시 쓰는 대신, 시스템은 강점이 있는 세그먼트는 정확히 그대로 유지하면서 약한 세그먼트만을 수정하는 새로운 버전의 프롬프트를 생성합니다. 이는 완벽한 초콜릿 케이크 반죽은 그대로 두고, 타버린 프로스팅만 신선한 반죽으로 교체하는 것과 같습니다. 이를 통해 이미 잘 작동하고 있는 지침 부분이 실수로 망가지는 것을 방지합니다.

마지막으로, 시스템은 이 새로운 (부분적으로 수정된) 프롬프트를 별도의 질문 세트(검증 세트)로 테스트합니다. 만약 새 프롬프트가 더 나은 성과를 보이면 채택됩니다. 그렇지 않다면 기존 프롬프트를 유지합니다. 이 과정은 로봇이 도달할 수 있는 최상의 상태가 될 때까지 반복됩니다.

결과: 명확한 승자

연구팀은 이 방법을 다섯 가지 매우 다른 과제에 대해 테스트했습니다:

  • SQuADv2: 읽기 지문을 바탕으로 질문에 답하기.
  • TweetEval: 트윗의 분위기 분류하기.
  • XSUM: 뉴스 기사 요약하기.
  • CommonGen: 단어 목록을 사용하여 문장 만들기.
  • GSM8K: 초등학교 수준의 수학 문장 문제 풀기.

그들은 이 테스트를 GPT-3.5-Turbo와 GPT-4o-mini라는 두 가지 서로 다른 로봇 모델에 대해 실시했습니다. 결과는 매우 인상적이었습니다. 전체 프롬프트를 한 번에 다시 쓰는 다른 인기 있는 방법들(APE, OPRO, EvoPrompt 등)과 비교했을 때, SAPO는 일관되게 더 높은 점수를 기록했습니다.

GPT-3.5-Turbo 모델에서 SAPO는 차순위 방법보다 평균 점수를 5.13% 향상시켰습니다. 더 발전된 모델인 GPT-4o-mini에서는 그 향상 폭이 더 커져서, 경쟁 모델보다 7.25% 더 높은 점수를 기록했습니다. 가장 큰 승리는 수학 문제(GSM8K)나 독해(SQuAD2)처럼 매우 엄격한 답변을 요구하는 작업에서 나타났는데, 이런 작업에서는 지침의 아주 작은 실수만으로도 완전히 틀린 답이 나올 수 있기 때문입니다.

이것이 중요한 이유

저자들은 이러한 성공이 SAPO가 한꺼번에 모든 것을 바꿀 때 발생하는 "파괴적 간섭(destructive interference)"을 막아주기 때문이라고 설명합니다. 변화를 프롬프트의 약한 부분에만 국한함으로써, 이미 완벽하게 작동하고 있는 부분들을 보존할 수 있습니다. 이는 로봇을 가르치는 데 있어 더 신중하고 정교한 외과 수술적 접근 방식입니다.

하지만 논문은 몇 가지 한계점도 언급하고 있습니다. 현재 방식은 고정된 네 가지 세그먼트를 사용합니다. 이 방식이 많은 작업에 효과적이긴 하지만, 모든 유형의 문제에 대해 충분히 상세하지 않을 수도 있습니다. 저자들은 미래의 버전에서는 단순히 이 네 가지에 머무르는 것이 아니라, 필요에 따라 로봇이 새로운 유형의 세그먼트를 자동으로 발견할 수 있도록 할 수 있다고 제안합니다.

요약하자면, SAPO는 슈퍼 인텔리전트 로봇을 가르치고 싶을 때, 때로는 실수를 바로잡는 가장 좋은 방법이 처음부터 다시 시작하는 것이 아니라, 정확히 무엇이 잘못되었는지 찾아내어 그 부분만을 고치는 것임을 보여줍니다. 이는 "모두 다시 쓰기"에서 "고장 난 부분만 고치기"로의 전환이며, 현재로서는 이것이 승리하는 전략인 것으로 보입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →