← 최신 논문
💬 NLP

SePO: Self-Evolving Prompt Agent for System Prompt Optimization

이 논문은 2단계 진화 탐색을 통해 태스크 에이전트와 프롬프트 에이전트 자신의 시스템 프롬프트를 모두 최적화하는 자기 참조 프레임워크인 SePO를 제안하며, 기존 방식들과 비교하여 다양한 벤치마크에서 우수한 일반화 성능과 성능을 입증한다.

원저자: Wangcheng Tao, Han Wu, Weng-Fai Wong

게시일 2026-06-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Wangcheng Tao, Han Wu, Weng-Fai Wong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 어려운 퍼즐을 풀거나, 코드를 작성하거나, 수학 문제를 해결해야 하는 아주 똑똑하지만 고집 센 로봇 비서(태스크 에이전트)가 있다고 상상해 보십시오. 이 로봇을 더 잘 작동하게 만들기 위해, 당신은 '시스템 프롬프트'라고 불리는 일련의 지침을 제공합니다.

오랫동안 이러한 지침을 작성하는 것은 인간이었습니다. 만약 로봇이 실패하면, 인간이 지침을 다시 쓰고, 다시 시도하며, 결과가 좋아지기를 바랐습니다. 일부 최신 방법들은 '코치'(프롬프트 에이전트)를 사용하여 이 지침을 자동으로 재작성합니다. 하지만 여기에는 함정이 있습니다. 코치의 지침 자체는 여전히 인간에 의해 작성되었으며 결코 변하지 않았다는 점입니다. 코치는 아무리 많은 횟수로 로봇을 도우려 노력하더라도, 고정된, 손으로 작성된 매뉴얼에 갇혀 있었습니다.

**SePO(Self-Evolving Prompt Optimization, 자기 진화형 프롬프트 최적화)**는 이 게임의 규칙을 바꿉니다. SePO는 코치가 스스로를 코칭할 수 있게 해줍니다.

핵심 아이디어: 코치가 코치를 코칭한다

SePO를 AI 지침 매뉴얼을 위한 체육관이라고 생각해보십시오.

  • 기존 방식: 당신은 고객(로봇)이 체력을 기르도록 돕기 위해 개인 트레이너(코치)를 고용합니다. 하지만 트레이너 자신의 운동 계획은 인간이 작성한 것이며 업데이트되지 않습니다. 트레이너는 고객을 돕는 데는 더 능숙해질 수 있지만, 트레이너 자신이 더 건강해지지는 못합니다.
  • SePO 방식: 트레이너 또한 고객입니다. 트레이너는 고객이 체력을 기르도록 돕지만, 트레이너 또한 자신의 운동 계획을 개선하기 위해 동일한 훈련 방법을 사용합니다. 트레이너는 고객뿐만 아니라 자기 자신도 점점 더 똑똑하고 강해집니다.

작동 원리: 두 단계의 훈련

이 논문은 인간이 새로운 기술을 배우는 방식과 유사한 두 단계 과정을 설명합니다.

1단계: "부트 캠프" (사전 훈련)
코치가 특정 로봇을 돕기 전, 코치는 매우 다양한 도전 과제들(수학, 논리 퍼즐, 코딩, 과학)이 있는 '부트 캠프'에 들어갑니다.

  • 이 단계에서 코치는 이 문제들을 해결하려고 시도합니다.
  • 실패했을 때, 코치는 자신의 지침을 비판하고, 지침을 다시 쓰고, 다시 시도합니다.
  • 코치는 자신의 가장 좋은 지침들을 담은 '스크랩북'(아카이브)을 유지합니다. 만약 새로운 지침이 기존의 것보다 더 효과적이라면, 새로운 것을 보관합니다.
  • 결과: 코치는 단순히 하나의 특정 기술을 암기하는 것이 아니라, 지침을 수정하는 일반적인 '기술'을 가진 숙련된 강사로 진화합니다.

2단계: "전문가 업무" (미세 조정)
이제 코치는 특정 작업(예: 스도쿠 해결)을 수행하는 특정 로봇을 돕기 위해 고용되었습니다.

  • 코치는 진화된 초스마트 지침을 사용하여 로봇을 돕습니다.
  • 코치는 특정 퍼즐에 맞게 로봇의 지침을 미세하게 조정합니다.
  • 코치는 1단계에서 '배우는 법'을 배웠기 때문에, 자신의 매뉴얼을 먼저 다시 쓰기 위해 인간의 도움을 받을 필요 없이 새로운 작업에 빠르게 적응할 수 있습니다.

이것이 왜 중요한가 (결과)

연구진은 다섯 가지 매우 다른 유형의 챌린지에 대해 테스트를 진행했습니다:

  1. 수학 (어려운 경시 대회 문제)
  2. 추상적 추론 (시각적 패턴 퍼즐)
  3. 과학 (대학원 수준의 질문)
  4. 코딩 (Python 프로그램 작성)
  5. 논리 (스도쿠 퍼즐)

그들은 SePO를 다음 모델들과 비교했습니다:

  • Manual-CoT: 인간이 직접 지침을 작성하는 방식.
  • TextGrad: 지침을 수정하지만 고정된 인간 작성 '비평가'를 사용하는 방식.
  • MetaSPO: 글로벌 규칙을 학습하지만 여전히 고정된 인간 작성 옵티마이저에 의존하는 방식.

결과:
SePO는 모든 작업에서 승리했습니다. 평균적으로 인간이 작성한 베이스라인보다 정확도를 4.49 포인트 향상시켰습니다.

  • SePO는 단순히 정답을 암기한 것이 아니라, 더 나은 지침을 쓰는 일반적인 '기술'을 배웠습니다.
  • 심지어 부트 캠프 기간 동안 한 번도 본 적 없는 퍼즐(스도쿠)에 대해 테스트했을 때도, 다른 방법들보다 더 나은 성능을 보였습니다. 이는 SePO가 특정 기술을 암기한 것이 아니라 전이 가능한 기술을 배웠음을 증명합니다.

"진화하는 정원"의 비유

지침을 정원의 식물이라고 상상해 보십시오.

  • 기존 방식: 당신은 씨앗(지침)을 심고 물을 줍니다. 만약 식물이 죽으면, 당신은 가방에서 새로운 씨앗을 꺼내 다시 시도합니다. 정원사(코치)는 변하지 않습니다.
  • SePO: 정원사 또한 식물입니다. 정원사는 다른 식물들을 돌보는 동시에 성장하고 진화하며 더 나은 정원사가 됩니다. 정원은 최고의 식물들을 기록(아카이브)하고, 이를 발판 삼아 더 나은 식물을 키워냅니다. 결국, 이 정원은 본 적 없는 식물조차도 키워낼 수 있을 만큼 숙련된 정원사를 만들어냅니다.

요약

SePO는 루프를 닫습니다. 인간이 AI 코치를 위한 고정된 매뉴얼을 작성하는 대신, SePO는 AI 코치가 자신의 매뉴얼을 직접 쓰고 개선할 수 있게 합니다. 이는 코치를 정적인 도구에서 경험을 통해 점점 더 똑똑해지는 학습 파트너로 변화시키며, 수학, 과학, 코딩, 논리 퍼즐 전반에서 더 나은 성능을 이끌어냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →