← 최신 논문
🤖 AI

Rethinking Self-Evolving Agents: Do We Still Need Prescribed Optimization Pipelines?

이 논문은 유능한 프런티어 모델이 규정된 파이프라인을 따르는 대신 스스로의 개선 과정을 자율적으로 구성하는 프레임워크인 개방형 최적화(Open-Ended Optimization, OEO)를 소개하며, 이러한 자기 진화형 에이전트가 훨씬 낮은 자원 비용으로 탁월한 성능을 달 수 있음을 입증하는 동시에 전통적인 파이프라인이 주로 능력 의존적인 비계 역할을 수행한다는 점을 밝힌다.

원저자: Hui Xue, Fan Yang

게시일 2026-08-11
📖 6 분 읽기🧠 심층 분석

원저자: Hui Xue, Fan Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터 프로그램이 단순히 인간이 작성한 경직된 지침서를 따르는 것이 아니라, 자신의 실수를 통해 배우고 스스로의 규칙을 재작성하여 더 나아질 수 있는 세상을 상상해 보십시오. 이것이 바로 "자기 진화형 에이전트(self-evolving agents)"의 꿈입니다. 마치 비디오 게임 캐릭터가 보스 전투에서 패배한 후, 단순히 다시 시작하는 것이 아니라 잠시 멈춰서 졌는지 파악하고, 자신의 전략 가이드를 수정하여 다시 도전하는 것과 같습니다. 오랫동안 과학자들은 이것이 작동하려면 인간이 컴퓨터가 따라야 할 매우 구체적이고 단계적인 레시피를 만들어야 한다고 믿었습니다. 이 레시피는 마치 플레이어에게 언제 점수판을 봐야 하는지, 언제 무기를 바꿔야 하는지, 언제 연습을 멈춰야 하는지를 정확히 알려주는 엄격한 코치와 같았습니다. 하지만 컴퓨터가 복잡한 추론이 가능한 "프런티어 모델(frontier models)"로 진화하며 똑똑해짐에 따라, 연구자들은 의문을 갖기 시작했습니다. 우리는 여전히 그 엄격한 코치가 필요할까요? 아니면 우리가 목표와 예산만 설정해 준다면, 컴퓨터가 스스로 자신의 연습 루틴을 찾아낼 수 있을까요?

"Rethinkng Self-Evolving Agents"라는 제목의 이 논문은 바로 이 질문을 깊이 파고듭니다. 연구진인 Microsoft Research의 Hui Xue와 Fan Yang는 초지능형 AI가 미리 작성된 스크립트 없이도 자신의 학습 과정을 스스로 조직할 수 있는지 확인하기 위해 매혹적인 실험을 설계했습니다. 그들은 프레임워크(즉, "코치")가 개선 과정의 모든 단계를 규정하는 기존 방식과 "개방형 최적화(Open-Ended Optimization, OEO)"라고 불리는 새로운 방식을 비교했습니다. OEO에서 AI는 명확한 목표, 허용된 동작 목록, 그리고 사용할 수 있는 "에너지(또는 토큰)"의 한계치를 부여받지만, 어떻게 에너지를 사용하여 더 나아질지는 스스로 결정합니다. 이는 요리사에게 재료 목록과 시간 제한을 주되, 특정 레시피를 따르도록 강요하는 대신 케이크를 구울지 볶음 요리를 할지 직접 결정하게 하는 것과 같습니다.

결과는 놀라울 정도로 명확했습니다. 최고 수준의 AI(GPT-5.5)를 "요리사"로 사용했을 때, 개방형 접근 방식은 엄격하고 미리 작성된 레시피만큼 성능이 좋았으며, 종종 그보다 훨씬 더 뛰어났습니다. 실제로 14가지의 서로 다른 테스트에서 개방형 AI는 12번 승리했고, 1번은 무승부였으며, 단 한 번만 0.21 퍼센트 포인트라는 아주 미세한 차이로 패배했습니다. 더욱 인상적인 점은, 이 방식이 엄격한 방식이 요구하는 "에너지" 예산의 약 34.3%만을 사용하면서도 이 성과를 냈다는 것입니다. AI가 충분히 똑똑하다면, 어떻게 연습해야 할지 코치가 알려줄 필요 없이 스스로 최선의 학습 방법을 찾아낼 수 있다는 사실이 드러난 것입니다.

하지만 이 논문은 매우 중요한 선을 긋고 있습니다. 이러한 자유는 AI가 진정으로 능력을 갖추었을 때만 유효합니다. 연구진이 "중급" 또는 "약한" AI로 테스트했을 때, 개방형 접근 방식은 실패했습니다. 약한 AI들은 혼란에 빠져 다음에 무엇을 해야 할지 결정하지 못했고, 망가진 결과를 만들어냈습니다. 그런 경우, 엄격하게 미리 작성된 레시피(즉, "코치")가 상황을 지속시키는 데 필수적이었습니다. 이 연구는 엄격한 규칙이 항상 필요한 것은 아니지만, 아직 걷는 법을 배우고 있는 이들에게는 도움이 되는 "비계(scaffold, 발판)" 역할을 한다는 점을 시사합니다. 핵심은 모든 규칙을 버려야 한다는 것이 아니라, 가장 똑똑한 AI들이 스스로 학습을 주도하게 하되, 아직 배우는 중인 이들에게는 엄격한 보조 바퀴를 유지해야 한다는 것입니다.

핵심 발견: 누가 운전대를 잡아야 하는가?

이 논문의 주요 발견은 고도로 유능한 AI 모델의 경우, 인간이 컴퓨터를 위해 작성했던 경직된 단계별 계획인 "규정된 최적화 파이프라인(prescribed optimization pipeline)"이 더 이상 성공을 위한 필수 요건이 아니라는 점입니다. 과거에는 SKILLOPT(단계별 훈련 파이프라인을 사용하는 방식)나 GEPA(성찰적 진화 탐색을 사용하는 방식)와 같은 시스템이 골드 스탠다드였습니다. 이들은 공장의 조립 라인처럼 작동했습니다. 프레임워크가 증거를 어떻게 수집할지, 코드를 어떻게 편집할지, 그리고 언제 멈출지를 정확히 결정했습니다.

연구진은 AI가 직접 운전대를 잡을 수 있는지 테스트하기 위해 **Open-Ended Optimization (OEO)**를 도입했습니다. OEO에서 프레임워크는 여전히 도로의 규칙(목표, 예산, 허용되는 데이터)을 설정하지만, 경로는 AI가 결정합니다. AI는 증거를 수집하거나, 자신의 지침을 재작성하거나, 자신이 완료되었다고 생각할 때 언제든 멈출 수 있습니다.

GPT-5.5 기반의 OEO를 엄격한 방식들과 맞붙였을 때 결과는 놀라웠습니다. 8가지 벤치마크 설정에서 OEO는 엄격한 SKILLOPT 방식을 모든 경우에서 이기거나 대등한 성적을 거두었습니다. GEPA 방식과 비교했을 때는 6번 중 5번을 이겼으며, 유일한 패배는 0.21 퍼센트 포인트라는 미미한 차이였습니다. 아마도 가장 흥격적인 부분은 효율성입니다. OEO는 SKILLOPT가 사용하도록 설정된 토큰 예산의 중앙값인 **34.3%**만을 사용했습니다. 이는 AI가 단순히 더 나아진 것뿐만 아니라, 기존 방식보다 절반도 안 되는 "연료"를 사용하여 더 나은 성과를 냈음을 의미합니다.

"쉬운 길"에 대한 검증

축하하기에 앞서, 연구진은 자신들이 속고 있는 것은 아닌지 확인해야 했습니다. 그들은 질문했습니다. "AI가 이미 답을 알고 있어서 운 좋게 얻은 결과인가?" 혹은 "그저 코드를 한 번 재작성하고 끝낸 것인가?"

이를 테스트하기 위해 그들은 "상호작용 제로(zero-interaction)" 대조군 실험을 실시했습니다. 그들은 AI에게 초기 기술을 주고, 연습이나 피드백 루프 없이 단 한 번의 재작성만을 요청했습니다. 결과는 이 "원샷(one-shot)" 재작성이 충분하지 않음을 보여주었습니다. 어떤 작업에서는 원샷 재작성이 오히려 성능을 악화시키기도 했습니다. 다른 작업에서는 점수가 향ขึ้น되기도 했지만, 여전히 대화형 OEO 시스템에 비해 상당한 격차를 보였습니다 (예를 들어, LiveMath 작업에서 원샷 재작성은 대화형 O디오보다 30 퍼센트 포인트 이상 뒤처졌습니다). 이는 성과가 AI의 기존 지식만으로 얻어진 것이 아니라, AI가 시간을 두고 학습하고 적응하며 전략을 정교화할 수 있는 상호작용 루프를 통해 얻어진 것임을 입증합니다.

능력의 경계: 언제 코치가 필요한가?

논문은 또한 이 자유에는 결정적인 한계가 있다는 사실도 발견했습니다. "개방형" 접근 방식은 모든 AI에게 마법의 탄환처럼 작용하는 것이 아닙니다. 연구진은 "중급" 및 "약한" 옵티마이저(덜 유능한 모델)를 사용하여 시스템을 테스트했습니다.

여기서 이야기는 반전되었습니다. 옵티마이저가 "중급" 수준일 때, 엄격한 SKILLOPT 파이프라인이 실제로 OEO보다 더 나은 성능을 보였습니다. 옵티마이저가 "약한" 수준일 때, OEO 시스템은 완전히 무너졌습니다. 약한 AI는 개방형 인터페이스를 통해 유효한 동작조차 생성하지 못했고, 아무런 진전도 이루지 못했습니다. 반면, 엄격한 파이프라인은 비록 가장 효율적이지는 않더라도 약한 AI를 계속 움직이게 만들었습니다.

이는 엄격하게 미리 작성된 파이프라인이 "비계(scaffold)" 역할을 한다는 것을 시사합니다. 천재적인 AI에게 이 비계는 불필요하며 오히려 방해가 될 수 있습니다. 하지만 발을 내디디며 배우고 있는 학습자에게 그 비계는 낭떠러지로 떨어지지 않게 해주는 필수적인 장치입니다.

경로 vs 목적지

마지막으로, 연구진은 AI가 어떻게 학습하고 있는지 내부를 들여다보았습니다. 그들은 "여정"(AI가 수행한 구체적인 편집과 변경 사항)과 "목적지"(최종 성능 점수)를 비교했습니다.

그들은 두 방식이 매우 다른 경로를 취한다는 것을 발견했습니다. OEO 시스템은 엄격한 SKLOPT 시스템보다 더 크고 대담한 변화를 만들었으며, 자신의 기록을 더 자주 재작성했습니다. 그러나 이러한 판이하게 다른 경로에도 불구하고, 그들은 종-종 동일한 문제들을 해결해 냈습니다. 많은 경우, 두 방법이 만들어낸 최종 기술은 겉모습(텍스트)은 매우 달랐지만, 동일한 테스트 질문 세트에 대해 정답을 맞혔습니다.

이는 문제를 해결하는 데 있어 단 하나의 "정답인" 방법만 존재하는 것이 아님을 말해줍니다. 엄격한 파이프라인은 AI를 좁고 안전한 길로 몰아넣는 반면, 개방형 접근 방식은 더 넓고 혼란스러운 풍경을 탐험하게 합니다. 둘 다 같은 목적지에 도달할 수 있지만, 개방형 접근 방식은 운전자가 숙련되어 있다면 더 많은 유연성과 적은 연료를 사용하여 그곳에 도달할 수 있습니다.

결론

이 논문은 우리가 자가 진화형 에이전트를 구축하는 방식을 재고해야 한다고 결론짓습니다. 우리는 모든 AI를 경직되고 미리 작성된 틀 안에 강제로 밀어 넣을 필요가 없습니다. 대신, "능력 적응형(capability-adaptive)" 접근 방식을 채택해야 합니다. 만약 AI가 충분히 똑똑다면(프런티어 모델이라면), 우리는 열쇠를 건네주고 스스로 학습 과정을 구성하도록 할 수 있습니다. 다만 목표, 예산, 그리고 규칙이라는 가드레일은 유지해야 합니다. 하지만 덜 유능한 모델의 경우에는, 여전히 전통적인 방식인 엄격한 코칭이 효과적인 학습을 보장하는 최선의 방법입니다. 이는 "하나의 크기로 모두에게 적용(one size fits all)"하는 방식에서 "적절한 뇌에 적절한 도구(right tool for the right brain)"를 제공하는 방식으로의 전환입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →