← 최신 논문
💬 NLP

AdaptEvolve: Improving Efficiency of Evolutionary AI Agents through Adaptive Model Selection

이 논문은 고유 생성 신뢰도에 기반하여 각 정제 단계에 가장 적합한 대규모 언어 모델을 동적으로 선택함으로써 진화형 AI 에이전트의 효율성을 향상시키는 프레임워크인 AdaptEvolve를 소개하며, 이를 통해 높은 정확도를 유지하면서 추론 비용을 약 38% 절감합니다.

원저자: Pretam Ray, Pratik Prabhanjan Brahma, Zicheng Liu, Emad Barsoum

게시일 2026-04-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Pretam Ray, Pratik Prabhanjan Brahma, Zicheng Liu, Emad Barsoum

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

고난도 프로그래밍 퍼즐을 해결하는 것을 목표로 하는 고위험 코딩 대회를 운영한다고 상상해 보세요. 여러분을 돕기 위해 두 가지 유형의 심사관이 있습니다:

  1. 주니어 인턴 (소규모 모델): 빠르고 저렴하며 일상적인 작업을 처리하는 데 뛰어납니다. 하지만 매우 어렵고 까다로운 문제에서는 막히거나 실수를 할 수 있습니다.
  2. 시니어 전문가 (대규모 모델): 극도로 똑똑하고 가장 어려운 퍼즐을 해결할 수 있지만, 느리고 고용 비용이 비싸며 답변을 제공하는 데 시간이 오래 걸립니다.

문제점:
전통적인 "진화형" AI 시스템 (AI 가 시도하고, 실패하고, 학습하며 다시 시도하는 방식) 에서는 일반적으로 하나의 심사관을 선택하여 전체 과정에서 그 심사관만 고수합니다.

  • 인턴만 사용하면 비용을 절감할 수 있지만, 가장 어려운 퍼즐을 결코 해결하지 못할 수 있습니다.
  • 전문가만 사용하면 모든 문제를 해결할 수 있지만, 비용이 천문학적으로 들고 시간이 무한히 걸립니다.
  • 일부 시스템은 누구를 호출할지 결정하기 위해 "규칙집"(정적 라우팅) 을 사용하려 하지만, 이러한 규칙은 경직되어 있습니다. 인턴이 실제로 자신감을 가지고 있을 때나 문제가 갑자기 너무 어려워졌을 때를 파악하지 못합니다.

해결책: AdaptEvolve
이 논문의 저자들은 AdaptEvolve라는 새로운 시스템을 개발했습니다. 이는 인턴의 작업을 실시간으로 감시하며, 순간적으로 인턴이 작업을 끝내게 할지 아니면 시니어 전문가를 소집할지 결정하는 똑똑한 실시간 관리자라고 생각하면 됩니다.

간단한 비유를 들어 작동 원리를 설명해 보겠습니다:

1. "자신감 맥박" 듣기

문제의 난이도를 추측하기 위해 외부 전문가에게 묻는 대신, AdaptEvolve 는 인턴 자신의 "분위기"를 듣습니다.

  • 인턴이 코드를 입력할 때, 시스템은 그들의 자신감을 확인합니다.
  • 높은 자신감: 인턴이 매끄럽게 코드를 입력하고, 답변에 확신이 있으며 코드가 견고해 보입니다. 시스템은 "좋아! 계속해, 인턴아. 넌 할 수 있어."라고 말합니다.
  • 낮은 자신감: 인턴이 망설이거나 되돌아가거나, 코드가 불안정해 보입니다 (높은 "엔트로피" 또는 불확실성). 시스템은 "어이구, 이건 위험해 보이네. 멈춰! 이 특정 부분은 시니어 전문가에게 맡기자."라고 말합니다.

2. "워밍업"과 "적응형 관리자"

이러한 호출을 어떻게 할지 학습하기 위해 시스템은 빠른 워밍업(50 개의 문제로 구성된 연습 라운드와 유사) 을 수행합니다.

  • 시스템은 인턴이 이 50 개의 문제를 해결하는 것을 지켜보며 다음과 같이 기록합니다: "인턴이 여기서 망설였을 때 실패했고, 저기서 자신감을 보였을 때 성공했다."
  • 이 데이터를 기반으로 간단한 의사결정 트리(흐름도) 를 구축합니다.
  • 결정적으로 이 관리자는 적응형입니다. 대회가 더 어려워질수록 (AI 가 더 어려운 문제를 해결하도록 진화할수록), 관리자는 실시간으로 규칙을 업데이트합니다. 문제가 더 까다로워지면 관리자는 전문가를 더 일찍 호출하도록 학습합니다. 이는 구식이 되는 정적 규칙집에 의존하지 않습니다.

3. 결과: 양쪽 세계의 최고

이 논문은 LiveCodeBench 와 MBPP 와 같은 코딩 벤치마크에서 이를 테스트했습니다. 그들이 발견한 바는 다음과 같습니다:

  • 비용 절감: 값싼 인턴에게 쉬운 작업을 맡기고 절대적으로 필요할 때만 비싼 전문가를 호출함으로써 총 컴퓨팅 비용을 약 38% 절감했습니다.
  • 성능: 품질을 많이 잃지 않았습니다. 시스템은 "전체 전문가" 시스템이 해결할 수 있었던 문제의 **97.5%**를 여전히 해결했습니다.
  • 효율성: 그들은 "파레토 프론티어"를 창출했는데, 이는 돈을 가장 많이 지불했을 때 가장 큰 가치를 얻는 완벽한 균형을 찾았다는 것을 의미하는 고급 표현입니다.

요약 비유

자동차를 운전한다고 상상해 보세요.

  • 구식 방식: 모든 여행을 느리고 연비가 좋은 경제형 차로 운전하거나 (어떤 어려운 일도 해결하지 못함), 기름을 많이 먹는 레이싱 카로 운전합니다 (모든 일을 해결하지만 비용이 천문학적으로 듭니다).
  • AdaptEvolve: 고속도로에서는 경제형 차로 운전합니다. 하지만 곧 가파르고 바위투성이인 산길이 앞쪽에 보이면 (어려운 문제), 차량의 스마트 시스템이 즉시 레이싱 카로 전환합니다. 산을 지나면 다시 경제형 차로 전환합니다. 연료를 절약하면서도 산을 정복할 수 있습니다.

이 논문이 주장하지 않는 것:

  • 자동으로 테스트 가능한 코드 조각이 "정답"이 아닌 시나리오, 즉 시나리오나 수학 증명서 작성과 같은 비코딩 작업에 대해 이것이 작동한다고 주장하지 않습니다.
  • 인간 코드를 완전히 대체한다고 주장하지 않으며, 대신 AI 코딩 프로세스를 더 저렴하고 빠르게 만드는 데 초점을 맞춥니다.
  • AI 가 코드를 생성하고, 테스트하며, 시간이 지남에 따라 개선하는 "진화형" 시스템에 구체적으로 초점을 맞춥니다.

간단히 말해, AdaptEvolve는 AI 의 고유한 "직감"(자신감) 을 활용하여 값싼 도구를 언제 사용할지, 언제 비싼 전문가를 소집할지 결정하는 스마트한 스위치로, 품질을 너무 희생하지 않으면서 비용을 절감합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →