The Optimizer Is the Agent: Reasoning-Driven Search across Prompts, Programs, and ML Workflows
이 논문은 단일한 추론 기반 에이전트가 프롬프트, 프로그램 및 ML 워크플로의 전체 최적화 과정을 자율적으로 관리하여 복잡한 탐색 정책을 효과적으로 내재화하고 다양한 작업에 걸쳐 특화된 시스템들을 능가하는 통합 프레임워크인 ReASearch를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇에게 퍼즐을 풀거나, 시를 쓰거나, 비디오 게임 캐릭터를 승리로 이끌도록 가르치고 있다고 상상해 보십시오. 인공지능의 세계에서 이것을 "최적화(optimization)"라고 부릅니다. 보통 인간은 사이드라인에서 엄격한 코치 역할을 수행합니다. 그들은 "이것을 해보고, 그다음 저것을 해보고, 만약 실패하면 다시 돌아가서 다른 것을 시도해 봐"와 같이 경직된 게임 플랜을 설계합니다. 로봇(대규모 언어 모델)은 그저 인간이 정한 전략에 따라 미세한 변화를 시도하며 명령을 맹목적으로 따르는 선수일 뿐입니다. 하지만 만약 로봇이 코치 역할까지 할 수 있다면 어떨까요? 로봇이 스스로 전광판을 보고, 왜 패배했는지 파악하고, 게임의 규칙을 바꿀지 결정하거나, 심지어 자신이 막다른 길에 다다랐음을 깨닫고 완전히 새로운 접근 방식이 필요하다는 것을 스스로 알아차릴 수 있다면 어떨까요? 이 논문은 바로 이 질문을 탐구합니다. 단 하나의 똑똑한 AI 에이전트가 인간이 작성한 스크립트의 지시 없이도, 최선의 해결책을 찾기 위한 자신의 탐색 과정을 스스로 관리하며 학습할 수 있을까요?
COLM 2026 컨퍼런스에서 발표된 이 연구의 저자들은 ReASearch라는 새로운 시스템을 소개합니다. 이것은 로봇에게 단순히 망치를 쥐여주는 대신 스위스 아미 나이프를 건네주는 것과 같습니다. 과거의 AI 최적화 도구들은 고정된 컨베이어 벨트가 있는 공장 조립 라인과 같았습니다. 어떤 후보 해결책을 다음에 테스트할지, 얼마나 많은 시간을 할애할지, 그리고 언제 포기할지를 인간이 설계한 알고리즘이 결정했습니다. AI의 유일한 임무는 현재의 해결책에 아주 작은 편집을 가하는 것이었습니다. ReASearch는 이 구도를 뒤집습니다. 이 시스템은 AI 에이전트에게 코드를 실행할 수 있는 파이썬 인터프리터, 과거의 실수를 기억하기 위한 메모리 파일, 그리고 실험을 수행할 수 있는 능력과 같은 도구 세트를 제공한 뒤, 에이전트가 모든 것을 결정하게 합니다. 에이전트는 스스로에게 묻습니다. "이 아이디어를 먼저 작은 샘플로 테스트해 볼까? 방금 똑같은 실수를 두 번 한 건가? 지금의 계획을 버리고 이전에 시도했던 더 나은 계획으로 돌아가야 할까?" 에이전트는 단순히 추측하는 것이 아니라, 과정을 통해 추론하며 자신만의 전략을 구축해 나갑니다.
연구팀은 이 "자기 코칭형" 에이전트를 텍스트 프롬프트를 더 똑똑하게 만드는 것부터 컴퓨터 프로그램을 진화시켜 수학 퍼즐을 풀게 하는 것, 그리고 머신러닝 학습 워크플로우를 최적화하는 것에 이르기까지 14가지의 다양한 과제를 통해 테스트했습니다. 결과는 놀라울 정도로 강력했습니다. 많은 경우에서 ReASearch는 특정 규칙을 하드코딩하여 만든 인간 전문가의 전문 시스템들을 능가했습니다. 예를 들어, "원 채우기(Circle Packing)"(정사각형 안에 원을 최대한 촘แพ하게 배치하는 작업)라는 과제에서, 이 에이전트는 인간이 이전에 발견했던 최선의 결과보다 더 나은 해결책을 찾아냈습니다. 다른 과제들에서는 성능을 2%에서 무려 40%까지 향상시키기도 했습니다.
정말로 매혹적인 점은 에이전트가 어떻게 그것을 해냈는가 하는 점입니다. 연구진은 아무도 가르쳐주지 않았음에도 불구하고, 에이전트가 자연스럽게 노련한 과학자나 체스 그랜드마스터처럼 행동하기 시작했다는 것을 발견했습니다. 에이전트는 어떤 아이디어를 확정하기 전에 먼저 "재확인"하는 과정을 거쳤습니다. 새로운 경로가 막다른 길로 이어질 때, 이전의 더 안전한 버전으로 "되돌리는" 법을 배웠습니다. 또한 똑같은 실수를 반복하지 않기 위해 "학습된 교훈" 일지를 작성하기 시작했습니다. 가장 인상적인 것은, 때로는 문제를 해결하기 위해 두 가지 서로 다른 기술을 결합해야 한다는 사실을 에이전트가 스스로 알아냈다는 점인데, 이는 대개 깊은 인간적 통찰력을 필요로 하는 발견입니다. 이 논문은 AI에게 적절한 도구를 주고 그 과정을 통해 추론하게 하면, 우리가 이전에는 인간이 설계한 알고리즘이 관리해야 한다고 생각했던 복잡한 탐색 전략을 내재화할 수 있음을 시사합니다. 결국, 최적화 도구는 별개의 경직된 컨트롤러일 필요가 없습니다. 최적화 도구 자체가 바로 에이전트가 될 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.