← 최신 논문
💬 NLP

Global Optimization and Inference-Time Region Grafting for Agentic Workflows

이 논문은 레이블이 없는 품질 신호를 사용하여 실패한 실행 영역을 더 나은 대안으로 적응적으로 교체함으로써, 계산 비용이 많이 드는 전체 워크플로 재최적화 없이도 인스턴스별 최적화와 다양한 작업에 걸친 성능 향상을 가능하게 하는 훈련이 필요 없는 방법인 GRAFT를 소개한다.

원저자: Donghyeok Koh, Gyuwan Kim, Jinyeong Bak, Seung-Hoon Na, Tao Yang, Haneol Jang, Cheoneum Park

게시일 2026-08-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Donghyeok Koh, Gyuwan Kim, Jinyeong Bak, Seung-Hoon Na, Tao Yang, Haneol Jang, Cheoneum Park

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한, 복잡한 퍼즐을 풀려고 노력하고 있다고 상상해 보세요. 인공지능의 세계에서 이러한 퍼즐들은 "에이전틱 워크플로우(agentic workflows)"라고 불립니다. 단순히 똑똑한 컴퓨터에게 "이것을 풀어줘"라고 요청하는 대신, 우리는 사실을 검색하고, 앞을 내다보고 계획하며, 자신의 작업을 검토하고, 답을 다듬는 것과 같은 도구들을 포함한 구체적인 레시피, 즉 단계별 계획을 제공합니다. 이것은 마치 헤드 셰프(AI)가 단순히 요리만 하는 것이 아니라, 재료를 다듬는 수셰프, 맛을 보고 검증하는 테이스터, 그리고 메뉴를 조직하는 플래너를 거느리고 있는 주방과 같습니다.

오랫동안 과학자들은 모든 유형의 퍼즐에 맞는 '완벽한' 레시피를 찾기 위해 노력해 왔습니다. 그들은 최적의 단계 순서를 파악하기 위해 수천 번의 오프라인 테스트를 수행합니다. 하지만 문제는 모든 퍼즐이 같지는 않다는 점입니다. 간단한 수학 문제는 빠른 손질만 필요할 수도 있지만, 까다로운 역사 질문은 깊이 있는 탐구와 재검토가 필요할 수도 있습니다. 만약 모든 퍼즐에 대해 동일하고 경직된 레시피를 사용한다면, 그 계획이 특정 순간에 충분히 유연하지 못해 막히거나 어처구니없는 실수를 할 수도 있습니다. 그렇다면, 이미 잘 짜인 레시피를 유지하면서도, 지금 만들고 있는 특정 요리에 맞춰서 처음부터 다시 시작하지 않고도 요리하는 도중에 단계를 미세하게 조정할 수 있을까요?

이것이 바로 "Global Optimization and Inference-Time Region Grafting for Agentic Workflows"라는 논문이 다루는 문제입니다. 저자들은 GRAFT라는 새로운 시스템을 소개합니다. GRAFT는 특정 유형의 식사를 위한 "황금 레시피"를 가지고 있으면서도, 맛을 본 결과 재료가 더 필요하다고 판단되면 한두 가지 재료를 기꺼이 교체할 수 있는 마스터 셰프처럼 행동합니다.

실제 논문에서 이 방식이 어떻게 작동하는지 살펴보겠습니다. 먼저, 시스템은 수학이나 코딩과 같은 특정 작업 범주에 대해 표준 테스트 방법을 사용하여 전역적으로 최적화된 워크플로우(즉, "황금 레시피")를 찾습니다. 이는 AI가 질문에 답하기 에 이루어집니다. 그다음, 특정 질문이 들어왔을 때 GRAFT는 레시피를 맹목적으로 실행하지 않습니다. 대신 레시피를 "리전(region, 영역)"이라고 불리는 작고 독립적인 섹션들로 나눕니다. AI가 문제를 해결해 나가는 동안, 시스템은 각 리전을 점검합니다. 만약 특정 리전(예를 들어 "추론" 단계)이 어려움을 겪거나 약한 결과를 내놓는 것처럼 보이면, GRAFT는 그 특정 섹션을 실시간으로 더 나은 버전으로 교체합니다.

결정적으로, 이 교체는 정답을 미리 알 필요 없이(실시간 사용 중에는 보통 불가능하므로) 이루어집니다. 대신, 시스템은 품질을 판단하기 위해 영리한 "레이블 프리(label-free, 정답 라벨이 필요 없는)" 신호를 사용합니다. 예를 들어, 수학에서는 동일한 문제를 다섯 가지 방식으로 실행해 보고 그것들이 서로 일치하는지 확인합니다(자기 일관성 기술). 코딩에서는 코드를 실행하여 테스트를 통과하는지 확인합니다. 만약 새로운 버전의 단계가 더 좋아 보이고 다음 단계와의 연결을 깨뜨리지 않는다면, GRAFF는 그것을 "접목(graft)"합니다. 그렇지 않다면 원래의 것을 유지합니다. 이 과정은 모든 입력에 대해 즉각적으로 일어납니다.

논문에 따르면 이 접근 방식은 게임 체인저임이 밝혀졌습니다. 수학 문제(GSM8K, MATH 등)부터 코딩 작업(HumanEval), 복잡한 질문(HotpotQA)에 이르기까지 다섯 가지 벤치마크에서 테스트했을 때, GRAFT는 이전의 최고 방법인 MaAS보다 평균 3.85포인트 더 높은 성적을 거두었습니다. AI 벤치마크의 세계에서 이는 엄청난 도약입니다. 예를 들어, GSM8K 수학 데이터셋에서 GRAFT는 95.04를 기록하여, 그다음으로 높은 성적을 낸 방법인 92.30을 앞질렀습니다.

저자들은 또한 "레시피" 자체에 대해 흥anche한 사실을 발견했습니다. 그들은 최적화된 워크플로우가 단순히 정적인 지침이 아니라, 유연한 정책이라는 것을 발견했습니다. 심지어 워크플로를 변경하지 않고도 "셰프"(기저에 깔린 AI 모델)를 더 강력한 모델로 교체하기만 해도 성능이 향상되었습니다. 이는 좋은 워크플로우가 적응 가능하다는 것을 시사합니다. 즉, 설계를 다시 할 필요 없이 더 똑똑한 도구를 갖추는 것만으로도 진화하고 개선될 수 있다는 것입니다.

하지만 논문은 이 마법이 어디에서 작동하고 어디에서 한계에 부딪히는지도 주의 깊게 명시합니다. 품질을 판단하는 데 사용되는 "레이블 프리" 신호는 정답이 맞거나 틀린 것으로 명확한 수학과 코딩에서는 매우 잘 작동합니다. 하지만 복잡한 지식 질문(역사나 과학에 관한 질문 등)의 경우, 신호의 신뢰도가 낮아 시스템의 개선 폭이 적습니다. 저자들은 GRAFT가 워크플로우를 실시간으로 적응시키는 강력한 방법이긴 하지만, 최종 정답을 모르는 상태에서 단계의 품질을 검증할 수 있는 능력에 크게 의존한다는 점을 시사합니다.

요약하자면, GRAFT는 엄격하게 미리 계획된 전략과 무작위로 즉흥적으로 만들어가는 방식 사이에서 하나를 선택할 필요가 없음을 증명합니다. 견고한 토대 위에 작고 스마트한 조정을 접목함으로써, AI 에이전트는 더욱 강력하고 효율적이며 정확해질 수 있으며, 기존의 "원 사이즈 피츠 올(one-size-fits-all)" 계획으로는 해결하기 어려웠던 문제들을 해결할 수 있게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →