← 최신 논문
💻 computer science

Reinforced Graph of Thoughts: RL-Driven Adaptive Prompting for LLMs

본 논문은 강화 학습을 활용하여 그래프 오브 씽킹 프롬프팅의 작업 그래프를 동적으로 적응시키는 자동화된 프레임워크인 강화 그래프 오브 씽킹 (RGoT) 을 제안함으로써, 수동으로 정의된 구조의 경직성을 극복하고 복잡한 문제 해결 작업을 더 잘 처리할 수 있도록 한다.

원저자: Manuel Noah Riesen, Peter Alfred von Niederhäusern

게시일 2026-05-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Manuel Noah Riesen, Peter Alfred von Niederhäusern

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 매우 똑똑하지만 때로는 산만할 수 있는 비서 (대형 언어 모델, 또는 LLM) 가 있다고 가정해 봅시다. 이 비서는 이야기 쓰기는 훌륭하지만 복잡한 수학이나 정리되지 않은 데이터 조직화에는 어려움을 겪습니다. 만약 단순히 "이 문제를 풀어라"라고만 요청한다면, 특히 문제가 거대할 경우 혼란을 겪거나 실수를 할 수 있습니다.

이를 돕기 위해 연구자들은 보통 그들에게 "레시피"나 단계별 계획을 제공합니다.

  • 생각의 연쇄 (Chain of Thought): "A 를 하고, 그다음 B 를 하고, 그다음 C 를 하라"와 같은 직선적인 지시들의 나열입니다.
  • 생각의 나무 (Tree of Thoughts): 가족 나무와 같아서, 비서가 다양한 가지들을 시도해 보고 어떤 것이 좋은지 확인한 뒤 막다른 길에 부딪히면 되돌아갑니다.
  • 생각의 그래프 (Graph of Thoughts, GoT): 가장 진보된 버전입니다. 지하철 노선도를 상상해 보세요. 비서는 문제를 여러 노선으로 나누어 각각 해결한 뒤, 그 결과들을 다시 하나로 합칩니다. 이는 큰 문제에 적합하지만, 사용하기 어렵습니다. 비서가 작업을 시작하기 전에, 당신이라는 인간이 전체 지하철 노선도를 직접 그려야 합니다. 만약 잘못된 지도를 그리면 비서는 실패합니다.

문제: "정적 지도"

원래의 "생각의 그래프"는 경직되고 미리 그려진 지하철 노선도와 같습니다. 문제가 정확히 예상한 것과 같다면 완벽하게 작동합니다. 하지만 문제가 더 커지거나 복잡해지면 (예: 예상했던 것보다 두 배 긴 숫자 목록), 고정된 지도는 무너집니다. 지도가 새로운 크기를 고려하지 않았기 때문에 비서는 길을 잃습니다.

해결책: 강화된 생각의 그래프 (Reinforced Graph of Thoughts, RGoT)

이 논문의 저자, 만누엘 노아 리젠 (Manuel Noah Riesen) 과 페터 알프레드 폰 니더하우저 (Peter Alfred von Niederhäusern) 는 RGoT라는 시스템을 구축했습니다. 당신이 지도를 그리는 대신, 그들은 비서에게 운전하면서 학습하는 GPS를 제공했습니다.

간단한 비유를 들어 작동 방식을 설명해 보겠습니다:

"합계 내기" 게임
임무가 매우 긴 숫자 목록을 더하는 것이라고 상상해 보세요.

  1. 옛날 방식: 당신은 비서에게 "이 숫자들을 더하라"고 말합니다. 목록에 숫자가 5 개라면 그들은 그것을 수행합니다. 하지만 50 개라면 혼란을 겪고 잘못된 답을 내놓습니다.
  2. RGoT 방식: 시스템에는 기본 동작들의 도구 상자가 있습니다.
    • 분할 (Split): 큰 목록을 두 개의 작은 목록으로 자릅니다.
    • 합계 (Sum): 작은 목록을 더합니다.
    • 병합 (Merge): 두 개의 작은 결과를 하나의 큰 결과로 합칩니다.

언제 분할하거나 병합할지 당신이 결정하는 대신, 시스템은 강화 학습 (RL) 에이전트를 사용합니다. 이 에이전트를 레벨을 클리어하려는 비디오 게임 캐릭터라고 생각하세요.

  • 게임: "레벨"은 숫자 목록입니다.
  • 동작: 캐릭터는 "분할", "합계", "병합", 또는 "중지"를 선택할 수 있습니다.
  • 보상: 최종 답이 맞으면 캐릭터는 점수를 얻습니다. 실패하면 점수를 잃습니다.

학습의 마법
처음에는 에이전트가 아무것도 모릅니다. 100 개의 숫자 목록을 한 번에 더해보려다 실패할 수도 있습니다. 하지만 "게임"을 하기 때문에 (강화 학습을 사용하므로) 실수에서 배웁니다.

  • 깨닫습니다: "이봐, 목록이 거대할 때 한 번에 모두 더하려고 하면 페널티를 받네. 하지만 먼저 분할하고, 그다음 작은 부분들을 합계내서, 마지막으로 그것들을 병합하면 엄청난 보상을 받는다!"
  • 시간이 지남에 따라 에이전트는 문제의 크기에 완벽하게 맞춰 실시간으로 자신만의 "지하철 노선도" (작업 그래프) 를 구축하는 법을 배웁니다.

그들이 실제로 한 일

연구자들은 이를 여러 작업에 대해 테스트했습니다:

  1. 목록 합계: 숫자들을 더하기.
  2. 목록 정렬: 숫자들을 순서대로 배치하기.
  3. 키워드 카운팅: 텍스트에서 단어가 몇 번 나타나는지 찾기.
  4. 문서 병합: 정보를 반복하지 않고 여러 텍스트를 하나로 합치기.

그들은 실제 AI 모델을 훈련시키는 것만 (너무 비싸고 느리므로) 사용하지 않았습니다. 대신 시뮬레이션을 만들었습니다. 그들은 AI 가 10 개, 20 개, 50 개 항목의 목록에서 실수를 할 확률을 파악하고 이를 게임에 프로그래밍했습니다. 에이전트는 이 시뮬레이션에서 학습한 뒤, 실제 AI 에 대해 테스트했습니다.

결과

논문의 주장에 따르면:

  • 적응성: 에이전트는 문제의 난이도에 따라 자동으로 전략을 변경하는 법을 배웠습니다. 목록이 짧으면 간단한 합계를 수행했고, 목록이 거대하면 자동으로 먼저 분할하기로 결정했습니다.
  • 기본 방식보다 우수함: 에이전트는 AI 에게 한 번에 "해라"라고 요청하는 것 (입력 - 출력 방식) 보다 복잡한 문제를 훨씬 더 신뢰성 있게 해결했습니다.
  • 일반화: 에이전트가 훈련 중에 단 한 번도 보지 못한 목록 크기 (예: 30 개까지의 목록만 연습했는데 60 개 목록을 줌) 를 주었을 때도 여전히 좋은 전략을 찾아냈습니다.

결론

이 논문은 고급 AI 문제 해결을 자동화하는 방법을 제시합니다. 복잡한 작업을 구조화하는 방법을 인간 전문가가 정확히 알아야 할 필요 대신, 시스템은 "학습 에이전트"를 사용하여 주어진 문제 크기에 맞는 최적의 단계별 계획 (그래프) 을 찾아냅니다. 이는 경직되고 수동적인 과정을 유연하고 자동 조정되는 것으로 바꿉니다.

참고: 이 논문은 이러한 특정 작업 (수학, 정렬, 카운팅, 병합) 에만 전적으로 초점을 맞추고 있으며, 이 방법이 정의된 논리 문제 외의 의료 진단, 법률 조언, 또는 기타 실제 응용 분야에 작동한다고 주장하지는 않습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →