← 최신 논문
🤖 AI

A Control System, a Dataset, and a Recipe for Making Frozen LLM Agents Learn a Domain

이 논문은 온라인 강화 학습과 다중 목적 보상을 사용하여 고정된 인간 가독형 LLM 에이전트 하네스를 최적화하는 샘플 효율적이고 감사 가능한 제어 시스템을 제안하며, 다양한 작업 도메인과 모델 제공업체에 걸친 효과를 입증하는 동시에 더 넓은 적용을 위한 코드, 데이터셋 및 배포 레시피를 공개한다.

원저자: Debjyoti Paul

게시일 2026-07-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Debjyoti Paul

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

AI 셰프와 마법의 요리책

당신에게 거의 무엇이든 요리할 수 있는 아주 똑똑하고 명석한 셰프가 있다고 상상해 보세요. 이 셰프는 인공지능, 구체적으로는 거대 언어 모델(LLM)입니다. 하지만 여기 한 가지 함정이 있습니다. 이 셰프는 그냥 주방으로 걸어 들어와 요리를 시작하는 것이 아닙니다. 그들에게는 레시피, 도구 세트, 그리고 계획이 필요합니다. AI의 세계에서 이 설정을 "하네스(harness)"라고 부릅니다. 이것은 AI에게 어떻게 생각해야 하는지, 어떤 도구(계산기나 검색 엔진 같은)를 사용해야 하는지, 그리고 최종 요리를 내놓기 전에 어떻게 자신의 작업을 검토해야 하는지를 알려주는 설명서입니다.

오랫동안 과학자들은 셰프를 더 낫게 만드는 유일한 방법은 셰프를 직접 훈련시키는 것, 즉 기초부터 새로운 기술을 가르치는 것이라고 생각했습니다. 하지만 더 새로운 아이디어는 어쩌면 셰프는 이미 훌륭하며, 우리는 단지 레시피를 약간 수정하기만 하면 될지도 모른다는 점을 시사합니다. 연구자들이 던지는 핵심 질문은 이것입니다. 요리하는 동안 AI가 스스로의 레시피를 다시 쓰도록 허용할 것인가(위험하고 비용이 많이 드는 선택), 아니면 레시피를 정해진 메뉴 옵션으로 취급하고 적절한 작업을 위해 최선의 것을 고르는 스마트하고 단순한 시스템을 사용할 것인가? 이 논문은 이 질문을 파고들며, "동결된(frozen)" AI(뇌를 바꾸지 않는 AI)가 단순히 지시를 전달하는 방식을 바꿈으로써 어떻게 강력해질 수 있는지 테스트합니다.


실험: "레시피 스위치보드"로 AI 길들이기

이 논문의 저자들은 매우 신중하고 통제된 접근 방식을 취하기로 했습니다. AI가 자신의 코드를 마음대로 다시 쓰도록 내버려 두는 대신(그들은 이것이 학생이 시험을 치르는 동안 시험 문제를 직접 다시 쓰게 하는 것과 같다고 주장합니다), 그들은 "제어 시스템(Control System)"을 구축했습니다. 이 시스템을 정확히 729개의 서로 다른 설정이 있는 거대하고 마법 같은 스위치보드라고 생각해 보세요. 각 설정은 다음과 같은 구체적인 지시 조합입니다:

  • 프롬프트 스타일(Prompt Style): AI가 직접적이어야 하는가, 구조적이어야 하는가, 아니면 성찰적이어야 하는가?
  • 도구 정책(Tool Policy): 도구를 필요할 때만 사용할 것인가, 아니면 항상 사용할 것인가?
  • 메모리(Memory): 과거의 성공을 기억할 것인가, 아니면 성공과 실패 모두를 기억할 것인가?
  • 계획(Planning): 바로 뛰어들 것인가, 짧은 계획을 세울 것인가, 아니면 계획을 세우고 수정할 것인가?
  • 검증(Verification): 마지막에 작업을 재확인할 것인가, 아니면 단계별로 확인할 것인가?
  • 단계 예산(Step Budget): 멈추기 전까지 몇 단계를 거쳐야 하는가?

연구자들은 강화 학습(Reinforcement Learning)이라 불리는 스마트한 학습 시스템을 사용하여 실시간으로 이 스위치들을 조작해 모든 작업에 완벽한 레시피를 찾아낼 수 있는지 확인하고 싶었습니다. 그들은 이를 세 가지 다른 "주방"에서 테스트했습니다:

  1. 도구 사용(Tool-Use): AI가 가상의 고객 데이터베이스(CRM과 같은)를 관리하게 함.
  2. 코딩(Coding): 특정 테스트를 통과하는 코드를 작성하도록 AI에게 요청함 (HumanEval 벤치마크 사용).
  3. 정보 검색(Retrieval): 문서 더미를 검색하여 까다로운 질문에 답하도록 AI에게 요청함 (HotpotQA 사용).

그들은 이 실험을 두 가지 다른 "셰프"를 대상으로 진행했습니다: 로컬 오픈 소스 모델(Ollama)과 강력한 클라우드 모델(AWS Bedrock). 그들은 이 스마트한 학습형 스위치보드를 무작위 추측기(설정을 무작위로 선택함) 및 "정적 베이스라인(Static Baseline)"(DSPy라는 도구로 만들어진, 한 번 최적화된 후 그대로 두는 단일 사전 제작 레시피)과 비교했습니다.

거대한 반전: "정적" 레시피의 승리

여기 저자들이 예상하지 못했던 반전이 있습니다: 스마트한 학습형 스치보드가 승리하지 못했습니다.

거의 모든 테스트에서, 단 한 번 정성스럽게 만들어진 후 그대로 유지된 "정적 베이스라인"이 끊임없이 배우고 적응하려고 노력하는 시스템과 비슷하거나 오히려 더 나은 성능을 보였습니다.

  • 도구 사용 영역에서, Bedrock 모델의 경우 정적 레시피가 96%의 작업을 성공시킨 반면, 학습 시스템은 약 62%의 작업만을 성공시켰습니다.
  • 코딩 영역에서, 정적 레시피는 학습 시스템만큼 우수했을 뿐만 아니라, 훨씬 적은 "토큰"(AI가 먹는 디지털 재료)을 사용하여 훨씬 저렴하고 빨랐습니다.
  • 정보 검색 영역에서도, 모두에게 어려웠던 분야임에도 불구하고 정적 레시피는 제 몫을 다했습니다.

저자들은 왜 이런 일이 일어났는지 깨달았습니다. "학습" 시스템은 729가지 가능성 중에서 최적의 설정을 찾으려 했지만, 지도를 배울 시간이나 시도가 부족했습니다. 그것은 마치 단 25번의 시도로 거대한 미로 속에서 최적의 경로를 찾는 것과 같습니다. 당신은 아마 막다른 길에 갇힐 가능성이 높습니다. 반면, 정적 레시피는 처음부터 타당하고 고품질인 옵션만을 살펴보는 방식을 사용하여 나쁜 경로를 탐색하는 데 시간을 낭비하지 않았습니다.

이것이 미래에 의미하는 바

논문은 대부분의 실질적인 현실 세계 상황에서는 모든 것을 처음부터 알아내려고 시도하는 복잡한 자가 학습 시스템으로 시작해서는 안 된다고 결론짓습니다. 대신 다음과 같이 해야 합니다:

  1. 강력한 정적 레시피(DSPy와 같은 방식으로 만들어진 것)로 시작하십시오.
  2. 학습 시스템은 나중에 추가하십시오. 오직 기존 레시피가 더 이상 작동하지 않을 정도로 작업이 크게 변했을 때만 추가하십시오.

저자들은 또한 이러한 시스템을 구축하고자 하는 다른 팀들을 위해 "레시피"(RECIPE.md라는 가이드)를 공유했습니다. 그들은 만약 학습 시스템을 사용한다면, "콜드 스타트"(시스템이 처음에 실수로 잘못된 설정을 선택하는 현상)를 주의해야 하며, 한 번의 잘못된 시도가 전체 배치(batch)를 망칠 수 있는 충돌을 경계해야 한다고 강조합니다.

요약하자면, 이 논문은 AI가 끊임없이 자신의 지침을 다시 쓰는 아이디어가 멋지고 미래지향적으로 들릴 수는 있지만, 현실 세계에서는 잘 작성된 고정된 지침서가 작동하는 방식을 파악하느라 애쓰고 있는 시스템보다 더 효과적이고, 빠르며, 저렴하다는 것을 시사합니다. "학습" 부분은 유용하지만, 이미 좋은 시작점을 찾은 후에야 비로소 의미가 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →