← 최신 논문
💬 NLP

PROTEA: Offline Evaluation and Iterative Refinement for Multi-Agent LLM Workflows

PROTEA 는 그래프 기반 점수 매기기와 역방향 평가를 통해 병목 현상을 식별하는 다중 에이전트 LLM 워크플로우의 오프라인 테스트 주도 개선을 위한 통합 인터페이스로, 개발자가 시스템 성능을 획기적으로 향상시키기 위해 프롬프트 수정을 반복적으로 편집하고 검증할 수 있게 합니다.

원저자: Kazuki Kawamura, Satoshi Waki, Kei Tateno

게시일 2026-05-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Kazuki Kawamura, Satoshi Waki, Kei Tateno

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

연극의 감독이 되어 상상해 보세요. 배우는 모두 AI 로봇으로만 구성되어 있습니다. 각 로봇은 특정 업무를 담당합니다. 한 로봇은 대본을 읽고, 다른 로봇은 사실을 확인하며, 세 번째 로봇은 대사를 작성하고, 네 번째 로봇은 최종 공연을 선보입니다. 개발자들은 이를 **"멀티 에이전트 LLM 워크플로우"**라고 부릅니다.

보통 이러한 로봇 팀은 모든 일을 한 번에 하려고 애쓰는 단일 로봇보다 더 잘 작동합니다. 하지만 문제는 다음과 같습니다. 최종 공연이 부실하다면, 어떤 로봇이 실수했는지 파악하는 것은 악몽과 같습니다. 사실 확인자가 잘못된 정보를 얻었을까요? 작가가 어조를 오해했을까요? 아니면 최종 배우가 단순히 넘어졌을까요?

현재 개발자들은 전체 공연의 수 시간 분량의 영상 (즉, "트레이스") 을 시청하며 오류가 어디서 시작되었는지 추측해야 합니다. 이는 500 페이지 분량의 책에서 오타 하나를 찾기 위해 모든 단어를 다시 읽는 것과 같습니다.

PROTEA 가 등장합니다.

PROTEA 를 **스마트하고 상호작용 가능한 "마법 스포트라이트가 있는 리허설실"**로 생각하세요. 이는 개발자들이 영화를 반복해서 전체 시청할 필요 없이 이러한 로봇 팀을 디버깅하고 개선할 수 있도록 돕습니다.

간단한 비유를 들어 작동 방식을 설명해 보겠습니다.

1. 마법 스포트라이트 (노드 수준 진단)

전체 공연을 보는 대신, PROTEA 는 각 로봇의 작업장에 신호등을 설치합니다.

  • 🟢 초록색: 이 로봇은 업무를 완벽하게 수행했습니다.
  • 🟡 노란색: 이 로봇은 괜찮았지만, 다소 부주의했을 수 있습니다.
  • 🔴 빨간색: 이 로봇이 실수했습니다.

최종 답변이 틀렸을 때, PROTEA 는 단순히 "공연이 실패했다"고 말하지 않습니다. 대신 즉시 빨간색 로봇을 강조하며 "여기를 보세요! 이 로봇이 다음 로봇에게 잘못된 정보를 제공했습니다"라고 말합니다. 이는 개발자가 대본 전체를 검색하는 수고를 덜어줍니다.

2. "역공학" (후방향 추론)

때로는 개발자들이 최종 답변이 무엇이어야 하는지 (예: "공연은 행복한 웃음으로 끝나야 한다") 는 알지만, 중간 로봇들이 무엇을 말해야 하는지에 대한 구체적인 대본은 가지고 있지 않습니다.

PROTEA 는 후방향 추론이라는 트릭을 사용합니다. 도로 여행의 목적지는 알지만 중간에 어떤 회전로를 거쳐야 하는지는 모르는 상황을 상상해 보세요. PROTEA 는 "행복한 웃음"이라는 최종 목표에서 역으로 작업하며 다음과 같이 질문합니다. "최종 로봇이 웃으려면 작가 로봇이 무엇을 말해야 했을까요? 그리고 작가가 그렇게 말하려면 사실 확인자가 무엇을 제공해야 했을까요?"

이는 최종 목표를 기반으로 중간 단계에 대한 "유령 대본"을 생성합니다. 그런 다음, 로봇들이 실제로 말한 내용과 이 "유령 대본"을 비교하여 약점을 찾아냅니다.

3. "편집 버튼" (프롬프트 정제)

PROTEA 가 빨간색 로봇을 찾으면 단순히 가리키는 것에서 그치지 않고 제안된 수정안을 제공합니다.

  • 로봇의 현재 지시사항 (즉, "프롬프트") 을 보여줍니다.
  • 해당 지시사항의 새롭고 개선된 버전을 제안합니다.
  • 사진 편집 도구가 원본과 편집된 버전을 나란히 보여주는 것처럼 "수정 전 vs 수정 후" 비교를 보여줍니다.

개발자는 제안을 수용하거나, 수정하거나, 무시할 수 있습니다.

4. "즉시 리플레이" (자동 재실행)

가장 좋은 점은 무엇일까요? 개발자가 "저장"을 누르는 순간, PROTEA 는 새로운 지시사항으로 전체 공연을 즉시 재실행합니다. 그런 다음 점수 그래프를 보여줍니다. "보세요? 이전에는 점수가 64% 였지만, 수정 후에는 이제 84% 입니다!"

이것은 빠른 루프를 만듭니다: 문제 찾기 → 수정 제안 → 테스트 → 결과 확인. 변경 사항이 작동했는지 확인하기 위해 며칠을 기다릴 필요가 더 이상 없습니다.

그들은 실제로 무엇을 달성했을까요?

이 논문은 두 가지 실제 시나리오에서 이 시스템을 테스트했습니다 (구체적인 회사 이름은 비밀로 유지되었습니다):

  1. 문서 검사: 엄격한 규칙을 준수하는지 문서를 확인하는 시스템. PROTEA 는 정확도를 **64.3% 에서 83.9%**로 개선하는 데 도움을 주었습니다.
  2. 추천 시스템: 영화나 제품과 같은 항목을 제안하는 챗봇. PROTEA 는 올바른 추천이 상위 5 개 목록에 포함되는 빈도를 높여 점수를 0.30 에서 0.38로 개선하는 데 기여했습니다.

또한 6 명의 숙련된 AI 개발자 그룹을 대상으로 테스트했습니다. 이 개발자들은 이 시스템을 좋아했는데, 끝없는 로그를 응시하는 일을 멈추고 문제를 일으키는 특정 로봇을 수정하는 데 집중할 수 있게 해주었기 때문입니다.

결론

PROTEA 는 AI 로봇 팀을 디버깅하는 혼란스럽고 messy 한 작업을 깔끔하고 시각적인 과정으로 바꿔주는 도구입니다. 이는 하이라이트 릴을 가진 코치처럼 작동하여, 정확히 어떤 플레이어가 공을 놓쳤는지 보여주고 이를 수정할 플레이북을 제공하며, 모든 것을 한곳에서 처리합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →