← 최신 논문
🤖 AI

AgentForesight: Online Auditing for Early Failure Prediction in Multi-Agent Systems

본 논문은 LLM 기반 다중 에이전트 시스템에서 결정적인 오류를 실시간으로 예측하고 국소화하기 위해 새로이 큐레이션된 AFTraj-2K 데이터셋으로 훈련된 경량 온라인 감시자를 갖춘 AgentForesight 프레임워크를 소개하며, 이를 통해 사후 실패 귀인에 의존하는 대신 배포 시 개입을 가능하게 합니다.

원저자: Boxuan Zhang, Jianing Zhu, Zeru Shi, Dongfang Liu, Ruixiang Tang

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Boxuan Zhang, Jianing Zhu, Zeru Shi, Dongfang Liu, Ruixiang Tang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇 팀이 복잡한 가구를 함께 제작하는 모습을 상상해 보세요. 그들은 계획을 가지고 있습니다: 한 로봇은 나무를 자르고, 다른 로봇은 사포질을 하며, 세 번째 로봇은 페인트를 칠합니다.

과거에는 최종 테이블이 흔들리거나 잘못된 색으로 칠해진 경우, 전문가들은 마지막까지 기다려 완성된 망가진 상태를 살펴본 후 "아, 문제의 시작은 사포질 로봇이 잘못된 입자 수의 사포를 사용했을 때였습니다"라고 말했습니다. 이를 **사후 실패 귀속 (Post-Hoc Failure Attribution)**이라고 합니다. 이는 집이 이미 타버린 후에 범인을 찾는 형사와 같습니다. 누가 범인인지는 알지만, 불을 막을 수는 없습니다.

AgentForesight는 게임의 규칙을 바꿉니다. 재앙이 일어나기를 기다리는 대신, 로봇들 바로 옆에 서서 그들이 하는 모든 움직임을 실시간으로 지켜보는 초경계 안전 검사관을 상상해 보세요.

핵심 아이디어: "중지 또는 진행" 검사관

이 검사관 (감사관, Auditor) 은 미래를 알지 못합니다. 그들은 오직 지금까지 일어난 일만 봅니다. 매 순간마다 검사관은 순간적인 결정을 내려야 합니다:

  1. 계속 진행 (CONTINUE): "지금까지 모든 것이 안전해 보입니다. 로봇들이 작업을 계속하게 하세요."
  2. 경보 (ALARM): "멈추세요! 지금 치명적인 실수가 발생했습니다. 계속하게 내버려 두면 전체 프로젝트가 실패할 것입니다."

목표는 다른 로봇들이 그 나쁜 신호를 맹목적으로 따라가 전체 프로젝트를 망치기 전에, 기차가 탈선하는 결정적인 실수—그 특정 순간—를 포착하는 것입니다.

문제: 왜 이것이 과거에는 어려웠을까요?

지금까지 우리는 이러한 검사관들을 훈련시킬 좋은 데이터가 부족했습니다.

  • "안전한" 문제: 기존 데이터의 대부분은 실패한 프로젝트만 보여주었습니다. 단계별로 아무런 문제도 없었던 완벽한 프로젝트에 대한 예시가 충분하지 않았습니다. 실패 사례만으로 훈련된 검사관은 모든 작은 방해를 재앙으로 간주하여 모든 프로젝트를 중단시키는 공황 상태에 빠질 수 있습니다.
  • "타이밍" 문제: 기존 모델들은 완성된 실패를 보고 "4 단계에서 문제가 발생했습니다"라고 말하는 데는 뛰어났습니다. 하지만 4 단계가 진행되는 동안 그것을 보고 "지금 바로 멈추세요!"라고 말하는 데는 매우 서툴렀습니다.

해결책: AgentForesight

연구자들은 세 가지 주요 부분으로 구성된 새로운 시스템을 구축했습니다:

1. 훈련 매뉴얼 (AFTRAJ-2K)

그들은 AFTRAJ-2K라는 거대한 로봇 작업 로그 라이브러리를 만들었습니다.

  • 안전한 로그: 그들은 수천 개의 성공적인 로봇 작업을 신중하게 필터링하여 시작부터 끝까지 진정한 완벽함을 보장했습니다. 이는 검사관에게 '안전한' 모습이 무엇인지 가르칩니다.
  • 고장 난 로그: 그들은 안전한 작업들을 특정 단계에서 고의적으로 망가뜨렸습니다 (예: 로봇에게 잘못된 도구를 사용하도록 지시). 그런 다음 AI 판정 패널을 통해 정확히 어떤 단계가 실패를 초래했는지 합의했습니다. 이는 검사관에게 경보를 울려야 하는 정확한 시기를 가르칩니다.

2. 훈련 방법 (거칠게부터 정밀하게, Coarse-to-Fine)

그들은 검사관을 깊은 물에 바로 던지지 않았습니다. 무술 학생처럼 두 단계로 훈련시켰습니다:

  • 1 단계: "직감" (위험 예측): 먼저 검사관에게 '안전한' 순간과 '위험한' 순간의 차이를 느끼게 했습니다. "이것은 안전해 보입니다" 대 "이것은 위험해 보입니다"와 같은 단계 쌍을 보여주었습니다. 검사관은 일이 잘못되는 경계를 감지하는 법을 배웠습니다.
  • 2 단계: "스나이퍼의 명중" (정밀도): 검사관이 좋은 '직감'을 갖게 되자, 그들의 기술을 연마했습니다. 검사관에게 정확한 단계와 정확한 책임 로봇을 지목하는 법을 가르쳤습니다. 검사관이 다음 세 가지를 정확히 했을 때 보상하는 시스템을 사용했습니다:
    • 무엇 (What): 올바른 답변 형식을 제공했는가?
    • 어디 (Where): 정확한 단계에서 실수를 포착했는가?
    • 누가 (Who): 올바른 로봇을 비난했는가?

3. 결과 (AgentForesight-7B)

결과는 다른 AI 시스템들과 함께 작동하는 소형이고 빠른 AI 감사관 (AgentForesight-7B) 입니다.

  • 더 빠르고 똑똑함: 테스트에서 이 시스템은 거대하고 비싼 AI 모델 (GPT-4.1 또는 DeepSeek-V4-Pro 등) 보다 훨씬 더 잘 실수를 포착했습니다.
  • 정밀함: 단순히 "무언가 잘못되었습니다"라고 말하는 것이 아니라, "멈추세요! 관리자 로봇이 3 단계에서 실수를 했습니다"라고 말했습니다.
  • 실용적: 표준 하드웨어에서 실행할 수 있을 만큼 작아, 모든 것을 지연시키지 않고 실제 응용 분야에서 실제로 사용될 수 있습니다.

이것이 중요한 이유

이를 AI 팀을 위한 맞춤 검사기라고 생각하세요.

  • 옛 방식: 전체 에세이를 작성하여 제출한 후, 맞춤법 검사기가 "1 페이지에 맞춤법 오류가 있습니다"라고 말합니다. 에세이는 이미 발송된 상태입니다.
  • AgentForesight 방식: 당신이 타이핑하는 동안, 맞춤법 검사기는 당신이 실수를 하는 순간에 오류를 강조합니다. 문장을 마치기도 전에 말입니다. 이는 결함이 있는 제품을 발송하는 것을 막아줍니다.

이 논문은 이 시스템이 AI 가 작업하는 동안 우리가 개입할 수 있게 하여, 코딩, 수학, 웹 탐색 작업에서 작은 실수가 크고 되돌릴 수 없는 실패로 변하는 것을 방지한다고 주장합니다. 이는 실패 분석을 "사후 분석 (부검)"에서 "생생한 수술 (환자 구하기)"로 전환시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →