← 최신 논문
🤖 AI

Automata from Agent Traces: Failure and Next-Step Prediction

본 논문은 LLM 에이전트의 실행 트레이스를 공유된 행동 토폴로지를 효과적으로 포착하는 압축된 모델 불가지론적 유한 상태 머신으로 붕괴시키는 방법을 제안하며, 이를 통해 안전 감사 및 런타임 모니터링을 위한 우수한 다음 단계 예측과 조기 실패 탐출을 가능하게 한다.

원저자: Seonglae Cho, Franklin Cardenoso Fernandez, Umar Mohammed, Zekun Wu, Kleyton Da Costa, Ilham Wicaksono, Adriano Koshiyama

게시일 2026-08-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Seonglae Cho, Franklin Cardenoso Fernandez, Umar Mohammed, Zekun Wu, Kleyton Da Costa, Ilham Wicaksono, Adriano Koshiyama

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능 에이전트가 단순히 질문에 답하는 챗봇을 넘어, 스스로 복잡한 문제를 해결할 수 있는 자율적인 작업자로 진화하는 세상을 상상해 보십시오. 이 디지털 직원들은 웹을 탐색하고, 컴퓨터 코드를 작성 및 디버깅하며, 고객 서비스 문의를 관리하고, 심지어 데스크톱 소프트웨어를 제어할 수도 있습니다. 이들은 하나의 큰 목표를 일련의 작은 단계들로 나누고, 각 단계를 숙고하며 행동함으로써 작동합니다. 그러나 이러한 에이전트가 더 유능해짐에 따라, 이들을 이해하기는 더욱 어려워지고 있습니다. 이들의 내부 의사결정 과정은 종종 블랙박스와 같으며, 실패했을 때 이들이 루프에 빠진 것인지, 단순한 실수를 한 것인지, 아니면 아무런 결실 없는 혼란스러운 경로로 방황하고 있는 것인지 구별하기 어렵습니다. 이러한 시스템을 배포하는 기업과 연구자들에게 이러한 불투명성은 중대한 안전 위험 요소입니다. 에이전트가 어떻게 행동하는지에 대한 명확한 지도가 없다면, 에이전트가 피해를 입히기 전에 오류를 잡아내거나 실패할 시점을 예측하는 것은 거의 불가능합니다.

한 연구팀은 이러한 자율 에이전트의 행동을 매핑하여, 무질서하고 구조화되지 않은 행동을 명확하고 압축된 청사진으로 변환하는 새로운 방법을 개발했습니다. 연구진은 에이전트의 두뇌 내부의 복잡한 추론을 이해하려고 노력하는 대신, 에이전트가 남기는 외부적인 행동의 흔적에 집중했습니다. 이들은 수천 개의 이러한 행동 궤적을 하나의 데이터셋으로 취급하고, 다음과 같은 간단한 질문을 던졌습니다: "에이전트가 한 단계에서 다음 단계로 어떻게 이동하는지를 설명할 수 있는 숨겨진 구조를 찾을 수 있는가?" 정보 검색, 파일 편집, 사용자 대화와 같은 행동의 시퀀스를 분석함으로써, 연구진은 에이전트의 선택이 겉보기에는 무작위적임에도 불구하고, 그 행동이 놀라울 정도로 견고하고 예측 가능한 패턴을 따른다는 사실을 발견했습니다. 연구진은 유한 상태 기계(finite-state machine)를 구축했는데, 이는 에이전트가 취할 수 있는 모든 경로를 포착하는 플로우차트와 같습니다. 이 플로우차트는 추측이 아니라, 실제 데이터로부터 추출된 에이전트의 실제 행동을 수학적으로 재구성한 것입니다.

가장 놀라운 발견은 이 플로우차트가 얼마나 작고 효율적인가 하는 점입니다. 에이전트가 수천 가지의 서로 다른 작업을 수행하더라도, 연구진은 그 행동이 단 몇 개의 상태(7개에서 43개의 뚜렷한 단계)로 압축될 수 있다는 것을 발견했습니다. 이는 복잡성을 대폭 줄인 것입니다. 이를 설명하기 위해, 거대한 도시의 전체 레이아웃을 모든 거리와 건물 목록을 나열하여 설명하려고 노력하는 상황을 상상해 보십시오. 연구진은 대신 몇 개의 주요 교차로와 자동차가 그 사이를 이동하는 규칙만을 사용하여 도시의 교통 흐름을 설명하는 방법을 찾아냈습니다. 테스트 결과, 이 압축된 지도들은 0.997의 AUC로 에이전트의 과거 행동을 재현할 수 있었습니다. 이 높은 정확도는 에이전트의 작업 구조가 이를 구동하는 특정 언어 모델보다는, 에이전트가 사용할 수 있는 도구와 부여받은 과업에 의해 결정된다는 점을 시사합니다.

이 구조적 지도는 과거를 기술하는 데 그치지 않고, 미래를 예측하는 강력한 도구 역할을 합니다. 지도가 에이전트 작업의 논리적 흐름을 포착하기 때문에, 에이전트가 경로를 벗어나고 있는지를 감지하는 데 사용될 수 있습니다. 연구진은 에이전트가 이 지도를 통해 움직이는 모습을 관찰함으로써, 과업이 완료되기도 훨씬 전에 성공 또는 실패 여부를 예측할 수 있음을 보여주었습니다. 어떤 경우에는 에이전트가 작업의 4분의 1 지점에 도달했을 때 실패할 실행을 식별하여 조기 개입을 가능하게 했습니다. 이는 종종 끝까지 기다린 후에야 성공이나 실패를 판단하던 기존 방식보다 크게 개선된 것입니다. 또한 이 지도는 기존의 다른 기술들보다 에이전트가 다음에 취할 단계를 더 잘 예측하였으며, 현재 워크플로 상의 위치를 바탕으로 에이전트가 다음에 무엇을 할 가능성이 높은지에 대한 더 명확한 그림을 제공했습니다.

연구진은 코딩, 웹 탐색, 고객 서비스, 데스크톱 관리에 이르기까지 광범위한 활동을 다루는 12개의 서로 다른 데이터셋을 대상으로 이 방법을 테스트했습니다. 모든 경우에서 이 방법은 작고 신뢰할 수 있는 지도를 생성했으며, 다른 접근 방식들보다 뛰어난 성능을 보였습니다. 수천 개의 불필요한 상태를 가진 지나치게 복잡한 모델을 만들거나, 혹은 너무 단순하여 쓸모없는 모델을 만드는 기존 기술들과 달리, 이 접근 방식은 최적의 지점을 찾아냈습니다. 이 방식은 빠르고 분석하기 쉬울 만큼 작으면서도, 에이전트의 행동적 뉘앙스를 포착할 수 있을 만큼 상세한 모델을 만들어냈습니다. 이 지도들의 구축은 밀리초 단위로 매우 빠르게 이루어졌으며, 이는 에이전트가 작업하는 동안 실시간으로 모니터링하는 데 사용될 수 있음을 의미합니다.

이 연구의 함의는 단순히 에이전트를 더 안전하게 만드는 것을 넘어섭니다. 이러한 복잡한 시스템의 행동이 단순한 기저 구조에 의해 지배된다는 것을 밝혀냄으로써, 연구진은 인공지능을 감사하고 이해하는 새로운 방법을 제시했습니다. 이 구조는 사용되는 특정 유형의 AI 모델에 의존하지 않으며, 서로 다른 모델과 서로 다른 유형의 과업 전반에 걸쳐 유효합니다. 이는 환경의 제약과 에이전트가 사용할 수 있는 도구가 AI 자체의 내부 로직보다는 에이전트의 행동을 결정하는 주요 동인임을 시사합니다. 개발자와 안전 감사관들에게 있어, 이는 에이전트를 모니터링하고, 실패를 조기에 감지하며, 이러한 자율 시스템이 안전하고 예측 가능한 경계 내에서 작동하도록 보장하기 위한 실용적이고 모델 불가지론적인(model-agnostic) 방법을 제공합니다. 이 연구는 현대 AI 에이전트의 가장 복잡하고 무질서해 보이는 행동조차도 명확하고 이해 가능하며 관리 가능한 일련의 규칙으로 환원될 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →