← 최신 논문
🤖 AI

AgentTrails: Towards Trust and Reuse for Agentic Tasks

AgentTrails는 LLM 기반 에이전트의 가공되지 않은 연대기적 로그를 구조화된 프로비넌스 그래프로 변환하여, 숨겨진 데이터 의존성을 드러내고 실행 비교를 가능하게 하며 패턴 추출 및 기술 추상화를 지원함으로써 신뢰와 재사용성을 높이는 프로토타입 시스템입니다.

원저자: Eden Wu, Sonia Castelo, Yurong Liu, Cláudio T. Silva, Juliana Freire

게시일 2026-07-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Eden Wu, Sonia Castelo, Yurong Liu, Cláudio T. Silva, Juliana Freire

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 한 명의 천재적이지만 약간은 혼란스러운 셰프가 복잡한 요리를 만드는 과정을 지켜보고 있다고 상상해 보세요. 당신은 셰프가 재료를 집고, 다지고, 젓고, 접시에 담는 모습을 볼 수 있지만, 당신이 가진 영상은 셰프의 손이 왼쪽에서 오른쪽으로 움직이는 모습뿐입니다. 당신은 무엇이 일어났는지는 알지만, 왜 셰프가 후추를 집은 뒤에 소금을 집었는지, 혹은 3단계에서 만든 소스가 최종 요리에 실제로 사용되었는지, 아니면 그냥 아무도 먹지 않을 수프 한 솥을 통째로 더 만든 것인지는 알 수 없습니다. 인공지능의 세계에서 이러한 '셰프'들은 **LLM 기반 에이전트(LLM-powered agents)**라고 불립니다. 이들은 웹 검색, 코드 실행, 파일 읽기 등 인간이 하는 것처럼 도구들을 사용하여 어려운 문제를 해결하는 컴퓨터 프로그램입니다.

이러로 에이전트들이 작동할 때, 이들은 자신이 한 모든 일을 시작부터 끝까지 순서대로 기록한 길고 어지러운 목록을 남깁니다. 이것을 **궤적(trajectory)**이라고 합니다. 이것은 마치 "먼저 이것을 했고, 그다음 저것을 했고, 그다음 다시 이것을 했다"라고 적힌 일기장과 같습니다. 문제는 이 일기가 사건의 순서는 알려주지만, 하나의 행동이 다음 행동에 어떻게 연결되는지에 대한 '보이지 않는 실타래'는 숨기고 있다는 점입니다. 어떤 단계가 이전 단계에 의존했는지, 혹은 에이전트가 혼란에 빠져 잘못된 길로 들어섰는지 파악하기가 매우 어렵습니다. 이러한 연결 고리를 보지 못한다면, 실수를 바로잡거나, 좋은 사례로부터 배우거나, 에이전트가 실제로 업무를 제대로 수행했는지 신뢰하는 것이 거의 불가능합니다.

여기서 AgentTrails라는 새로운 프로젝트가 등장합니다. 이 연구를 진행한 뉴욕 대학교(NYU) 팀은 단순히 연대기적인 일기를 읽는 것만으로는 충분하지 않다는 것을 깨달았습니다. 그들은 그 어지러운 목록을 명확하고 시각적인 지도로 바꾸고 싶었습니다. 그들의 목표는 에이전트의 가공되지 않은 지루한 로그를 보고, 숨겨진 의존성의 '가계도'를 자동으로 재구성하는 시스템을 구축하는 것이었습니다. 그들은 어떤 도구 호출이 특정 파일을 생성했는지, 그 파일이 다음 단계의 재료로서 어떻게 사용되었는지, 그리고 에이전트가 어디에서 경로를 이탈했는지를 정확히 보여주고 싶었습니다.

이 논문은 탐정 역할을 하는 프로토타입 시스템인 AgentTrails를 제시합니다. AgentTrails는 단순히 사건의 목록을 보여주는 대신, 가공되지 않은 텍스트 로그를 가져와 **프로비넌스 그래프(provenance graph)**로 변환합니다. 마치 혼란스러운 주방 영상을 모든 재료가 노드(node)가 되고 모든 요리 단계가 이들을 연결하는 화살표가 되는 순서도로 바꾸는 것과 같습니다. 이를 통해 보이지 않는 의존성을 가시화합니다. 이 시스템은 단순히 추측하는 것이 아니라, 한 단계에서 나타나 이후 단계에서 참조되는 파일 이름, ID 또는 특정 값과 같은 단서들을 텍스트 속에서 찾아내어 단계들 사이에 선을 긋습니다.

하지만 마법은 단 하나의 에이전트에서 멈추지 않습니다. 연구진은 또한 서로 다른 에이전트를 비교하거나, 동일한 에이전트가 동일한 작업을 여러 번 수행하는 문제를 다루었습니다. AI는 인간과 비슷해서, 똑같은 퍼즐을 풀더라도 약간 다른 순서로 풀거나 한 번은 우회하고 다음번에는 지름길을 택할 수도 있습니다. AgentTrails는 이러한 여러 개의 '지도'를 가져와서 **결합 몫 그래프(joined quotient graph)**로 엮어낼 수 있습니다. 이것은 마치 산을 오르는 여러 명의 등산객이 지나간 서로 다른 경로들을 하나로 겹쳐 놓는 것과 같습니다. 시스템은 모든 사람이 사용한 주요 경로(공통된 성공적인 워크플로우)를 강조하고, 일부 등산객이 길을 잃거나 불필요한 우회로를 택했던 작은 옆길들을 보여줍니다. 이는 개발자들이 로그를 하나씩 따로 볼 때는 숨겨져 있던 '모범 사례'와 '나쁜 습관'을 찾아내는 데 도움을 줍니다.

연구팀은 실제 사례를 통해 이 시스템을 테스트했습니다. 한 시나리오에서 그들은 수소 원자에 관한 물리학 문제를 해결하려는 에이전트를 관찰했습니다. 가공되지 않은 로그는 그저 숫자와 도구 호출의 긴 문자열이었지만, AgentTrails는 명확한 패턴을 드러냈습니다. 에이전트는 몇 가지 독립적인 상수들을 계산하고, 그것들을 결합하여 특정 값을 구한 뒤, 그 값을 사용하여 최종 답을 계산했다는 것입니다. 또 다른 테스트에서는 유전자 데이터를 탐색하는 에이전트를 분석했습니다. '고득점'(성공적인) 실행과 '저득점'(실패한) 실행을 비교했을 때, 결합된 그래프는 성공적인 에이전트는 직접적인 경로를 따랐던 반면, 실패한 에이전트는 도움이 되지 않는 추가적인 도구 호출을 하며 불필요한 옆길을 계속 돌았음을 보여주었습니다.

이 논문은 이러한 접근 방식이 AI 에이전트를 더 신뢰할 수 있고 디버깅하기 쉽게 만드는 유망한 단계임을 시사합니다. 그러나 저자들은 이것이 여전히 예비적인 연구 단계임을 주의 깊게 언급했습니다. 그들은 아직 시스템이 모든 연결 고리를 찾는 데 완벽하다는 것을 증명하지 못했으며, 수천 개의 복잡한 작업을 동시에 처리할 수 있도록 규모를 확장하는 방법도 여전히 연구 중입니다. 그들은 시스템이 작동함을 보여주기 위해 소수의 사례를 직접 수동으로 주석을 달아 검증했지만, 이러한 지도를 대규모로 자동 검증하는 방법에 대한 큰 질문은 여전히 남아 있습니다.

궁극적으로 AgentTrails는 AI를 바라보는 새로운 방식을 제공합니다. 에이전트를 단순히 답을 내뱉는 '블랙박스'로 취급하는 대신, 그 상자를 열어 내부의 기어가 어떻게 돌아가는지 보여주려 합니다. 단순한 타임라인을 풍부하고 상호 연결된 지도로 바꿈으로써, 이 시스템은 개발자들에게 디지털 에이전트가 어떻게 생각하고 작동하는지 이해하고, 비교하고, 개선할 수 있는 도구를 제공합니다. 이는 단순히 쇼를 관람하는 것에서 벗어나, 무대 뒤의 대본을 이해하는 단계로 나아가는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →