← 최신 논문
🤖 machine learning

ATLAS: Discovering Agent Strategies through LLM-Guided Abstraction and Automata Learning

이 논문은 트레이스 추상화(trace abstraction)와 오토마타 학습(automata learning)을 결적으로 결합하여 불투명한 LLM 기반 에이전트 궤적을 해석 가능한 유한 상태 모델로 변환함으로써, 사이버 보안과 같은 복잡한 작업에서 에이전트 전략의 체계적인 분석, 설명 가능성 및 지식 전이를 가능하게 하는 새로운 프레임워크인 ATLAS를 소개한다.

원저자: Ignacio D. Lopez-Miguel, Andreas Happe, Jürgen Cito, Ezio Bartocci, Bettina Könighofer, Martin Tappler

게시일 2026-08-17
📖 5 분 읽기🧠 심층 분석

원저자: Ignacio D. Lopez-Miguel, Andreas Happe, Jürgen Cito, Ezio Bartocci, Bettina Könighofer, Martin Tappler

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 천재적이지만 신비로운 탐정이 범죄를 해결하는 모습을 지켜보고 있다고 상상해 보십시오. 당신은 탐정이 방 안으로 걸어 들어가고, 단서를 줍고, 용의자들과 대화하는 모습은 볼 수 있지만, 그들의 내면적인 독백은 들을 수 없습니다. 당신은 '행동'을 보지만, 그들의 '전략'은 알지 못합니다. 인공지능의 세계에서 이러한 탐정들을 "AI 에이전트"라고 부릅니다. 이들은 거대 언어 모델(매우 똑똑한 텍스트 예측 엔진이라고 생각하면 됩니다)에 의해 구동되는 컴퓨터 프로그램으로, 웹 탐색, 코드 작성, 심지어 컴퓨터 보안 테스트와 같은 복잡하고 다단계적인 문제를 해결할 수 있습니다. 하지만 여기에는 함정이 있습니다. 이 에이전트들이 문제를 해결하는 능력은 점점 좋아지고 있지만, 동시에 이해하기는 점점 더 어려워지고 있다는 점입니다. 우리는 최종 결과물이나 그들이 입력한 모든 명령어가 담긴 길고 무질서한 목록은 볼 수 있지만, 그들이 그곳에 도달하기 위해 어떻게 결정했는지에 대한 "지도"는 쉽게 볼 수 없습니다. 이는 마치 체스 그랜드마스터의 천재성을 이해하기 위해, 그들이 어떤 수를 두었는지 보지 못한 채 최종적인 체스판의 사진만 보고 있는 것과 같습니다.

ATLAS라는 제목의 이 논문은 이 AI 에이전트들이 실제로 어떻게 생각하고 행동하는지를 파악하는 문제를 다룹니다. 저자들은 이 복잡하고 혼란스러운 명령어 목록을 명확하고 단순한 지도, 즉 에이전트의 전략을 보여주는 "행동 모델(behavioral model)"로 바꾸고자 합니다. 이를 위해 그들은 두 가지 주요 기술을 사용합니다. 첫째, 강력한 AI(거대 언어 모델)를 번역가처럼 사용하여 복잡하고 구체적인 컴퓨터 명령어를 단순하고 수준 높은 카테고리로 변환합니다(예를 들어, "sudo -l"을 "특수 권한 확인 중"으로 바꾸는 것). 둘째, "오토마타 학습(automata learning)"이라는 수학적 기법을 사용하는데, 이는 모든 번역된 행동들을 살펴보고 게임의 규칙을 찾아내는 패턴 인식 기계와 같습니다. 목표는 에이전트가 무엇을 했는지뿐만 아니라 '왜' 그것을 했는지를 설명하며, 루프(반복), 막다른 길, 그리고 성공적인 경로를 보여주는 압축적이고 읽기 쉬운 다이어그램을 만드는 것입니다.

탐정의 비밀 지도

그렇다면 어떻게 혼란스러운 디지털 발자국 더미를 깨끗하고 이해 가능한 지도로 바꿀 수 있을까요? 이 논문의 저자들은 ATLAS(Automata Learning for Agent Trajectory Analysis and Strategy Discovery)라고 불리는 시스템을 구축했습니다. ATLAS를 단순히 AI 에이전트가 하는 일을 기록하는 것을 넘어, 그 행동을 즉각적으로 동화책 형식으로 번역하고 의사결정 과정의 순서도를 그려주는 마법의 카메라라고 생각해 보십시오.

이를 테스트하기 위해 연구진은 침투 테스트(penetration testing)—AI가 컴퓨터 시스템의 보안 취약점을 찾는 윤리적 해킹을 의미함—를 위해 설계된 AI 에이전트를 사용했습니다. 그들은 12개의 서로 다른 "취약한" 머신(디지털 연습 대상)이 있는 시나리오를 설정하고 AI 에이전트가 그곳에 침입하도록 했습니다.

1단계: 가공되지 않은 혼돈
AI 에이전트가 작업할 때, "궤적(trajectory)"을 생성합니다. 이것은 단지 그가 수행한 모든 것의 길고 가공되지 않은 로그일 뿐입니다. 다음과 같이 보일 수 있습니다:

  • 에이전트 입력: exec_command id
  • 컴퓨터 응답: uid=1000(lowpriv)...
  • 에이전트 입력: exec_command sudo -l
  • 컴퓨터 응답: (ALL) NOPASSWD:ALL...

인간에게 이것은 다소 건조합니다. 패턴을 찾으려는 컴퓨터에게 이것은 악몽입니다. 큰 그림을 보는 데 방해가 되는 너무 많은 구체적인 세부 사항(예: 정확한 사용자 ID나 긴 에러 메시지)이 존재하기 때문입니다. 이는 영화의 줄거리를 보는 대신 모든 프레임의 픽셀 데이터를 읽으며 영화를 이해하려는 것과 같습니다.

2단계: 마법의 번역기 (추상화)
이 부분이 ATLAS의 첫 번째 강점이 빛나는 지점입니다. 연구진은 강력한 AI("파운데이션 모델")를 번역가로 사용했습니다. 그들은 이 AI에 지저도한 로그를 입력하고, 유사한 행동들을 단순한 카테고리로 그룹화하도록 요청했습니다.

  • exec_command id 대신, AI는 **"사용자 탐색(Discovery User)"**이라고 말합니다.
  • 비밀번호가 없는 루트 권한을 드러내는 sudo -l 대신, AI는 **"착취 가능한 Sudo(Exploitable Sudo)"**라고 말합니다.

갑자기, 지저분한 로그는 깔끔한 이야기가 됩니다: "에이전트는 사용자를 찾았고, 특수 권한을 사용할 방법을 발견한 뒤, 침입을 시도했다." 이 과정을 **추상화(abstraction)**라고 합니다. 이는 핵심 전략을 드러내기 위해 노이즈를 제거하는 과정입니다.

3단계: 지도 그리기 (오토마타 학습)
로그가 이러한 단순한 카테고리로 번역되면, ATLAS의 두 번째 부분이 작동합니다. 이 시스템은 Alergia라고 불리는 알고 알고리즘을 사용하여 수백 개의 이러한 번역된 이야기들을 살펴보고 **마르코프 체인(Markov Chain)**을 구축합니다.

보드게임을 상상해 보십시오. 마르코프 체인은 그 게임의 지도입니다.

  • 원(상태, States): 에이전트의 사고 과정 중 현재 위치를 나타냅니다 (예: "방금 시작함", "사용자를 찾음", "약점을 발견함").
  • 화살표(전이, Transitions): 에이전트가 다음에 무엇을 하는지 보여줍니다.
  • 숫자: 해당 경로를 따를 확률을 보여줍니다. 예를 들어, "사용자를 찾은 후, 에이전트가 특정 명령어를 시도할 확률은 70%이지만, 혼란에 빠져 다른 것을 시도할 확률은 30%이다"와 같습니다.

동일한 머신에 대한 20번의 시도를 통해, 시스템은 에이전트의 전형적인 행동을 보여주는 지도를 구축했습니다. 이는 원본 로그에서는 숨겨져 있던 패턴을 드러냈습니다. 예를 들어, 지도는 에이전트가 보통 사용자 정보를 확인하며 시작한다는 것을 보여주었습니다. 만약 약점을 발견하면 즉시 30%의 확률로 성공합니다. 하지만 발견하지 못하면, 결국 성공하기 전까지 잘못된 명령어를 시도하는 루프에 빠지는 경우가 많습니다.

그들은 무엇을 발견했는가?

이 논문은 이 접근 방식이 놀라울 정도로 잘 작동한다고 제안합니다. 원시 로그를 이러한 상징적 지도로 변환함으로써, 연구진은 두 가지 멋진 일을 할 수 있었습니다.

1. "주니어" 탐정 가르치기 (지식 전이)
연구진은 매우 똑똑한 AI(DeepSeek V4)로부터 학습한 "전략 지도"를 가져와서, 더 작고 저렴하며 덜 강력한 AI(ministral-8b)가 동일한 해킹 작업을 해결하는 데 도움을 주었습니다.

  • 도움 없이, 작은 AI의 성공률은 단 **5%**였습니다.
  • 지도를 바탕으로 한 "힌트"(다음 단계로 무엇을 해야 할지 정확히 알려줌)를 제공했을 때, 성공률은 **28.3%**로 급증했습니다.
  • 가장 효과적인 방법은 "동적(Dynamic)" 가이드였습니다. 지도가 GPS처럼 작동하여 작은 AI에게 "당신은 3단계에 있습니다, 이제 X를 하세요"라고 알려주는 방식이었습니다. 이는 똑똑한 AI의 "두뇌"가 약한 AI의 성능을 훨씬 더 향상시킬 수 있는 단순한 지도로 증류될 수 있음을 시사합니다.

2. "이유" 설명하기 (설명 모델)
때로는 지도가 너무 크고 복잡해서 읽기 어려울 수 있습니다. 연구진은 성공으로 이어지는 부분에만 집중하기 위해 지도를 "자르는(slice)" 방법을 보여주었습니다. 그들은 모든 막다른 길과 루프를 잘라내어, 에이전트가 코드를 어떻게 뚫었는지 정확히 설명하는 단순하고 직선적인 다이어그램을 남길 수 있었습니다. 예를 들어, 한 시나리오에서 단순화된 지도는 성공의 열쇠가 단순히 특정 파일(.bash_history)을 읽는 것임을 보여주었습니다. 이는 57단계의 복잡한 과정을 7단계의 명확한 설명으로 바꿔놓았습니다.

거시적 관점

저자들은 이것이 하나의 **개념 증명(proof of concept)**임을 주의 깊게 밝히고 있습니다. 그들이 모든 AI 안전 문제를 해결한 것은 아니지만, AI 행동을 바라보는 새로운 방법을 제시했습니다. 그들은 AI 에이전트가 실행되기를 기다리며 실수를 하지 않기를 바라는 대신, 그들의 "궤적"(행동 로그)을 공식적인 모델로 바꿀 수 있는 가치 있는 데이터로 취급해야 한다고 주장합니다.

이 모델들은 단순한 그림이 아닙니다. 이들은 공학적 도구입니다. 이 모델들은 다음과 같은 일을 도울 수 있습니다:

  • AI 시스템이 안전하게 행동하는지 확인하기 위한 감사(Audit).
  • 에이전트가 어디에서 루프에 빠지는지 찾아내어 디버깅(Debug).
  • 크고 비싼 AI 모델로부터 작고 빠른 모델로 지식을 전이(Transfer).

논문은 이것이 시작에 불과하다고 결론짓습니다. 만약 우리가 AI 에이전트의 혼란스러운 행동을 명확하고 수학적인 지도로 바꿀 수 있다면, 우리 세상의 더 큰 부분을 차지하고 있는 자율 시스템을 진정으로 이해하고, 신뢰하고, 개선하기 시작할 수 있습니다. 이는 "블랙박스"인 AI를 조금 더 투명하게 만들어, 미스터리를 지도로 바꾸는 단계입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →