← 최신 논문
🤖 AI

LedgerAgent: Structured State for Policy-Adherent Tool-Calling Agents

LedgerAgent는 별도의 원장(ledger)에 작업 상태를 유지함으로써 일관된 의사결정을 보장하고 도구 실행 전 정책 위반을 선제적으로 차단하여, 고객 서비스 도메인에서 정책 준수 도구 호출 에이전트를 개선하는 추론 시점(inference-time) 방법론입니다.

원저자: Md Nayem Uddin, Amir Saeidi, Eduardo Blanco, Chitta Baral

게시일 2026-06-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Md Nayem Uddin, Amir Saeidi, Eduardo Blanco, Chitta Baral

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 항공사나 소매점의 고객 서비스 상담원이라고 상상해 보세요. 당신의 업무는 고객이 항공권을 취소하거나, 물건을 반품하거나, 계획을 변경하는 것을 돕는 것입니다. 이를 위해 당신은 기록을 확인하고, 계정을 업데이트하거나, 환불을 처리할 수 있는 디지털 도구인 '도구 벨트(toolbelt)'를 사용할 수 있습니다.

문제는, 이 논문에 따르면 일반적인 AI 에이전트들이 매우 긴 기억력을 가진 건망증 환자와 같다는 점입니다. 그들은 전체 대화 기록(트랜스크립트)을 읽을 수는 있지만, 방금 찾아낸 중요한 사실들을 적어둘 전용 공책이 없습니다.

다음은 이 논문이 제시하는 해결책인 LedgerAgent를 쉬운 비유를 들어 설명한 내용입니다.

문제점: "소음 속에서 길을 잃은" 에이전트

표준적인 설정에서는 AI가 항공 예약 상태나 주문 상태를 확인할 때마다, 그 정보가 거대하고 스크롤되는 채팅 로그 속에 쏟아져 들어갑니다.

  • 비유: 500페이지 분량의 손으로 쓴 메모 더미 속에서 특정 전화번호 하나를 찾는 상황을 상상해 보세요. 다음 행동을 결정할 때마다 그 전체 더미를 다시 읽어야 합니다.
  • 실패 사례: AI는 사실 관계를 기억하기 위해 채팅 로그를 계속 "다시 읽어야" 하기 때문에 종종 혼란에 빠집니다. AI는 다음과 같은 실수를 할 수 있습니다:
    1. 결정적인 세부 사항(예: 비행 날짜)을 잊어버립니다.
    2. 오래된 정보에 근거해 행동합니다(예: 실제로는 예약이 불가능한데도 여전히 예약 가능한 상태라고 생각함).
    3. 현재의 사실을 정책과 대조하여 재확인하지 않고, 규칙을 어기는 "기술적으로는 맞지만 틀린" 동작을 수행합니다(예: 존재하지 않는 결제 수단으로 환불을 시도함).

해결책: "장부(Ledger)"와 "가드(Bouncer)"

저자들은 LedgerAgent를 통해 AI의 워크플로우에 두 가지 단순하지만 강력한 기능을 추가했습니다.

1. 장부 (정리된 공책)

AI는 단순히 사실들을 채팅 로그에 떠다니게 두는 대신, 구조화된 장부를 갖게 됩니다.

  • 작동 방식: AI가 도구(예: "항공 상세 정보 가져오기")를 사용하여 데이터를 성공적으로 읽을 때마다, 그 데이터는 단순히 채팅에 남겨지는 것이 아니라 즉시 깔끔하고 정리된 "공책"(타입된 딕셔너리)으로 복사됩니다.
  • 비유: 채팅 로그가 식재료가 여기저기 흩어져 있는 지저도한 주방 조리대라면, **장부(Ledger)**는 라벨이 붙은 양념 선반입니다. AI가 항공권 가격을 알아내야 할 때, 지저한 조리대를 뒤지는 대신 "항공권 가격"이라고 적힌 병을 바로 확인하면 됩니다.
  • 이점: AI는 추측하거나 검색할 필요 없이 자신이 무엇을 알고 있는지 정확히 알게 됩니다.

2. 정책 게이트 (가드/보디가드)

AI가 현실 세계에 변화를 주기 전(예: 항공권 취소 또는 환불 발행), 반드시 **정책 게이트(Policy Gate)**를 통과해야 합니다.

  • 작동 방식: 이 게이트는 엄격한 규칙 검사기입니다. AI가 제안한 행동을 살펴보고, 이를 장부의 사실 및 회사의 규칙과 대조합니다.
  • 비유: 클럽의 보디가드를 상상해 보세요. AI(손님)가 "이 항공권을 취소하고 싶습니다"라고 말합니다. 보디가드(게이트)는 장부(게스트 리스트)와 규칙집(정책)을 확인합니다.
    • 시나리오: 규칙에는 "24시간 이내에만 취소할 수 있다"고 되어 있습니다. 장부에는 항공권이 48시간 전에 예약되었다고 나와 있습니다.
    • 결과: 보디가드는 AI를 막아섭니다. "출입 불가. 24시간 규칙을 위반했습니다." 그러면 AI는 무작정 취소를 시도하다 실패하는 대신, 고객에게 "죄송합니다, 그 요청은 처리할 수 없습니다"라고 말하게 됩니다.

이것이 왜 중요한가

저자들은 이 시스템을 **항공, 소매, 통신, 텔레헬스(원격 의료)**라는 네 가지 서로 다른 고객 서비스 환경에서 테스트했습니다. 또한 다양한 AI 모델(오픈 소스 및 대형 상용 모델 모두)을 사용했습니다.

  • 결과: LedgerAgent는 특히 현실 세계의 변화(환불이나 취소 등)가 필요한 작업을 수행할 때 훨씬 더 높은 성공률을 보였습니다.
  • 일관성: 가장 큰 성과는 일관성입니다. 만약 표준 AI에게 동일한 작업을 4번 시키면, 스스로의 채팅 기록 때문에 혼란을 겪어 한 번은 성공하고 세 번은 실패할 수 있습니다. 하지만 LedgerAgent는 4번의 시도 모두에서 훨씬 더 일관되게 성공했습니다.
  • 추가 비용 없음: 더 많은 데이터로 AI를 학습시키거나 여러 개의 AI 두뇌를 사용하는 다른 방법들과 달리, LedgerAgent는 AI의 두뇌 자체를 바꾸지 않습니다. 단지 AI에게 더 나은 노트 정리법과 검토할 수 있는 가드를 제공할 뿐입니다.

요약

LedgerAgent는 혼란스럽고 잘 까먹는 조수에게 구조화된 파일 캐비닛(장부)과 엄격한 관리자(정책 게이트)를 주는 것과 같습니다.

  • 파일 캐비닛은 조수가 오래된 이메일을 뒤질 필요 없이 항상 최신 사실을 알 수 있게 해줍니다.
  • 관리자는 조수가 실제로 행동을 취하기 전에 규칙을 어기지 않도록 보장합니다.

이 논문은 이러한 단순한 변화가 AI 에이전트를 복잡한 고객 서비스 업무를 처리할 때 훨씬 더 신뢰할 수 있고, 정확하며, 정중하게 만든다고 주장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →