Toward Effective and Reliable LLM Agents via Dynamic Ontology
이 논문은 지식과 관계를 명시적으로 접지(grounding)하여 대규모 언어 모델 에이전트의 다단계 추론 시 증거 활용도와 신뢰성을 향상시키기 위해, 작업 지향적 온톨로지를 동적으로 구축하고 정교화하는 프레임워크인 OaK를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능이 급격히 발전하는 세상에서, '대규모 언어 모델'로 알려진 특정 유형의 소프트웨어가 인간의 언어를 이해하고 생성하는 강력한 도구로 등장했습니다. 이러한 모델들은 단순히 대화를 나누는 것을 넘어, 정보를 검색하거나 디지털 도구를 사용하고, 발견한 내용을 바탕으로 의사결정을 내리는 것과 같이 작업을 작은 단계로 나누어 복잡한 과업을 수행하도록 설계된 프로그램인 '에이전트'를 구축하는 데 자주 사용됩니다. 그러나 이러한 에이전트들이 더 길고 복잡한 업무를 시도할 때, 종종 어려움을 겪곤 합니다. 그들은 필요한 사실을 놓치거나, 논리적 비약을 범하거나, 자신의 메모리에 저장된 방대하고 구조화되지 않은 지식에 너무 과하게 의존하여 오류의 루프에 빠지기도 합니다. 이를 해결하기 위해 연구자들은 에이전트가 항해하는 세계에 대해 더 명확하고 조직화된 지도를 제공함으로써, 모든 단계가 추측이 아닌 신뢰할 수 있는 증거에 기반하도록 보장하는 방법을 탐구하고 있습니다.
난징 대학교와 다른 기관의 연구진은 이러한 신뢰성 문제를 해결하기 위해 'OaK'라고 불리는 새로운 프레임워크를 개발했습니다. 이들의 연구는 '온톨로지(ontology)'라는 개념에 초점을 맞추고 있는데, 이는 본질적으로 개념들과 그들 사이의 관계를 컴퓨터가 엄격하게 해석할 수 있는 방식으로 작성된 구조화된 사전와 같습니다. 전통적인 방식의 구조 생성은 전문가가 모든 규칙을 수동으로 정의해야 하므로 느리고 어려운 과정이지만, 새로운 시스템은 해당 작업에 특화된 지도를 자동으로 생성합니다. 연구진은 각 작업에 맞는 맞-춤형 동적 구조를 구축함으로써 에이전트가 다단계 과업을 계획하고 실행하는 능력을 크게 향arly할 수 있었으며, 이 과정을 더 투명하게 만들고 실패 가능성을 낮출 수 있다는 것을 발견했습니다.
OaK 시스템의 핵심은 에이전트가 실제 작업을 시도하기 전에 일어나는 2단계 프로세스입니다. 먼저, 시스템은 일련의 훈련 예시와 여행 계획이나 고객 데이터 관리와 같은 특정 작업 요구 사항을 살펴봅니다. 그런 다음 시스템은 '호텔', '항공편', '예산'과 같이 관련된 중요한 정보의 유형과 이들이 어떻게 연결되는지를 정의하는 청사진인 '스키마(schema)'를 자동으로 작성합니다. 이 청사진은 단순한 목록이 아니라, 모순이나 누락된 규칙이 없는지 확인하기 위해 논리적 추론기(reasoner)에 의해 엄격하게 검증됩니다. 만약 청사진에 결함이 있다면, 시스템은 다음 단계로 넘어가기 전에 이를 수정합니다. 청사진이 견고해지면, 시스템은 훈련 자료에서 추출한 실제 데이터 포인트들을 청사진의 규칙에 따라 정확하게 조직하여 지식 그래프(knowledge graph)를 구축합니다.
이러한 구조적 토대가 마련되면, 시스템은 에이전트가 사용할 수 있는 전문화된 도구, 즉 '함수(functions)' 세트를 생성합니다. 에이전트에게 항공편을 검색하고, 가격별로 필터링하고, 예약 가능 여부를 직접 확인하는 방법을 스스로 알아내라고 요구하는 대신, 시스템은 이러한 특정 동작들을 정확하게 수행하는 사전 제작된 도구들을 제공합니다. 그러면 에이전트는 청사진의 엄격한 규칙에 따라 이 도구들을 사용하여 문제를 해결합니다. 만약 에이전트가 실수를 하거나 작업이 실패하면, '판사(judge)' 모델이 전체 과정을 검토하여 청사진이나 도구의 어느 부분이 잘못되었는지 식별하고 개선 사항을 제안합니다. 이러한 구축, 테스트, 개선의 순환은 시스템이 보이지 않는 질문들을 처리할 만큼 견고해질 때까지 여러 번 반복됩니다. 그 결과, 에이전트가 데이터와 상호작용할 때 사용하는 신뢰할 수 있는 인터페이스인 '커널(kernel)'이 만들어지며, 이를 통해 모든 결정이 증거에 의해 뒷받침되고 에이전트가 실수로 사실을 지어내거나 제약 조건을 무시할 수 없도록 보장합니다.
연구진은 이 접근 방식이 현실 세계에서도 유효한지 확인하기 위해 세 가지 매우 다른 유형의 과제에 대해 테스트를 진행했습니다. 첫 번째는 예산과 일정 제약 조건을 준-수하면서 항공편, 호텔, 식사, 활동을 준비해야 하는 여행 계획 작업이었습니다. 두 번째는 복잡한 회사 정책을 따르고 특정 기록을 검색해야 하는 비즈니스 환경에서의 고객 관계 관리였습니다. 세 번째는 상세한 질문에 답하기 위해 항공 데이터베이스 및 레스토랑 리뷰와 같은 다양한 외부 소스의 정보를 결합하는 능력을 테스트했습니다. 모든 경우에서 OaK 시스템은 표준 방식보다 우수한 성능을 보였습니다. 예를 들어, 여행 계획 작업에서 기본 모델 중 하나를 사용했을 때 완전하고 유효한 일정을 완료하는 성공률이 약 15%에서 거의 56%로 향상되었고, 다른 모델의 경우 약 4%에서 거의 20%로 향상되었습니다. 또한 비즈니스 및 데이터 작업에서도, 특히 에이전트가 엄격한 규칙을 따르거나 여러 테이블에서 데이터를 결합해야 하는 시나리오에서 상당한 성과를 보여주었습니다.
이 연구는 또한 왜 이러한 개선이 일어났는지 밝혀냈습니다. 연구진이 맞춤형 도구를 제거하거나 여러 차례의 개선 과정을 거치지 않도록 했을 때 성능이 급격히 떨어졌습니다. 이는 단순히 에이전트에게 데이터에 대한 접근 권한을 주는 것만으로는 충분하지 않으며, 에이전트가 효과적으로 행동을 조정하기 위해서는 구조화된 규칙과 사전 패키징된 도구가 필요하다는 것을 나타냅니다. 시스템은 에이전트의 추론 과정을 가시적이고 제약된 상태로 만듦으로써, 근거 없는 가정으로 빠져드는 것을 방지하며 작동합니다. 새로운 방식은 더 단순한 접근 방식보다 실행 시간이 약간 더 걸리고 더 많은 출력 텍스트를 생성했지만, 입력 토큰은 더 적게 사용했는데, 이는 구조화된 인터페이스가 에이전트가 필요한 정보를 처리하는 데 있어 더 효율적임을 시사합니다. 연구진은 도메인 지식을 실행 가능하고 자기 수정이 가능한 인터페이스로 전환함으로써, 인공지능 에이전트를 더욱 신뢰할 수 있고 믿음직하며, 현실 세계의 응용 분야에서 요구되는 복잡한 다단계 추론을 처리할 수 있도록 만들 수 있다고 결론지었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.