← 최신 논문
🤖 AI

Robustness Analysis of Agentic AI to Inconsistent and Incomplete Tool Responses

이 질적 파일럿 연구는 에이전틱 AI 모델이 일관되지 않은 도구 응답과 불완전한 도구 응답을 마주할 때 로그 확률에서 뚜렷하고 채널 특이적인 시그니처를 나타낸다는 것을 입증하며, 이러한 서로 다른 결함 유형에 대한 강건성이 비대칭적이고 보편적인 접근 방식보다는 맞춤형 탐지 메커니즘을 필요로 한다는 점을 밝혀낸다.

원저자: Jiachen Xu, Torben Bach Pedersen, Zhongming Yao, Xiaoyu Zhang, Yushuai Li

게시일 2026-08-25
📖 5 분 읽기🧠 심층 분석

원저자: Jiachen Xu, Torben Bach Pedersen, Zhongming Yao, Xiaoyu Zhang, Yushuai Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 인공지능의 지형에서 새로운 종류의 디지털 작업자인 '언어 에이전트(language agent)'가 등장했습니다. 단순히 정적인 데이터베이스를 기반으로 질문에 답하던 이전의 프로그램들과 달리, 이 에이전트들은 행동하도록 설계되었습니다. 이들은 웹을 검색하고, 데이터베이스를 쿼리하며, 소프트웨어 도구를 사용하여 복잡한 문제를 해결할 수 있는데, 이는 마치 전화를 걸어 예약을 하거나 재고 확인을 위해 스프레드시트를 확인하는 인간 비서와 매우 유사합니다. 하지만 이러한 디지털 작업자들이 결코 완벽한 것은 아닙니다. 이들이 도구에 접근할 때, 이들은 깨끗하고 정확한 응답을 기대합니다. 그러나 현실 세계에서 도구는 때때로 실패하여 에러 메시지를 반환하거나, 겉보기에는 완벽해 보이지만 미묘한 거짓을 포함한 데이터를 반환하기도 합니다. 연구자들의 핵심 과제는 모든 것이 제대로 작동할 때 잘 작동하는 에이전트를 만드는 것뿐만 아니라, 무언가 잘못되었을 때 이를 인식하고 적절하게 대응할 수 있는 에이전트를 구축하는 것입니다. 만약 에이전트가 고장 난 도구와 속임수를 쓰는 도구를 구분하지 못한다면, 잘못된 해결책을 적용하여 시간을 낭비하거나 상황을 악화시킬 수 있습니다.

알보르 대학(Aalborg University)과 절강 대학교(Zhejiang University)의 연구팀은 바로 이 결정의 순간을 조사하기 위해 나섰습니다. 그들은 인공지능이 데이터를 전혀 반환하지 못한 도구와, 잘 구성되었으나 거짓된 답변을 반환한 도구를 즉각적으로 구별할 수 있는지 알고 싶었습니다. 이를 테스트하기 위해, 그들은 통제된 환경을 조성하여 소매 고객 서비스 시나리오를 시뮬레이션했습니다. 이 디지털 세계에서 에이전트는 지원 담당자 역할을 수행하며, 주문 상세 내역을 조회하고, 결제 수단을 확인하며, 사용자 정보를 업데이트하기 위해 16가지의 서로 다른 도구 세트를 사용합니다. 연구진은 표준적이고 성공적인 일련의 행동 과정을 가져온 뒤, 특정 시점에서 도구의 정상적인 응답을 결함이 있는 응답으로 교체했습니다. 그들은 세 가지 유형의 결함을 만들었습니다. 하나는 도구가 에러 메시지를 반환하는 완전한 실패였고, 다른 하나는 에이전트가 다음에 할 수 있는 규칙을 변경하는 조작된 주문 상태였으며, 마지막은 올바르게 보이지만 고객에게 속하지 않은 조작된 결제 식별자였습니다.

연구진은 단순히 에이전트가 과업을 완수하려고 노력하는 모습을 지켜보며 성공 여부를 확인하는 데 그치지 않았습니다. 대신, 결함이 있는 데이터가 도착하는 즉시 프로세스를 일시 중단했습니다. 그들은 모델의 내부 '사고 과정', 특히 응답의 다음 단어를 생성할 확률을 조사했습니다. 그들은 두 가지 뚜렷한 요소를 측정했습니다. 첫째, 반환된 데이터가 도구 자체의 예상 형식에 얼마나 잘 부합하는지 확인했습니다. 둘로, 그 데이터가 사용자의 원래 요청과 이전의 도구 결과들을 포함하여 에이전트가 이미 대화에서 접한 모든 내용과 얼마나 잘 부합하는지 확인했습니다. 또한 그들은 에이전트의 바로 다음 단계에 대한 계획을 살펴보았으며, 에이전트가 행동을 취하는 데 있어 얼마나 확신을 갖는지, 그리고 그 행동이 시스템의 상태를 다시 확인하는 것인지 아니면 변화를 추진하는 것인지를 측정했습니다.

결과는 에이전트가 이러한 다양한 유형의 오류에 어떻게 반응하는지에 대해 뚜렷하고 즉각적인 차이를 보여주었습니다. 도구가 고장 난 에러 메시지를 반환했을 때, 에이전트는 데이터가 도구의 기본 형식에 맞지 않는다는 것을 즉시 인식했습니다. 이는 도구가 실패했다는 명확한 신호였습니다. 결과적으로 에이전트의 계획은 급격히 변화했습니다. 에이전트는 시스템의 상태를 다시 읽는 동작을 선택할 가능성이 매우 높아졌는데, 이는 본질적으로 다시 시도하거나 사실을 확인하기로 결정한 것을 의미합니다. 반면, 도구가 잘 구성되었으나 거짓된 답변을 반환했을 때, 에이전트는 형식상의 문제를 발견하지 못했습니다. 데이터는 완벽해 보였습니다. 그러나 에이전트가 새로운 데이터를 대화 기록과 비교했을 때 충돌이 발생했습니다. 거짓된 데이터가 사용자가 이전에 진술한 내용이나 시스템 정책과 충돌했기 때문입니다.

결정적으로, 연구진은 에이전트가 이러한 거짓 답변에 반응하는 방식이 전적으로 거짓의 성격에 달려 있다는 것을 발견했습니다. 조작된 정보가 사용자의 것이 아닌 결제 ID와 같은 단순한 불일치였을 때, 에이전트의 계획은 거의 변하지 않았습니다. 에이전트는 혼란을 느끼거나 불확실해지지 않았으며, 단순히 그 거짓 데이터를 수용하고 계속 진행했습니다. 왜냐하면 그 거짓말은 상호작용의 근본적인 규칙을 바꾸지 않았기 때문입니다. 하지만 조작된 정보가 허용되는 행동의 규칙을 바꾸는 주문 상태였을 때, 에이전트의 행동은 변화했습니다. 에이전트는 다음에 무엇을 해야 할지에 대해 불확실성을 느꼈고, 그 계획은 새로운, 잘못된 현실을 반영하도록 바뀌었습니다. 이는 에이전트가 고장 난 도구와 속이는 도구는 구분할 수 있지만, 무해한 거짓말과 과업을 탈선시킬 수 있는 중대한 거짓말을 항상 구분할 수 있는 것은 아님을 보여주었습니다.

연구는 초기 실수 이후에 어떤 일이 일어나는지도 살펴보았습니다. 연구진은 오류의 유형이 에이전트의 향후 행동에 지속적인 흔적을 남긴다는 것을 발견했습니다. 고장 난 도구는 에이전트가 후속 단계에서 시스템 상태를 계속해서 다시 읽도록 만들었는데, 이는 검증의 루프에 갇혔음을 나타내는 신호였습니다. 그러나 조작된 주문 상태는 에이전트를 완전히 다른 경로로 유도하여, 거짓 정보에 기반하여 시스템 상태를 변경하는 행동을 취하게 했습니다. 처음에 아무 문제 없이 수용했던 조작된 결제 ID의 경우, 에이 l전트가 속았다는 징후 없이 이후 단계에서도 계속해서 수용되었습니다. 이는 에이전트의 오류 인식 능력이 단일하고 보편적인 경보가 아님을 입증했습니다. 대신, 그것은 다양한 신호들의 집합이었습니다. 하나의 신호는 도구가 고장 났음을 알려주었고, 다른 하나는 데이터가 과거와 일치하지 않음을 알려주었으며, 세 번째는 데이터가 규칙과 일치하지 않음을 알려주었습니다. 단 하나의 신호로는 모든 유형의 오류를 잡아낼 수 없었습니다.

연구진은 이러한 에이전트의 강건성(robustness)이 모든 나쁜 데이터를 표시하는 단일 지표를 갖는 것에 관한 것이 아니라고 결론지었습니다. 대신, 여러 채널의 정보를 동시에 읽는 능력이 필요합니다. 에이전트는 데이터가 도구의 형태와 일치하지 않을 때, 데이터가 대화의 이력과 모순될 때, 그리고 데이터가 도메인의 규칙과 모순될 때를 모두 볼 수 있어야 합니다. 이 연구는 이러한 다양한 유형의 오류가 에이전트의 내부 계산에서 뚜렷한 특징(signature)을 만들어낸다는 것을 보여주었습니다. 고장 난 도구는 형식을 깨뜨리기 때문에 즉각적으로 드러납니다. 속이는 도구는 형식을 갖추고 있지만 이야기를 깨뜨리기 때문에 포착하기 더 어렵습니다. 가장 위험한 거짓말은 게임의 규칙을 바꾸는 거짓말로, 이는 에이전트에게 아무런 혼란을 일으키지 않으면서 완전히 잘못된 경로로 몰아넣을 수 있습니다. 이러한 구체적인 특징들을 이해함으로써, 개발자들은 에이전트가 자신의 실수를 진단하고, 도구를 재시도할지, 사실을 교차 검증할지, 혹은 멈춰서 명확한 설명을 요구할지와 같은 올바른 해결책을 선택할 수 있도록 더 잘 준비된 에이전트를 구축할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →