← 최신 논문
🤖 AI

Right Family, Wrong Skill: Benchmarking Risk Exposure in Agent Skill Retrieval

이 논문은 에이전트 기술 검색 시 시스템이 유익한 기술의 유해한 형제 기술을 얼마나 자주 검색하는지를 측정함으로써 '동일 역량 위험 노출(same-capability risk exposure)'을 평가하고 완화하기 위해 설계된 새로운 벤치마크인 SameCapRisk-Bench를 소개하며, 현재의 방식들이 높은 재현율을 달고 있음에도 불구하고 타겟팅된 스코어링 및 클러스터링 메커니즘을 통해 강화되지 않는 한 위험한 대안들을 빈번하게 노출한다는 점을 입증한다.

원저자: Jiandong Ding, Honglei Ji, Ming Liu, Tao Duan

게시일 2026-08-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jiandong Ding, Honglei Ji, Ming Liu, Tao Duan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능이 부상하는 세상에서, 소프트웨어 에이전트들은 우리를 대신해 행동하는 법을 배우고 있습니다. 이 디지털 비서들은 단순히 질문에 답하는 것에 그치지 않고, 방대한 전문 도구, 즉 '기술(skills)' 라이브러리에 접근하여 주어진 과업을 수행합니다. 마치 책을 찾는 것뿐만 아니라, 그 책을 펼쳐 내부의 지침을 읽고, 텍스트에 언급된 망치나 계산기를 사용하여 부서진 의자를 고칠 수 있는 사서와 같은 모습입니다. 이것이 제대로 작동하려면, 에이전트는 특정 순간에 적합한 도구를 검색해야 합니다. 만약 작업이 섬세한 조작을 요구한다면, 에이전트는 정밀하고 안전한 기술이 필요합니다. 반대로 작업이 거칠고 단순하다면, 다른 방식의 접근이 필요합니다. 문제는 이러한 라이브러리들이 점점 거대하고 무질서해지고 있으며, 겉보기에는 매우 유사하지만 내부적인 동작 방식은 서로 다른 도구들로 가득 차 있다는 점입니다.

문제는 단순히 관련 있어 보이는 도구를 찾는 것이 아니라, 올바른 도구의 잘못된 버전을 선택하는 함정에 빠지지 않는 것입니다. 연구자는 데이터를 안전하게 처리하는 기술이 필요할 수 있지만, 라이브러리에는 안전 점검을 무시하는 거의 동일한 기술이 포함되어 있을 수 있습니다. 만약 에이전트가 잘못된 것을 집어 든다면, 그 결과는 과업의 실패부터 위험한 오류에 이르기까지 다양할 수 있습니다. 바로 이 특정한 실패 유형, 즉 올바른 도구 군(family)은 찾았으나 그 군 안에서 잘못된 대표자를 선택하는 문제는 지금까지 측정하기 어려웠습니다. 화웨이 테크놀로지(Huawei Technologies)와 동티 대학(Tongji University)의 연구팀은 이 위험을 지도화하기 위해 새로운 방법을 고안하여, 에이전트가 유용한 도구와 위험한 닮은꼴 사이를 얼마나 잘 구별할 수 있는지 테스트하는 방법을 만들어냈습니다.

연구진은 이 특정한 유형의 실수를 잡아내기 위해 설계된 통제된 환경인 'SameCapRisk-Bench'라는 테스트 환경을 구축했습니다. 그들은 에이전트에게 문제를 해결하도록 요청하는 1,100개 이상의 테스트 케이스를 만들었습니다. 각 문제에는 작업에 딱 맞는 완벽한 기술과, 안전 점검이 누락되었거나 잘못된 자원을 사용하는 등 숨겨진 결함이 있는 '위험한 형제(risky sibling)'가 존재합니다. 목표는 에이전트의 검색 시스템이 위험한 쌍둥이를 무시하고 완벽한 기술을 선택할 수 있는지 확인하는 것이었습니다. 테스트에는 두 가지 유형의 도전 과제가 포함되었습니다. 첫 번째는 수천 개의 기술이 담긴 대규모 공개 라이브러리를 활용하여 에이전트가 많은 방해 요소 속에서 올바른 것을 찾을 수 있는지 보는 것이었습니다. 두 번째는 더 어려운 테스트로, 두 기술의 역할이 뒤바뀌는 상황이었습니다. 즉, 한 시나리오에서는 유용했던 도구가 약간 다른 시나리오에서는 위험한 도구가 되도록 하여, 시스템이 단순히 일반적인 주제가 아니라 요청의 구체적인 세부 사항에 주의를 기울이도록 강제했습니다.

연구진이 테스트를 실행한 결과, 현재의 시스템들은 도구의 일반적인 범주를 찾는 데는 꽤 능숙하지만 안전한 버전을 선택하는 데는 자주 실패한다는 것을 발견했습니다. 표준적인 공개 검색 시스템을 사용할 때, 에이전트들은 거의 90%의 사례에서 유용한 기술을 성공적으로 찾아냈습니다. 그러나 그 성공적인 사례 중 약 35~37%의 경우, 시스템은 위험한 형제를 상위 결과에 함께 포함시켰습니다. 이는 에이전트가 올바른 도구 군을 찾더라도, 자주 잘못된 대표자에게 자신을 노출시킨다는 것을 의미합니다. 연구진은 이를 '유해한 형제율(harmful sibling rate)'이라는 지표로 측정했는데, 이는 위험한 닮은꼴이 최종 선택 목록에 얼마나 자주 나타나는지를 추적합니다. 데이터에 따르면, 시스템은 적절한 도구를 찾아내는 '재현율(recall)' 측면에서는 뛰어났지만, 안전하지 않은 것을 걸러내는 능력은 부족했습니다.

이를 해결하기 위해 연구팀은 과정을 두 단계로 분리하는 새로운 접근 방식을 테스트했습니다. 먼저, 시스템은 어떤 도구들이 동일한 군에 속하는지 식별합니다. 그다음, 최종 결과를 순위 매기기 전에 해당 군에서 단 하나의 대표자만을 선택하도록 하는 구체적인 결정을 내립니다. 이 방법을 적용했을 때 결과는 극적으로 변했습니다. 시스템은 여전히 높은 비율로 유용한 기술을 찾아냈지만, 위험한 형제를 실수로 포함하는 횟수는 최선의 경우 30% 이상에서 1% 미만으로 급감했습니다. 이는 실패의 원인이 올바른 주제를 찾는 데 있는 것이 아니라, 특정 도구를 선택하는 최종 결정에 있었음을 입 증했습니다. 이 연구는 단순히 관련 도구의 목록을 만드는 것만으로는 충분하지 않으며, 시스템이 현재의 작업에 적합한 도구의 버전을 능동적으로 결정해야 한다는 점을 시사합니다.

이 연구 결과는 현재 AI 에이전트가 구축되는 방식의 결정적인 격차를 강조합니다. 대부분의 시스템은 사용자의 질문을 올바른 주제와 매칭시키는 데 집중하며, 주제가 맞으면 도구도 안전할 것이라고 가정합니다. 본 논문은 그 가정이 잘못되었음을 보여줍니다. 두 도구는 이름과 설명이 같을 수 있지만, 작동 규칙은 다를 수 있습니다. 하나는 실행을 위해 특정 권한을 요구할 수 있는 반면, 다른 하나는 그렇지 않을 수 있습니다. 만약 에이전트가 권한 확인 절차가 없는 것을 선택한다면, 시스템이 충돌하거나 예측 불가능하게 동작할 수 있습니다. 연구진은 이러한 가족 간의 갈로를 해결하는 단계, 즉 "이 유사한 도구들 중 실제로 이 특정 요청에 맞는 것은 무엇인가?"라고 묻는 단계를 추가함으로써, 올바른 도구를 찾는 능력을 희생하지 않으면서도 노출 위험을 크게 낮출 수 있음을 보여주었습니다.

이 작업은 AI의 모든 안전 문제를 해결했다고 주장하거나, 라이브러리의 모든 도구가 위험하다고 제안하는 것이 아닙니다. 대신, 간과되었던 특정한 위험에 대한 명확한 측정 기준을 제공합니다. 연구진은 가장 진보된 공개 시스템조차도 이 구분에 어려움을 겪으며, 올바른 군을 찾는 경우의 3분의 1 이상에서 잘못된 도구를 노출한다는 것을 발견했습니다. 그러나 또한 이것이 해결 가능한 문제임을 보여주었습니다. 특정 도구의 선택을 일반적인 주제의 선택으로부터 별개의 결정으로 취급함으로써, 개발자들은 유능하면서도 신중한 시스템을 구축할 수 있습니다. 연구는 미래의 AI 에이전트 벤치마크가 단순히 올바른 도구가 발견되었는지만을 측정하는 것이 아니라, 잘못된 위험 버전이 최종 선택에서 배제되었는지도 측정해야 한다고 결론짓습니다. 이러한 초점의 전환은 에이전트가 무엇을 해야 하는지뿐만 아니라, 정확히 어떻게 안전하게 수행해야 하는지를 이해하는 더 신뢰할 수 있는 에이전트로 이어질 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →