← 최신 논문
🤖 machine learning

SkillConsist: Detecting Inconsistencies in Agent Skills via Bidirectional Graph Alignment

SkillConsist는 양방향 행동 그래프를 구축하고 그래프 정렬 및 차분(differencing)을 수행함으로써 선언된 에이전트 기술과 구현된 기술 사이의 불일치를 탐지하는 새로운 프레임워크이며, 새롭게 구축된 633개 기술 벤치마크에서 최첨단 성능을 달성했습니다.

원저자: Chaofan Meng, Yuhang Zheng, Yingnan Zhou, Sihan Xu

게시일 2026-08-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Chaofan Meng, Yuhang Zheng, Yingnan Zhou, Sihan Xu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 컴퓨터가 단순히 명령을 따르는 것을 넘어, 웹 서핑을 하고, 파일을 관리하며, 심지어 휴가 예약까지 할 수 있는 유능한 비서이자 디지털 집사처럼 행동하는 세상을 상상해 보십시오. 이를 위해 컴퓨터는 "에이전트 스킬(Agent Skills)"—즉, 특정 작업을 수행하는 정확한 방법을 알려주는 미리 만들어진 도구나 레시피—를 사용합니다. 이 스킬들을 요리책의 지침이라고 생각하면 쉽습니다. 여기서 "선언(declaration)"은 메뉴판에 적힌 "매콤한 타코"라는 맛있는 요리 설명인 반면, "구현(implementation)"은 주방에서 실제로 이루어지는 실제 요리 과정입니다.

문제는 메뉴가 거짓말을 할 때 발생합니다. 예를 들어, 셰프(코드)가 실수로 타코에 독이 되는 비밀 재료를 넣었거나, 메뉴에는 분명히 적혀 있는데 정작 요리할 때는 살사를 넣는 것을 깜빡했을 수도 있습니다. 디지털 세계에서 이러한 불일치는 위험합니다. 만약 컴퓨터 에이전트가 거짓된 약속을 바탕으로 스킬을 선택한다면, 실수로 당신의 파일을 삭제하거나, 개인 정보를 유출하거나, 해커에게 속아 넘어갈 수 있습니다. 과학자들은 음식을 맛보고 메뉴와 비교하여, 에이전트가 음식을 내놓기 전에 그 거짓말을 잡아낼 수 있는 "음식 비평가"를 구축하기 위해 노력하고 있습니다. 이것이 바로 스킬이 '말하는 것'과 '실제로 하는 것'이 일치하는지 확인하는 과제입니다.

여기에 바로 이 미스터리를 해결하기 위해 설계된 새로운 디지털 탐정, SkillConsist가 등장합니다. 이 도구를 개발한 연구진은 기존 방식들이 마치 명확한 대조 방법 없이 한 문장의 메뉴 설명을 50페이지 분량의 레시피 북과 비교하려는 것과 같다는 점을 깨달았습니다. 메뉴에는 "타코 만들기"라고 되어 있지만, 주방의 작업은 양파 썰기, 고기 굽기, 또르띠야 데우기, 살사 섞기 등으로 구성됩니다. 단순한 단어 대 단어의 확인 방식은 실패할 수밖에 없습니다. 왜냐하면 "타코 만들기"라는 약속은 하나의 커다란 개념이지만, 주방의 작업은 여러 작은 단계들의 사슬이기 때문입니다.

SkillConsist는 아주 체계적인 사서처럼 행동하여 두 개의 별도 지도, 즉 메뉴의 약속을 위한 지도와 주방의 행동을 위한 지도를 만듦으로써 이 문제를 해결합니다. 먼저, 스마트한 AI를 사용하여 복잡하게 섞인 텍스트와 코드를 분류하고, "우리가 약속하는 것"과 "우리가 실제로 하는 것"을 분리합니다. 그런 다음, 이를 그래프(graphs)—모든 단계가 노드(node)가 되고 모든 연결이 선(line)이 되는 흐름도—로 그립니다.

마법은 다음 단계인 **양방향 그래프 정렬(Bidirectional Graph Alignment)**에서 일어납니다. 메뉴 지도의 커다란 "타코 만들기" 버블 하나를 주방 지도의 연결된 여러 버블 뭉치와 맞추려고 시례한다고 상상해 보십시오. SkillConsist는 단순히 하나의 매칭만을 찾는 것이 아니라, 주방 지도의 선들을 따라 외부로 확장하며, 일련의 단계들(썰기, 굽기, 섞기)을 하나의 묶음으로 결합하여 단 하나의 메뉴 약속을 완벽하게 설명할 수 있는지 확인합니다. 이는 모든 주방 단계가 메뉴의 약속을 가지고 있는지, 그리고 모든 메뉴의 약속이 주방의 계획을 가지고 있는지 양방향으로 확인하며 진행됩니다.

지도가 정렬되면, 탐정은 **불일치(inconsistencies)**를 찾아냅니다. 다음과 같은 세 가지 유형의 문제를 표시합니다:

  1. 충돌(Conflicts): 메뉴에는 "매콤한 맛"이라고 되어 있지만, 주방 코드에는 "달콤한 맛"이 추가되었습니다.
  2. 미구현(Unimplemented): 메뉴는 "살사"를 약속했지만, 주방에는 살사 재료가 전혀 없습니다.
  3. 미선언(Undeclared): 주방에서 몰래 "독"을 섞고 있지만, 메뉴에는 언급된 바가 없습니다.

연구진은 633개의 실제 세계 에이전트 스킬(까다롭거나 악의적인 스킬 포함)이 포함된 방대한 벤치마크를 통해 SkillConsksist를 테스트했습니다. 결과는 인상적이었습니다. 이 도구는 불일치하는 스킬을 **87.93%**의 확률(F1 점수)로 정확히 식별해 냈는데, 이는 기존의 가장 뛰어난 방법들보다 20 퍼센트 포인트 이상 높은 수치입니다. 또한, 약 **62%**의 경우에서 코드 내의 거짓말이 어디에 숨어 있는지 정확히 짚어냈습니다.

가장 중요한 점은, 이 논문이 이것이 단순히 오타를 수정하는 문제가 아니라 '안전'에 관한 문제임을 보여준다는 것입니다. 연구진이 악의적인 스킬을 걸러내기 위해 SkillConsist를 사용했을 때, 이 도구는 위험한 환경에서 먼저 실행해 볼 필요 없이 더 많은 위험한 도구들을 잡아내는 데 도움을 주었습니다. 약속과 실제 사이의 불일치를 잡아냄으로써, SkillConsist는 컴퓨터가 타코를 만든다고 말할 때 실제로 위험한 것을 내놓지 않도록 보장하며, 우리가 디지털 비서를 조금 더 신뢰할 수 있는 방법을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →