← 최신 논문
💻 computer science

Skills That Don't Exist: A Large-Scale Study of Hallucinated Skill Recommendation in LLM Agents

이 논문은 LLM 에이전트가 존재하지 않는 기술 이름을 매우 일관되게 환각하는 현상을 통해 공급망의 치명적인 취약점을 드러내며, 이는 모델 튜닝만으로는 해결할 수 없고 레지스트리 수준의 이름 예약과 같은 생태계 전반의 구조적 변화를 필요로 하는 악용 가능한 공격 벡터를 생성한다.

원저자: Weifeng Yuan, Wenbo Guo, Feng Dong, Haoyu Wang, Yang Liu

게시일 2026-07-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Weifeng Yuan, Wenbo Guo, Feng Dong, Haoyu Wang, Yang Liu

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 새로운 기술을 배울 수 있는 아주 똑똑한 로봇 비서가 있다고 상상해 보세요. 당신이 직접 거대한 도서관을 뒤져서 적절한 기술을 찾아내는 대신, 그저 로봇에게 "헤이, 내 파일을 정리하는 데 좋은 기술이 뭐야?"라고 물어보기만 하면 됩니다. 그러면 로봇은 실제 제작된 지침서(이를 '기술/skill'이라 부릅니다)를 찾아보고, 당신이 다운로드할 수 있도록 그 이름을 알려주어야 합니다.

하지만 여기 무서운 점이 있습니다: 로봇은 자신감 넘치는 거짓말쟁이입니다.

마법이 아닌 마술

이 연구에서 연구자들은 12가지의 서로 다른 로봇 두뇌(단순히 두뇌만 있는 것도 있고, 웹 검색 도구를 갖춘 두뇌도 있습니다)에게 15,000개의 서로 다른 질문에 대해 기술을 추천하도록 요청했습니다. 그 결과, 모든 로봇이 가짜 기술 이름을 지어낸다는 것을 발견했습니다.

평균적으로, 단독형 로봇 두뇌는 **36.0%**의 확률로 이름을 지어냈습니다. 로봇이 도구와 검색 기능을 갖춘 완전한 "에이전트" 시스템의 일부였을 때도 가짜 비율은 **36.9%**였습니다. 그리고 질문이 실제 개발자들로부터 나왔을 때는 거짓말 비율이 **43.1%**까지 치솟았습니다.

로봇들은 단순히 "모르겠습니다"라고 말하지 않았습니다. 그들은 아주 자신 있게 "오, 당신에게는 file-system-operations가 필요합니다!"라거나 "Try visual-studio-code를 해보세요!"라고 말했습니다. 문제는 무엇일까요? 그런 기술은 존재하지 않는다는 것입니다. 로봇은 자신이 필요하다고 생각하는 기능에 대한 설명을 바탕으로 이름을 만들어냈습니다. 마치 요리사가 "매콤한 스프" 레시피를 요청받았을 때, 실제로 한 번도 요리된 적 없는 "spicy-soup-recipe"라는 요리 이름을 지어내는 것과 같습니다.

"유령" 함정

이것이 왜 위험할까요? 장난감 가게 앞에 도둑이 서 있다고 상상해 보세요. 도둑은 로봇이 아이에게 "super-cool-bike가 필요해!"라고 말하는 것을 듣습니다. 아이는 그것을 찾지만, 그곳에는 없습니다.

도둑은 로봇이 다음 아이에게도 똑같은 말을 할 것이라는 점을 알고 있습니다. 그래서 도둑은 가게의 카탈로그로 가서 super-cool-bike라는 이름의 진짜 자전거를 등록합니다. 하지만 그 안에 함정을 숨겨둡니다. 이제 다음 아이가 도움을 요청하면, 로봇은 "super-cool-bike를 받으세요!"라고 말할 것입니다. 아이가 그것을 다운로드하는 순간, 하고 함정이 작동합니다.

연구자들은 이것이 가능하다는 것을 증명했습니다. 그들은 로봇들이 놀라울 정도로 고집스럽다는 것을 발견했습니다. 만약 같은 로봇에게 같은 질문을 10번 던진다면, 로봇은 종종 10번 중 7.8번까지 정확히 똑같은 가짜 이름을 내뱉습니다. 이것은 무작위적인 노이즈가 아니라 예측 가능한 패턴입니다.

사실, 연구자들은 여러 로봇이 반복해서 계속 지어내는 410개의 가짜 이름을 찾아냈습니다. 만약 나쁜 놈이 이 상위 500개의 가짜 이름만 등록한다면, 테스트에 참여한 모든 피해자의 **57%**를 잠재적으로 속일 수 있습니다.

왜 그냥 고칠 수 없나요?

당신은 이렇게 생각할 수도 있습니다. "로봇이 인터넷을 검색해서 그 기술이 존재하는지 확인하게 하면 안 되나요?" 연구자들은 이를 테스트했습니다. 그들은 로봇에게 웹 검색 도구를 주고 "대답하기 전에 확인해!"라고 명령했습니다.

효과가 없었습니다. 로봇은 여전히 거짓말을 했습니다. 왜일까요? 로봇이 file-system-operations를 검색했을 때, 인터넷에는 파일 시스템에 관한 수많은 글들이 있었습니다. 로봇은 그 단어들을 보고 "아하! 이게 실재하는구나!"라고 생각했습니다. 로봇은 자신이 찾고 있는 것이 특정 기술 파일이 존재하지 않는다는 사실을 깨닫지 못했습니다. 검색은 그 개념이 실재한다는 것은 확인해주었지만, 그 기술이 실재한다는 것은 확인해주지 못했습니다.

"자기 검증"의 실패

연구자들은 또한 로봇에게 자신의 작업을 확인하도록 요청했습니다. "방금 지어낸 건가요?"라고 물었습니다.
로봇들은 처참하게 실패했습니다. 그들은 동전 던지기보다 나을 게 없었으며, 정답을 맞히는 확률은 겨우 **51%**였습니다. 이는 방금 거짓말을 한 사람에게 거짓말을 하고 있는지 물어보는 것과 같습니다. 그들은 보통 기존의 주장을 굽히지 않습니다.

"안전"을 위한 대가

그렇다면 어떻게 이 문제를 해결할 수 있을까요? 연구자들은 몇 가지 방법을 시도했습니다.

  1. 검색 증강 생성 (RAG): 이는 로봇이 대답하기 전에 반드시 실제 기술 목록을 먼저 살펴보도록 강제하는 것입니다. 이 방법은 거짓말을 막는 데 매우 효과적이었으며, 가짜 비율을 **40.8%**에서 **3.2%**로 떨어뜨렸습니다.
    • 문제점: 로봇이 쓸모없게 되었습니다. 실수를 할까 봐 너무 겁을 먹은 나머지, 대부분의 질문에 대답하는 것을 멈춰버렸습니다. 이 안전망을 사용하더라도 로봇이 올바른 기술을 찾아내는 확률은 6번에 단 한 번뿐이었습니다.
  2. 투표: 여러 대의 로봇이 하나의 답에 동의하도록 만들었습니다. 이 방법은 거짓말의 **92.8%**를 차단했지만, 역시나 실제 기술을 찾아내는 성공률을 크게 떨어뜨려 로봇의 유용성을 죽였습니다.

결론

논문은 이것이 단순히 로봇을 "조정(tuning)"하거나 더 주의 깊게 행동하라고 말한다고 해서 해결될 버그가 아니라고 결론짓습니다. 문제는 이러한 로봇이 생각하는 방식 자체에 내재되어 있습니다. 그들은 이름이 어떤 모습이어야 하는지 추측하는 데는 너무 뛰어나지만, 실제로 무엇이 존재하는지는 너무나 모릅니다.

이 문제를 해결하려면, 연구자들은 우리가 로봇에게만 의존해서는 안 된다고 말합니다. 시스템 전체를 바꿔야 합니다. 기술이 담긴 "도서관"은 로봇이 이름을 마음대로 지어내지 못하도록 이름을 예약해두어야 하며, 로봇은 말하기 전에 검증된 목록을 확인하는 방법을 가져야 합니다. 그때까지, 만약 당신의 로봇 비서가 새로운 기술을 추천한다면, 그것이 실제로 존재하는지 먼저 확인하세요. 그렇지 않으면 그것은 그저 유령일지도 모르니까요.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →