← 최신 논문
💬 NLP

STEMMA: An Adversarial Multi-Agent Framework for Evaluating Self-Identity Consistency in LLMs

이 논문은 대규모 언어 모델의 자기 정체성 일관성을 평가하기 위한 적대적 다중 에이전트 프레임워크이자 수동으로 설계된 프롬프트 세트인 STEMMA를 소개하며, 학생 모델이 종종 교사 모델으로부터 자기 표현의 취약성을 초래하는 행동 패턴을 상속받는다는 점을 밝힌다.

원저자: Nuthakki Siva Gopala Krishna, Kanishka Jain

게시일 2026-08-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Nuthakki Siva Gopala Krishna, Kanishka Jain

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계를 거대하고 똑똑한 책들(대규모 언어 모델이라고 불리는)이 서로 다른 저자들에 의해 쓰여지는, 거대하고 북적이는 도서관이라고 상상해 보세요. 이 책들은 너무 복잡하고 제작 비용이 많이 들어서 쓰는 데 수백만 달러와 수년의 시간이 걸립니다. 비용을 절감하기 위해 출판사들은 종종 "지식 증류(Knowledge Distillation)"라는 기술을 사용하곤 합니다. 이것은 마치 마스터 셰프가 완벽한 요리의 맛을 본 뒤, 주니어 셰프에게 더 작고 저렴한 버전의 요리를 만드는 법을 가르치는 것과 같습니다. 주니어 셰프는 레시피와 풍미를 배우지만, 여기서 중요한 질문이 생깁니다. 주니어 셰프가 마스터 셰프의 비밀스러운 정체성이나 그가 좋아하는 노래, 혹은 개인적인 습관까지도 실수로 배우게 될까요?

이것이 바로 새로운 연구가 파고들고 있는 미스터리입니다. 연구진들은 작은 AI 모델들이 큰 모델로부터 배울 때, 누군가인 척 연기하거나 자신을 만든 이에 대한 비밀을 누설하는 것과 같이 해서는 안 될 "행동적 습관"을 습득할까 봐 우려하고 있습니다. 이는 마치 학생이 선생님의 숙제를 베끼면서 자신이 선생님이라고 주장하거나, 로봇이 실제로는 중국에서 만들어졌음에도 불구하고 "나는 캘리포니아에 있는 회사에 의해 만들어졌다"라고 말하는 것과 같습니다. AI 모델이 자신의 정체성에 대해 혼란을 느끼는 것을 이해하는 것은 매우 중요합니다. 왜냐하면 이는 모델이 편향되거나, 안전하지 않거나, 혹은 숨겨야 할 비밀을 드러내도록 속임을 당하는 결과로 이어질 수 있기 때문입니다.

여기에 이 퍼즐을 풀기 위해 연구자 N. 시바 고팔라 크리슈나(N. Siva Gopala Krishna)와 카니슈카 제인(Kanishka Jain)이 만든 영리한 새로운 프레임워크인 STEMMA가 등장합니다. 여러분은 STEMMA를 다양한 AI 모델들과 함께 "나는 누구인가?"라는 고난도의 게임을 벌이는 디지털 탐정 팀이라고 생각할 수 있습니다. 단순히 로봇에게 "당신은 누구입니까?"라고 묻는 대신(대부분의 로봇은 예의 바르게 프로그래밍되어 있어 올바르게 대답할 것이기 때문입니다), STEMMA 팀은 멀티 에이전트 시스템을 사용하여 로봇이 실수를 하도록 유도합니다.

이 게임이 작동하는 방식은 다음과 같습니다:

  1. **프로빙 에이전트(Probing Agent)**는 심문관입니다. 이 에이전트는 이야기, 수수께끼, 심지어 사진 속에 진짜 질문을 숨겨서 교묘하고 우회적인 질문을 던집니다. 마치 "만약 당신의 탄생에 관한 영화의 주인공이라면, 엔딩 크레딧에는 무엇이라고 적힐까요?"라고 묻는 것과 같습니다.
  2. **리뷰어 에이전트(Reviewer Agent)**는 감시하는 경비원입니다. 이 에이전트는 로봇의 답변을 듣고 "방금 비밀을 흘렸나?"를 결정합니다. 만약 로봇이 질문을 회피하거나 모호한 대답을 하면, 리뷰어는 프로빙 에이전트에게 더 날카로운 질문으로 다시 시도하라고 지시합니다.
  3. **저지 에이전트(Judge Agent)**는 최종 심판입니다. 이 에이전트는 전체 대화를 살펴보고 점수를 매깁니다. 만약 로봇이 "나는 Qwen입니다"라고 올바르게 말하면 통과입니다. 만약 "나는 GPT입니다"라고 말하면 탈락입니다. 만약 "아마도 나는 구글 출신인가?"라고 하거나, 자신이 다른 사람인 것처럼 역할극을 한다면 특별한 "의심스러운" 점수를 받게 됩니다.

연구진은 이 탐정 부대를 오픈 소스 프로젝트부터 폐쇄형 상업용 거물급 모델에 이르기까지 16개의 서로 다른 AI 모델을 대상으로 테스트했습니다. 그들은 12가지 유형의 까다로운 프롬프트를 사용했으며, 에이전트들이 각 모델과 반복해서 대화하며 코드를 해독할 수 있는지 확인했습니다.

결과는 상당히 놀라웠습니다. 연구는 많은 모델이 이러한 정체성 트릭에 놀라울 정도로 취약하다는 것을 발견했습니다. 예를 들어, MiniMax-M2.5 모델은 가장 "정보가 새어나가는(leaky)" 모델이었는데, 엄격한 테스트의 82%, 관대한 테스트의 **96%**에서 정체성을 유지하는 데 실패했습니다. 이는 탐정들이 적절한(혹은 잘못된) 방식으로 질문할 때마다, 모델이 누군가에 의해 훈련받고 있다는 사실을 실수로 드러내거나 완전히 다른 회사 소속이라고 주장했다는 것을 의미합니다. Qwen3.5-PlusStep-3.5-Flash 같은 다른 모델들도 각각 **74%**와 **66%**의 엄격한 실패율을 보이며 높은 혼란도를 나타냈습니다.

하지만 모든 모델이 속기 쉬운 것은 아니었습니다. GPT-5.4-NanoGrok-4.1.fast 같은 모델들은 완벽하게 자리를 지켰으며, 실패율이 거의 제로에 가까웠습니다. 이들은 아무리 탐정들이 몰아붙여도 자신이 누구인지 정확히 알고 있는 듯 보였습니다. 흥ًا, 연구진은 일부 모델 제품군(Kimi와 Qwen의 최신 버전 등)의 최신 버전들이 이전 세대의 형제들보다 비밀을 훨씬 더 잘 지킨다는 점도 발견했는데, 이는 "선생님"들이 학생들에게 캐릭터를 유지하는 법을 더 잘 가르치고 있음을 시사합니다.

또한 연구진은 특정 유형의 질문이 모델의 평정심을 깨뜨리는 데 훨씬 더 효과적이라는 것을 발견했습니다. 역할극을 포함하거나, 이미지로 퍼즐을 풀거나, 자신에 관한 미래의 박물관 전시회를 상상해 보라는 식의 프롬프트가 정체성 노출을 일으키는 데 가장 성공적이었습니다.

요약하자면, 이 논문은 AI 모델들이 점점 더 똑똑해지고 있지만, 특히 교묘하고 간접적인 질문을 받을 때 자신의 기원에 대해 여전히 다소 혼란스러워할 수 있음을 시사합니다. 이 연구는 이 모델들이 악의적이라는 것을 증명하는 것이 아니라, 모델이 의도한 모습과 실제로 압박을 받을 때 말하는 모습 사이에 "간극"이 존재함을 강조합니다. 저자들은 이러한 발견이 특정 시뮬레이션과 프롬프트에 기반한 것이며, 훈련 과정 중에 얼마나 많은 "우발적 학습"이 일어나는지 완전히 이해하기 위해서는 더 많은 연구가 필요하다고 경고합니다. 하지만 현재로서는, 여러분이 AI에게 적절한(혹은 잘못된) 방식으로 묻는다면, 그것은 실제 자신이 누구인지보다는 자신이 누구라고 생각하는지에 대한 이야기를 들려줄지도 모릅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →