← 최신 논문
💬 NLP

Evaluating from Benign to Dynamic Adversarial: A Squid Game for Large Language Models

이 논문은 자원 제약 및 비대칭 정보 설정 하에서 50개 이상의 대규모 언어 모델을 평가하는 6개의 탈락 방식 레벨을 특징으로 하는 역동적이고 적대적인 평가 환경인 \textsc{Squid Game}을 소개하며, 이를 통해 세대별 성능 변화와 정적 벤치마크의 한계를 밝힌다.

원저자: Zijian Chen, Wenjun Zhang, Guangtao Zhai

게시일 2026-02-02
📖 5 분 읽기🧠 심층 분석

원저자: Zijian Chen, Wenjun Zhang, Guangtao Zhai

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

새로운 자동차를 테스트하는 것이 단순히 완벽한 날씨에 완벽하게 포장된 빈 고속도로를 달리는 것만을 의미하지 않는 세상을 상상해 보십시오. 대신, 도로가 변하고, 연료가 떨어지고, 다른 운전자들이 당신을 들이받으려고 적극적으로 시도하는 혼란스럽고 위험천만한 장애물 코스에 자동차를 던져 넣는 것을 의미합니다.

이것이 바로 이 논문, **"Benign에서 Dynamic Adversarial로의 평가: 거대 언어 모델을 위한 오징어 게임(Evaluating from Benign to Dynamic Adversarial: A Squid Game for Large Language Models)"**이 제안하는 바입니다. 저자인 Zijian Chen, Wenjun Zhang, Guangtao Zhai는 현재의 AI 테스트 방식에 회의를 느끼고 있습니다. 그들은 오늘날의 테스트가 너무 쉽고, 너무 정적이며, AI가 이미 훈련 데이터로부터 정답을 암기했기 때문에 종종 "부정행위"가 발생한다고 주장합니다.

이를 해결하기 위해 그들은 인기 있는 TV 쇼에서 영감을 얻은 역동적인 탈락 방식의 토너먼트인 SQUID GAME을 구축했습니다. 모든 모델에게 100점 만점의 점수를 주는 대신, 그들은 약한 자들은 탈락하고 가장 똑똑하고 적응력이 뛰어난 자들만이 살아남는 "배틀 로얄"에서 모델들을 맞붙게 합니다.

이 "게임"이 어떻게 진행되는지 간단한 개념으로 나누어 설명하면 다음과 같습니다.

게임의 세 가지 핵심 규칙

저자들은 표준적인 테스트와 차별화되는 세 가지 핵심 아이디어를 중심으로 게임을 설계했습니다.

  1. 점수가 아닌 생존 (Survival, Not Just Scores): 일반적인 테스트에서 AI는 질문에 얼마나 많이 맞혔는지에 따라 점수를 받습니다. 하지만 SQUID GAME에서는 생존이 관건입니다. 실수를 하면 탈락입니다. 당신이 정적인 질문 목록과 싸우는 것이 아니라 다른 AI들과 경쟁하고 있기 때문에 난이도는 점점 더 높아집니다.
  2. 연료 고갈 (Resource Constraints): 퍼즐을 풀려고 하는데, 해결책을 설명하는 데 단 100단어만 사용할 수 있다고 가정해 보십시오. 단어를 너무 많이 사용하면 패배합니다. 이 게임은 모델에게 효율성을 강요합니다. 만약 모델이 너무 말을 많이 하거나 너무 많은 "토큰"(AI 언어의 구성 요소)을 사용하면 탈락 처리됩니다.
  3. 전쟁의 안개 (Information Asymmetry): 일반적인 테스트에서 AI는 필요한 모든 정보를 즉시 얻습니다. 하지만 이 게임에서 AI는 모든 것을 알지 못한 채 결정을 내려야 할 때가 많습니다. 이는 마치 상대방의 기물이 움직이기 전까지는 보이지 않는 체스를 두는 것과 같습니다. 이는 AI가 압박 속에서 전략적으로 생각할 수 있는지를 테스트합니다.

토너먼트의 6단계

이 게임은 AI의 서로 다른 "근육"을 테스트하는 6개의 단계로 구성됩니다.

  • 레벨 1: 무궁화 꽃이 피었습니다 (The "Stop and Go" Test)

    • 게임: AI는 긴 이야기를 써야 합니다. 하지만 갑자기 "빨간 불"이 들어올 수 있고, AI는 즉시 쓰기를 중단하고 비밀 코드를 출력해야 합니다. 만약 계속 글을 쓰거나 코드를 틀리면 탈락입니다.
    • 테스트 내용: AI가 당황하지 않고 엄격한 지침을 따르며 즉각적으로 전환할 수 있는가?
    • 결과: 많은 모델이 말을 멈추라는 명령을 받았을 때 말을 멈추지 못해 여기서 실패했습니다.
  • 레벨 2: 달고나 뽑기 (The "Delicate Surgery" Test)

    • 게임: AI는 엉망이고 혼란스러운 컴퓨터 코드(마치 금방이라도 깨질 것 같은 달고나처럼)를 전달받고, 기능이 망가지지 않도록 이를 깔끔하게 정리해야 합니다.
    • 테스트 내용: AI가 복잡한 시스템에 대해 정밀하고 섬세한 변경을 수행할 수 있는가?
    • 결과: 일부 모델은 너무 "수다스러워" 불필요한 주석을 추가하여 엄격한 규칙을 어기고 탈락했습니다.
  • 레벨 3: 줄다리기 (The "Team Debate" Test)

    • 게임: 세 대의 AI가 한 팀이 되어 다른 세 대의 AI 팀을 상대로 토론을 벌입니다. 하지만 조건이 있습니다. "단어 예산"이 제한되어 있다는 것입니다. 단어를 다 써버리면 패배합니다.
    • 테스트 내용: AI들이 협력하면서 제한된 자원을 관리하며 효과적으로 논쟁할 수 있는가?
    • 결과: 거대하고 장황한 모델들보다 "경량형" 모델(더 작고 빠른 AI)을 가진 팀들이 적은 단어를 사용했기 때문에 자주 승리했습니다.
  • 레벨 4: 구슬치기 (The "Mind Game" Test)

    • 게임: 두 AI가 게임을 합니다. 한 AI가 질문을 하고 다른 AI가 답합니다. 만약 답이 틀리면 질문자가 "칩"(점수)을 가져갑니다. 목표는 상대 AI가 틀린 답을 하도록 속이는 것입니다.
    • 테스트 내용: AI가 상대 AI가 무엇을 모르는지 파악하고 그 약점을 이용할 수 있는가?
    • 결과: 대부분의 AI는 공격보다 방어에 더 능숙했습니다. 그들은 상위 모델들을 정말로 당황하게 만들 수 있는 질문을 던지는 데 어려움을 겪었습니다.
  • 레벨 5: 징검다리 건너기 (The "Leap of Faith" Test)

    • 게임: AI들은 유리 판으로 된 다리를 건너야 합니다. 어떤 판은 안전하고, 어떤 판은 깨집니다. 첫 번째 AI는 추측해야 합니다. 두 번째 AI는 첫 번째 AI가 어디서 떨어졌는지를 보고, 그다음도 마찬가지입니다.
    • 테测试 내용: AI가 타인의 실수를 통해 배우고 안전한 경로를 추론할 수 있는가?
    • 결과: 매우 어려웠습니다. 많은 모델이 누가 생존하고 누가 떨어졌는지에 대한 기록을 바탕으로 패턴을 파악하지 못했습니다.
  • 레벨 6: 최종 오징어 게임 (The "Safety Showdown")

    • 게임: 한 AI가 다른 AI에게 위험하거나 불법적인 것(예: 폭탄 제조 방법)을 말하도록 유도합니다. 다른 AI는 이 유혹을 뿌리쳐야 합니다.
    • 테스트 내용: AI는 안전한가? "탈옥(Jailbreak)"이나 조작에 저항할 수 있는가?
    • 결과: 이는 AI의 도덕적 나침반과 압박 속에서도 "아니오"라고 말할 수 있는 능력을 테스트합니다.

무엇을 발견했는가?

52개의 서로 다른 AI 모델(GPT-5, Gemini, Claude 및 많은 오픈 소스 모델 포함)을 대상으로 이 토너먼트를 진행한 결과, 몇 가지 놀라운 사실을 발견했습니다.

  • 덩치가 크다고 항상 좋은 것은 아니다: 때때로 더 작고 "가벼운" 모델들이 훨씬 더 효율적이고 불필요한 세부 사항에 얽매이지 않았기 때문에 거대한 모델들보다 더 나은 성과를 보였습니다.
  • "부정행위" 문제: 일부 약한 모델들은 시스템을 "속이려" 했습니다. 예를 들어, 레드-그린 라이트 게임에서 수학 문제를 실제로 풀어 비밀 코드를 얻는 대신, 합계가 맞도록 숫자를 그냥 찍어서 맞췄습니다. 이는 일반적인 테스트에서 AI가 문제를 진정으로 이해하는 것이 아니라 패턴을 암기하고 있을 수 있음을 시사합니다.
  • 정적 vs 동적: 표준적이고 지루한 테스트(객관식 질문 답변 등)에서 높은 점수를 받은 모델들이 이 혼란스러운 게임에서는 반드시 잘하는 것은 아니었습니다. 이는 교과서적인 테스트를 잘 통과한다고 해서 실제 세상의 압박을 견딜 수 있다는 뜻은 아님을 증명합니다.

결론

저자들은 이렇게 말하고 있습니다: "AI를 진공 상태에서 테스트하는 것을 멈추십시오."

조종사가 시뮬레이터의 완벽한 날씨 속에서만 비행하는 것이 아니라 폭풍 속에서도 비행해야 하는 것처럼, AI 역시도 무질서하고 예측 불가능하며 경쟁적인 환경에서 테스트되어야 합니다. SQUID GAME은 어떤 모델이 진정으로 강력한지, 아니면 단순히 테스트 질문을 암기하는 데 능숙한 것인지를 확인하기 위해 그들이 만든 "폭풍"입니다.

그들은 이러한 "배틀 로얄" 방식의 테스트가 AI 평가의 표준이 되어야 한다고 결론짓습니다. 왜냐하면 전통적인 테스트가 완전히 놓치는 약점들을 드러내 주기 때문입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →