← 최신 논문
💬 NLP

Large Language Model Selection with Limited Annotations

본 논문은 쌍별 모델 출력 유사성에서 도출된 기대 정보 이득을 활용하여 주석 달기를 위한 최소한의 쿼리 세트를 능동적으로 선택하는 새로운 프레임워크인 SELECT-LLM 을 소개하며, 이를 통해 모델 가중치에 대한 접근 없이도 주어진 작업에 대한 최상의 대규모 언어 모델을 효과적으로 식별하면서 평가 비용을 크게 절감합니다.

원저자: Yavuz Durmazkeser, Patrik Okanovic, Andreas Kirsch, Torsten Hoefler, Nezihe Merve Gürel

게시일 2026-05-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yavuz Durmazkeser, Patrik Okanovic, Andreas Kirsch, Torsten Hoefler, Nezihe Merve Gürel

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

특정 직무에 완벽한 직원을 채용하려는 채용 담당자라고 상상해 보세요. 여러분에게는 156 명의 지원자 풀 (이들은 대규모 언어 모델, 즉 LLM 들입니다) 이 있습니다. 모두 똑똑하다는 것은 알지만, 여러분의 특정 작업에 실제로 가장 뛰어난 지원자가 누구인지는 모릅니다.

보통 이를 파악하기 위해 모든 지원자에게 100 문항의 완전한 시험을 치르게 한 다음, 비싼 인간 전문가 팀을 고용해 모든 답변을 채점합니다. 이는 느리고, 비싸며, 진이 빠지는 과정입니다.

이 논문은 SELECT-LLM이라는 새로운 방법을 소개합니다. 이는 지원자들에게 100 문항 대신 아마도 5 개 또는 10 개에 불과한 시험의 아주 작은 부분만 치르게 함으로써 최고의 지원자를 찾아낼 수 있는 초지능 채용 보조원처럼 작동합니다.

간단한 비유를 들어 작동 방식을 설명해 보겠습니다:

문제: "눈가리개 맛 평가"

156 명의 다른 셰프 (AI 모델들) 가 있고, 그중에서 최고의 피자를 만드는 셰프를 찾고 싶다고 상상해 보세요.

  • 기존 방식: 모든 셰프에게 피자를 100 개씩 만들게 합니다. 그리고 100 명의 음식 평론가를 고용해 모든 피자를 맛보고 보고서를 작성하게 합니다. 이는 시간과 돈 측면에서 천문학적 비용이 듭니다.
  • 무작위 방식: 셰프들에게 피자를 5 개만 만들게 하되, 그 5 개 질문을 무작위로 선택합니다. 어쩌면 모든 5 명의 셰프가 치즈 피자는 훌륭하지만 페페로니 피자는 형편없을 수도 있습니다. 단순히 운이 나빠서 잘못된 승자를 선택할 수 있습니다.

해결책: SELECT-LLM ("지능형 퀴즈")

SELECT-LLM 은 정확히 어떤 질문이 진실을 드러낼지 아는 탐정처럼 작동합니다. 단순히 무작위 질문을 선택하는 것이 아니라, 가장 정보 가치가 높은 질문들을 선택합니다.

단계별 과정은 다음과 같습니다:

  1. 준비: 잠재적 질문들의 "풀" (시험 은행) 과 후보 모델 목록을 가지고 있습니다.
  2. 추측 게임: 시스템은 인간이 채점할 필요도 없이 모든 모델이 질문에 답했을 때 무엇이라고 말할지를 살펴봅니다.
  3. "불일치" 감지기: 시스템은 이렇게 질문합니다: "이 질문을 한다면, 상위 후보들이 매우 다른 답변을 내놓을까?"
    • 모든 상위 셰프가 정확히 같은 답변을 내놓는다면, 그 질문은 그들을 구별하는 데 그리 유용하지 않습니다.
    • 최고의 셰프들이 매우 다른 답변을 내놓는다면, 그 질문은 황금과 같은 것입니다. 그 질문이 실제로 누가 가장 뛰어난지 파악하는 데 도움이 될 것입니다.
  4. 선택: 시스템은 그 "황금" 질문을 선택하고, 인간 전문가 ( "오라클") 에게 그 하나의 답변만 채점하게 합니다.
  5. 업데이트: 그 단일 채점 결과를 바탕으로 시스템은 셰프들의 순위를 업데이트합니다. "아, 셰프 A 는 그걸 맞혔지만 셰프 B 는 틀렸군. 셰프 A 가 이제 승자일 가능성이 더 높아졌어"라고 말할 수 있습니다.
  6. 반복: 남은 상위 경쟁자들 사이에서 가장 많은 "불일치"를 유발할 다음 질문을 항상 선택하며 이 과정을 반복하다가, 승자를 선택하기에 충분히 확신이 생길 때까지 진행합니다.

이것이 왜 중요한가요?

이 논문은 수학, 뉴스 요약, 언어 번역, 과학 질문 답변 등 23 가지 다른 유형의 작업과 156 개의 서로 다른 AI 모델을 대상으로 이 방법을 테스트했습니다.

  • 결과: SELECT-LLM 은 다음으로 좋은 방법보다 최대 84% 적은 인간 채점을 사용하여 최고의 모델을 찾았습니다.
  • 비유: 100 명의 평론가가 100 개의 피자를 맛보게 하는 대신, 이 방법은 동일한 승자를 찾기 위해 아마도 15 명의 평론가가 15 개의 피자만 맛보게 하면 될지도 모릅니다.

주요 특징

  • "블랙박스" 친화적: AI 모델이 내부적으로 어떻게 구축되었는지 (코드나 가중치 등) 알 필요가 없습니다. 그들이 무엇을 말하는지만 보이면 됩니다. 이는 오픈소스 모델과 API 를 통해 비용을 지불하는 비싼 폐쇄형 상용 모델 모두에서 작동합니다.
  • 모델 중립적: 모델이 크거나 작거나, 어떤 언어를 구사하는지 상관없습니다. 단지 답변들의 유사성만 살펴보면 됩니다.
  • 안전함: 절대적인 1 등 모델을 선택하지 못하더라도, 거의 항상 최상위 모델에 매우 근접한 모델을 선택하므로 끔찍한 결과로 이어지지 않습니다.

요약

SELECT-LLM 은 불필요한 테스트에 돈을 낭비하지 않도록 하는 지능적인 전략입니다. 모든 AI 에게 전체 시험을 치르게 하고 인간이 모두 채점하게 하는 대신, 슈퍼스타 모델을 빠르게 식별할 수 있는 딱 필요한 몇 가지 질문만 던집니다. 이는 거대하고 비싼 탐색을 빠르고 효율적인 사냥으로 바꿉니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →