← 최신 논문
💬 NLP

CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks

CoEval은 레이블이 지정된 데이터가 필요하지 않거나 공개 벤치마크를 신뢰할 필요 없이, 커스텀 태스크를 위해 언어 모델을 안정적으로 순위 매기기 위해 오염되지 않고 속성이 제어된 벤치마크를 생성하고 다양한 앙상블 판별 모델을 채택하는 오픈 소스 프레임워크입니다.

원저자: Alexander Apartsin, Yehudit Aperstein

게시일 2026-06-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Alexander Apartsin, Yehudit Aperstein

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 구체적인 직무, 예를 들어 "혼란스러운 창고 정리하기"나 "원예에 관한 재미있는 농담 쓰기"와 같은 일을 수행할 최고의 직원을 뽑으려는 채용 담당자라고 상상해 보십시오. 당신에게는 한 가지 문제가 있습니다. 과거의 성과 검토 데이터(레이블이 지정된 데이터)가 없으며, 다른 사람들이 사용하는 표준 테스트(공개 벤치마크)는 후보자들이 미리 공부해서 답을 다 외워버렸기 때문에 무용지물이라는 점입니다.

이것이 바로 CoEval이 해결하는 문제입니다. CoEval은 인간 전문가의 채점 없이도, 또한 부정행위를 걱정할 필요 없이도, 당신의 특정 요구에 맞춰 AI 모델의 순위를 매길 수 있도록 돕는 새로운 오픈 소스 도구입니다.

작동 방식은 다음과 같이 쉬운 비유로 나누어 설명할 수 있습니다.

1. "새로운 시험" 생성기 (부정행위 방지)

보통 AI 모델들은 수년 동안 존재해 온 오래된 테스트(SAT나 GRE 같은)를 치릅니다. 이러한 테스트들이 매우 대중적이기 때문에, AI 모델들은 훈련 과정에서 질문들을 이미 보았을 가능성이 높고 단순히 답을 암기했을 것입니다. 이는 수학을 배우는 대신 정답지를 통째로 외운 학생과 같습니다.

CoEval은 게임의 판도를 바꿉니다. 오래된 질문을 사용하는 대신, 오직 당신의 작업 설명만을 바탕으로 "교사 AI"를 사용하여 즉석에서 완전히 새로운 질문을 만들어냅니다.

  • 비유: 학생이 교실에 있는 동안 수학 시험 문제를 만드는 선생님을 상상해 보십시오. 질문이 그 순간까지 존재하지 않았기 때문에 학생은 답을 외울 수 없습니다.
  • 결과: 이 논문은 이 새로운 질문들이 100% 신선하다는 것을 증명합니다. 주요 공개 테스트 뱅크와 13개 단어 이상의 문구가 하나도 겹치지 않으므로, AI가 과거의 데이터를 회상하여 부정행위를 할 수 없습니다.

2. 심판들의 "배심원단" (숫자보다 다양성)

AI 모델들이 이 신선한 질문들에 답하고 나면, 누군가는 이를 채점해야 합니다. 아주 똑똑한 AI 한 명에게 채점을 맡길 수도 있겠지만, 이는 위험 요소가 있습니다. 단일 심판은 긴 답변을 짧은 좋은 답변보다 선호하거나, 자신의 모델 계열과 유사한 답변을 선호하는 것과 같은 기이한 편향을 가질 수 있기 때문입니다.

CoEval은 "배심원단" 접근 방식을 사용합니다. 서로 다른 회사(예: OpenAI, Anthole, Google 등)에서 온 소수의 심판 그룹을 모읍니다.

  • 비유: 법정을 생각해 보십시오. 만약 까칠하기로 유명한 판사 한 명만 있다면 판결이 불공정할 수 있습니다. 하지만 서로 다른 배경을 가진 세 명의 배심원이 있다면, 그들의 개인적인 특성은 서로 상쇄됩니다. 한 심판은 긴 답변을 좋아하고 다른 심판은 싫어한다면, 그 평균 점수는 공정해집니다.
  • 중요한 발견: 논문은 배심원이 얼마나 많은가보다 누구인가가 더 중요하다는 것을 발견했습니다. 같은 회사의 심판을 더 많이 추가하는 것은 그들의 공유된 편향을 증폭시킬 뿐입니다. 사실, 단일 심판은 때때로 "역상관 관계"(틀린 답을 내놓음)를 보일 수 있지만, 다양한 배심원단은 거의 그러지 않습니다.

3. "사람 없는" 공장

보통 좋은 테스트를 만들려면 질문을 쓰고 답을 채점할 사람이 필요합니다. 이는 느리고 비용이 많이 듭니다.

  • 비유: CoEval은 완전히 자동화된 공장과 같습니다. 당신이 설계도(작업에 대한 설명)를 주면, 시스템은 자동으로 다음을 수행합니다:
    1. 테스트 질문을 설계합니다.
    2. AI 후보자들이 테스트를 치르게 합니다.
    3. 다양한 배심원단을 구성하여 답을 채점하게 합니다.
    4. 최종 순위를 산출합니다.
  • 비용: 저자들은 커피 한 잔 값($5.89)으로 거의 8,000회의 평가를 수행하는 거대한 연구를 진행했습니다. 너무 저렴해서 새로운 AI 모델이 나올 때마다 새로운 테스트를 실행할 수 있을 정도입니다.

4. 이것이 왜 중요한가

논문은 "정답"이 존재하지 않는 세 가지 실제 시나리오에서 CoEval을 테스트했습니다:

  • 약물 상호작용: 두 약물이 충돌하는지 여부를 파악함.
  • 임상 추론: 환자의 증상을 진단함.
  • 법률 분석: 법률을 해석함.

이러한 분야에는 표준적인 "골드 스탠다드(표준 정답)" 테스트가 없습니다. CoEval은 모델들의 순위를 성공적으로 매겼으며, 어떤 모델이 이 특정 작업들에 가장 적합한지를 보여주었습니다. 심지어 단일 편향된 심판이라면 놓쳤을 수도 있는, 더 작은 규모의 저렴한 모델이 더 큰 모델보다 실제로 더 나쁘다는 사실까지 잡아냈습니다.

핵심 요약

CoEval은 이렇게 말합니다: "오래되어 암기된 테스트를 믿지 마십시오. 편향될 수 있는 단일 심판에게 의존하지 마십시오. 대신, 당신의 특정 직무를 위한 신선한 테스트를 생성하고, 다양한 소규모 팀의 AI 심판들이 이를 채점하게 하십시오."

이 도구는 복잡하고 비용이 많이 드는 AI 테스트 과정을, 누구나 자신의 특정 요구에 맞는 적절한 AI를 찾을 수 있도록 저렴하고 반복 가능하며 공정한 프로세스로 바꿔 놓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →