← 최신 논문
💻 computer science

EvoLM: Self-Evolving Language Models through Co-Evolved Discriminative Rubrics

이 논문은 외부 인간 또는 모델 감독 없이도 우수한 결과를 달성할 수 있도록 언어 모델이 인스턴스별 판별 기준을 생성하고 이러한 기준을 보상으로서 활용하여 정책 성능을 최적화하는 과정을 반복함으로써 점진적으로 개선할 수 있게 하는 자기지도형 사후 학습 방법인 EvoLM 을 소개합니다.

원저자: Shuyue Stella Li, Rui Xin, Teng Xiao, Yike Wang, Rulin Shao, Zoey Hao, Melanie Sclar, Sewoong Oh, Faeze Brahman, Pang Wei Koh, Yulia Tsvetkov

게시일 2026-05-06
📖 3 분 읽기☕ 가벼운 읽기

원저자: Shuyue Stella Li, Rui Xin, Teng Xiao, Yike Wang, Rulin Shao, Zoey Hao, Melanie Sclar, Sewoong Oh, Faeze Brahman, Pang Wei Koh, Yulia Tsvetkov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

한 학생(정책 모델)에게 완벽한 에세이를 쓰는 법을 가르치려 한다고 상상해 보세요. 예전 방식에서는 엄격한 교사(인간 또는 초지능 AI)가 모든 에세이를 읽고, 점수를 매기고, 학생이 무엇을 잘못했는지 알려줘야 했습니다. 이는 비용이 많이 들고 느리며, 그 교사의 지능 수준에 제한을 받습니다.

EVOLM은 학생이 스스로 교사가 될 수 있게 하는 새로운 방법이지만, 교묘한 비틀기가 있습니다. 단순히 "좋은" 에세이가 어떤 모습일지 추측하는 대신, 학생은 자신이 쓰는 모든 에세이에 대해 **특정 체크리스트(루브릭)**를 작성하는 법을 배웁니다.

이 과정은 다음과 같은 간단한 단계로 나뉩니다:

1. 두 가지 역할: 작성자와 체크리스트 작성자

이 시스템에서 동일한 AI 모델이 동시에 두 가지 역할을 수행합니다:

  • 작성자 (정책): 이 부분은 질문에 대한 답변을 생성합니다.
  • 체크리스트 작성자 (루브릭 생성기): 이 부분은 질문을 보고 답변을 평가하는 구체적인 규칙 세트(루브릭)를 작성합니다.

요리사가 요리를 할 뿐만 아니라 요리를 한 에 그 요리를 왜 좋거나 나쁜지 정확히 설명하는 레시피 카드를 작성하는 것과 같다고 생각하세요.

2. "시간 여행" 피드백 루프

시스템이 체크리스트가 좋은지 어떻게 알까요? 인간이 "잘했다!"라고 말해줄 필요가 없습니다. 대신 시간 여행을 사용합니다.

  • 단계 A: AI 가 오늘 답변을 작성합니다.
  • 단계 B: 며칠 전에 작성한 답변(자신의 "이전 버전") 을 돌아봅니다.
  • 단계 C: AI 가 학습해 왔다고 가정하여 새로운 답변이 더 낫다고 가정합니다.
  • 단계 D: 체크리스트 작성자가 두 답변을 평가할 루브릭을 생성합니다.

목표는 간단합니다: 루브릭은 "새롭고 더 나은" 답변과 "오래되고 더 나쁜" 답변 사이의 차이를 명확히 구분할 수 있어야 합니다. 루브릭이 모호하면 차이를 발견하지 못합니다. 루브릭이 날카롭고 구체적이면 새로운 답변에는 높은 점수를, 오래된 답변에는 낮은 점수를 줄 것입니다.

3. 공진화 춤

이곳에서 마법이 일어납니다. 두 역할이 루프 속에서 서로를 번갈아 개선합니다:

  1. 작성자가 더 나아집니다: 체크리스트를 사용하여 작성자는 더 높은 점수를 받기 위해 더 나은 답변을 생산하는 법을 배웁니다.
  2. 체크리스트 작성자가 더 날카로워집니다: 작성자가 나아질수록 비교 대상이 되는 오래된 답변은 훨씬 더 나빠 보입니다. "좋음"과 "훌륭함" 사이의 차이를 계속 구분하기 위해 체크리스트 작성자는 더 구체적이고 더 상세한 규칙을 작성해야 합니다. 단순히 "문법이 좋다"라고 말할 수 없습니다. "문장은 도입구절 뒤에 쉼표를 사용해야 한다"라고 말해야 합니다.

시간이 지남에 따라 체크리스트는 "재미있게 만들어라"와 같은 모호한 레이블에서 "답변은 48 의 둘레에서 유도된 144 라는 숫자를 포함해야 한다"와 같은 구체적이고 검증 가능한 지시로 진화합니다.

4. "작은 심판" 트릭

보통 복잡한 에세이를 채점하려면 거대하고 초지능적인 AI 가 필요합니다. 하지만 EVOLM 은 실제 채점을 수행하는 **작고 고정된 AI(작은 심판)**를 사용합니다.

체크리스트 작성자가 " '혁신'이라는 단어가 두 번 나타나는지 확인하라"와 같이 매우 구체적이고 구체적인 규칙을 작성하는 법을 배웠기 때문에, 작고 단순한 AI 라도 지시를 완벽하게 따를 수 있습니다. 마치 어린아이가 매우 구체적인 보물 지도를 받는 것과 같습니다. 탐정이 될 필요는 없습니다. 지도만 따르면 됩니다.

이것이 왜 중요한가요?

  • 외부 교사 불필요: 이 시스템은 수천 편의 에세이를 채점하거나 비싼 AI API 비용을 지불할 인간이 필요하지 않습니다. 과거의 성과에서 자체적인 학습 신호를 생성합니다.
  • 한계 돌파: 인간 교사에 의존하면 AI 는 그 인간보다 더 나아질 수 없습니다. 특정 AI 교사에 의존하면 AI 는 그 교사의 수준에 갇힙니다. EVOLM 과 함께 AI 의 "교사"(루브릭) 는 AI 와 함께 진화하므로 한계는 계속 높아집니다.
  • 작동함: 해당 논문에 따르면, 이 자기 학습형 AI(80 억 개 파라미터를 가진 작은 모델을 사용) 는 실제로 규칙을 생성하는 데 GPT-4(훨씬 더 크고 비싼 모델) 를 사용한 시스템보다 더 나은 성과를 냈습니다.

요약하자면: EVOLM 은 AI 가 자체적인 상세 채점 루브릭을 작성하는 법을 배우는 자기 개선 루프입니다. 현재의 자신을 과거의 자신과 지속적으로 비교함으로써 점점 더 정밀한 규칙을 작성하도록 스스로를 압박하고, 이는 다시 인간이 개입할 필요 없이 더 나은 답변을 작성하는 법을 배우는 데 도움이 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →