← 최신 논문
💻 computer science

GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human

본 논문은 정적 벤치마크가 인간성과 평가에 가진 한계를 극복하기 위해 최소한의 인간 시드 주석과 반복적인 LLM 기반 루브릭 정제를 활용하여 진화하는 모델과 변화하는 시나리오에 지속적으로 적응하는 자기 진화형 대화 평가 시스템인 GrowLoop 을 제안합니다.

원저자: Yihang Lin, Yunze Gao, Zeyang Lin, Dongbo Li, Kun Peng, Chenglong Song, Yue Liu

게시일 2026-05-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yihang Lin, Yunze Gao, Zeyang Lin, Dongbo Li, Kun Peng, Chenglong Song, Yue Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 훌륭한 대화 상대가 되는 법을 가르치려 한다고 상상해 보세요. 로봇이 자연스럽고 공감적이며 인간처럼 들리기를 원합니다. 하지만 여기에는 문제가 있습니다. "인간다움"은 수학 공식이 아니라 느낌입니다.

"그 응답이 친절했나요?"라고 인간에게 물으면, 어떤 이는 "예"라고 답할 수 있고, 다른 이는 "아니요"라고 답할 수 있습니다. 정답은 하나뿐이며, "친절함"의 기준은 로봇이 더 똑똑해지고 인간의 기대가 변함에 따라 달라집니다.

알리바바 그룹의 GrowLoop 논문은 바로 이 문제를 해결하려 합니다. 그들은 로봇을 단순히 테스트하는 시스템을 구축한 것이 아니라, 로봇이 발전함에 따라 로봇을 평가하는 법을 스스로 가르치는 시스템을 만들었습니다.

다음은 이를 간단한 개념으로 분해한 작동 원리입니다:

1. 문제: "암묵지"의 함정

"인간다움"을 자전거 타기라고 생각해 보세요. 당신은 어떻게 하는지 알고 있고, 다른 사람이 잘하는지 알 수 있습니다. 하지만 균형을 잡는 방법을 정확히 설명하는 매뉴얼을 작성하려 한다면 어려움을 겪을 것입니다. 당신은 "암묵지"를 가지고 있습니다. 말로 표현할 수 있는 것보다 더 많이 알고 있는 것이죠.

기존의 AI 테스트는 "페달 속도"와 "핸들바 각도" 같은 엄격한 체크리스트로 자전거 타는 사람을 평가하려는 것과 같습니다. 그들은 균형 잡기의 실제 느낌을 놓칩니다. 또한 로봇이 발전함에 따라 테스트도 더 어려워져야 하지만, 기존 테스트는 그대로 남아 쓸모없어집니다.

2. 해결책: "자기 진화" 시스템

GrowLoop은 AI와 함께 성장하는 살아 숨 쉬는 평가 시스템과 같습니다. 이는 서로 돕는 두 가지 주요 부분으로 구성되는데, 댄스 파트너안무가와 같습니다:

  • 안무가 (평가 기준): 이는 규칙책입니다. "좋은 것"이 무엇인지 정의합니다 (예: "공감하라", "의학적 조언을 주지 마라").
  • 댄스 파트너 (사례): 이는 AI를 테스트하는 실제 대화들입니다.

과거에는 인간이 규칙책과 테스트 질문을 작성했고, 이는 시간 속에서 고정되었습니다. 하지만 GrowLoop에서는 시스템이 소수의 인간 예시에서 규칙을 학습한 후, AI가 여전히 실패하는 부분을 찾기 위해 스스로 새로운 테스트 질문을 작성합니다.

3. 학습 방법: "휴리스틱 학습" 루프

학생 (AI) 에게 몇 가지 샘플 에세이 (Human Seeds) 를 보여주며 가르친다고 상상해 보세요.

  1. 시스템이 샘플을 읽습니다: 인간이 이 에세이들을 어떻게 평가했는지 살펴보고, 인간이 사용한 숨겨진 규칙을 추측해 봅니다.
  2. 규칙책을 작성합니다: 초안 규칙책 (Rubric) 을 만듭니다.
  3. 스스로 테스트합니다: 이 규칙책을 사용하여 샘플을 다시 평가합니다.
  4. "휴리스틱" 수정: 시스템의 평가가 인간의 평가와 일치하지 않으면, 단순히 추측하지 않습니다. *"왜 내가 이걸 틀렸지? 나의 '공감' 정의가 너무 모호했나?"*라고 묻습니다. 그런 다음 특정 맹점을 해결하기 위해 규칙책을 다시 작성합니다.

시스템의 평가가 인간의 평가와 거의 완벽하게 일치할 때까지 이 과정을 반복합니다.

4. 이견 처리: "합의 vs. 이질" 영역

때로는 인간들이 무엇이 "좋은지"에 대해 이견을 보입니다.

  • 영역 A (합의): 모두 AI가 무례했다고 동의합니다. 시스템은 이에 맞춰야 합니다.
  • 영역 B (이질): 한 인간은 AI가 너무 짧았다고 생각하지만, 다른 인간은 완벽하다고 생각합니다. 논문은 이것은 괜찮다고 말합니다. 시스템은 여기서 단일한 "정답"을 강요할 필요가 없습니다. 단지 그 판단이 합리적이며 인간 의견의 범위 내에 있음을 보여주면 됩니다.

이는 재능 쇼의 심사위원과 같습니다. 심사위원들이 모두 가수가 음정이 틀렸다고 동의하면 가수는 탈락합니다. 하지만 심사위원들이 나뉘어 있다면 (일부는 스타일을 사랑하고 일부는 싫어함), 가수가 만장일치를 받지 못했다고 해서 탈락하는 것은 아닙니다. 그들은 단지 자신만의 유효한 스타일을 보이면 됩니다.

5. "이중 루프" 진화

이것이 마법 같은 부분입니다. 시스템은 서로 먹이를 주고받는 두 개의 루프를 가지고 있습니다:

  • 루프 1 (규칙이 사례를 주도): 시스템은 새로운 규칙책을 사용하여 AI 의 약점을 구체적으로 겨냥한 새롭고 더 어려운 테스트 질문을 생성합니다.
  • 루프 2 (사례가 규칙을 주도): AI 가 이러한 새롭고 어려운 테스트를 치르면, 규칙책이 예상하지 못한 방식으로 실패할 수 있습니다. 시스템은 이러한 새로운 실패를 목격하고, 해당 실패에 대한 새로운 "씨앗" 예시를 인간에게서 빠르게 요청한 후, 이 새로운 규칙을 포함하도록 규칙책을 업데이트합니다.

비유: 비디오 게임을 상상해 보세요.

  • 기존 방식: 게임은 고정된 레벨을 가집니다. 한 번 클리어하면 게임은 "해결"된 것입니다.
  • GrowLoop 방식: 당신이 레벨을 클리어하자마자 게임은 방금 마스터한 동작을 정확히 겨냥한 더 어려운 레벨을 자동으로 설계합니다. 당신이 버그 (새로운 승리 방법) 를 발견하면, 게임은 그 버그를 패치하기 위해 규칙을 업데이트합니다. 게임은 결코 더 어렵거나 흥미로워지는 것을 멈추지 않습니다.

6. 결과

이 논문은 친구와 대화하는 것과 같은 개방형 대화에서 이를 테스트했습니다.

  • 더 나은 평가: GrowLoop 은 다른 방법들 (표준 AI 심사위원이나 인간이 작성한 체크리스트 등) 보다 인간 심사위원과 훨씬 더 자주 일치했습니다.
  • 숨겨진 결함 발견: 인간이 놓친 실수를 찾아냈습니다. 예를 들어, 한 사례에서 인간은 AI 응답이 괜찮다고 생각했지만, GrowLoop 의 규칙책은 AI 가 의사처럼 행동했기 때문에 (AI 는 그렇게 해서는 안 됨) 위험하다고 표시했습니다.
  • 적응성: "좋은" 모델과 "나쁜" 모델을 성공적으로 구분했으며, 모델이 왜 약한지 정확히 알려줄 수 있었습니다 (예: "사실은 잘 다루지만 공감은 부족함").

요약

GrowLoop 은 자기 개선형 평가 시스템입니다. 인간이 지속적으로 새로운 테스트와 규칙을 작성하는 대신, 시스템은 인간이 몇 가지 예시를 어떻게 평가하는지 관찰하고, 인간다움의 "말하지 않은 규칙"을 학습한 후, 스스로 테스트를 작성하며 AI 가 발전하거나 세상이 변할 때마다 스스로 규칙을 업데이트합니다. 이는 AI 평가 방식을 정적인 시험에서 살아 숨 쉬며 성장하는 대화로 바꿉니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →