← 최신 논문
💬 NLP

Prosa: Rubric-Based Evaluation of LLMs on Real User Chats in Brazilian Portuguese

본 논문은 최초의 실사용자 다턴 브라질 포르투갈어 채팅 벤치마크인 Prosa 를 소개하고, 이진 루브릭 점수 평가에 다중 판정자 필터링을 적용하는 것이 전통적인 전체적 LLM-판정자 방식에 비해 평가의 안정성과 변별력을 크게 향상시킨다는 것을 입증합니다.

원저자: Roseval Malaquias Junior, Giovana Kerche Bonás, Thales Sales Almeida, Hugo Abonizio, Thiago Laitz, Ramon Pires, Marcos Piau, Celio Larcher, Rodrigo Nogueira

게시일 2026-05-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Roseval Malaquias Junior, Giovana Kerche Bonás, Thales Sales Almeida, Hugo Abonizio, Thiago Laitz, Ramon Pires, Marcos Piau, Celio Larcher, Rodrigo Nogueira

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

도시에서 최고의 요리사를 순위로 매기려 한다고 상상해 보세요. 과거에는 미식 평론가에게 요리를 맛보게 하고 1 점부터 10 점까지 하나의 점수를 매기게 했을 것입니다. 이는 현재 대부분의 AI 모델을 평가하는 방식과 유사합니다. 즉, '심판' AI 가 응답을 읽고 전체적인 점수 하나를 부여하는 것입니다.

이 논문이 설명하는 바와 같이 문제는 비평가마다 취향이 다르다는 점입니다. 한 사람은 매운 음식을 사랑하지만, 다른 사람은 그것을 싫어할 수 있습니다. 세 명의 다른 비평가에게 같은 16 명의 요리사를 순위로 매기게 하면, 누가 가장 나쁜지는 모두 동의할지라도 누가 가장 좋은지에 대해서는 완전히 이견을 보일 수 있습니다. 이로 인해 순위 매기기가 신뢰할 수 없게 됩니다.

이 논문의 해결책: '체크리스트' 방식

브라질 포르투갈어 AI 채팅을 위한 새로운 벤치마크인 Prosa를 개발한 연구자들은 게임의 규칙을 바꾸기로 결정했습니다. 심판에게 "이 대화가 전체적으로 얼마나 좋은가?"라고 묻는 대신, 심판들에게 이진 (예/아니오) 질문으로 구성된 구체적인 체크리스트를 제공했습니다.

  • 구식 방식 (전체적 평가): "이 대화를 1 점부터 10 점까지 평가하세요." (주관적이며 편향되기 쉬움).
  • 신규 방식 (루브릭 기반): "AI 가 질문에 답했나요? 예/아니오. 공손하게 유지했나요? 예/아니오. 사실을 허위로 만들지 않았나요? 예/아니오."

운전 면허 시험을 생각해 보세요. 강사가 "운전을 꽤 잘했네, 8 점을 주마"라고 말하는 대신, 구체적인 항목을 확인합니다. "방향 지시등을 사용했나요? 예/아니오. 적색 신호에서 정차했나요? 예/아니오."

'필터링'의 마법

연구자들은 때로는 체크리스트 항목 자체가 고장 나 있을 수 있음을 깨달았습니다. 어떤 질문은 너무 쉬워서 모든 요리사가 통과하거나, 너무 어려워서 모두 떨어질 수 있습니다. 이러한 '고장 난 질문'들은 순위 매기기를 혼란스럽게 만듭니다.

그래서 그들은 필터링 단계를 추가했습니다. 최종 점수를 확정하기 전에 체크리스트를 '품질 관리' 팀을 통과시켰습니다. 너무 쉽거나, 너무 어렵거나, 혼란스러운 질문들은 제외했습니다. 그 결과, 좋은 요리사와 훌륭한 요리사 사이를 실제로 구별할 수 있는 날카롭고 고품질의 질문 세트를 확보하게 되었습니다.

큰 발견

다음은 그들의 발견 중 가장 놀라운 부분입니다:

  1. 심판보다 방법이 더 중요하다: 그들이 구식인 '1 점부터 10 점' 방식을 사용했을 때, 세 개의 서로 다른 AI 심판 (서로 다른 회사 소속) 은 상위 요리사에 대해 완전히 다른 순위를 매겼습니다. 하지만 '체크리스트 + 필터링' 방식으로 전환하자, 세 심판 모두 16 명의 요리사에 대해 정확히 동일한 순위에 동의했습니다.
  2. 비용이 더 저렴하다: 체크리스트가 작업을 간단한 예/아니오 질문으로 분해하기 때문에, 심판을 위해 초고가이고 '초지능'인 AI 가 필요하지 않습니다. 더 저렴하고 빠른 AI(예: Gemini 3 Flash) 를 사용해도 동일한 완벽한 순위를 얻을 수 있습니다. 이 방식으로 새로운 모델을 평가하는 데 드는 비용은 약 2.10 달러이며, 다른 방식들에 비해 훨씬 높은 비용과 비교됩니다.

Prosa 란 무엇인가?

Prosa브라질 포르투갈어를 위한 최초의 벤치마크입니다.

  • 실제 생활: 학교 시험과 같은 가상의 테스트 질문 대신, 브라질에서 실제 사람들이 AI 와 나눈 1,000 개의 실제 대화를 사용했습니다. 이는 사람들이 실제로 어떻게 말하고, 어떤 은어를 사용하는지, 그리고 그들이 해결하려는 실제 문제들을 포착합니다.
  • 결과: 그들은 16 개의 서로 다른 AI 모델을 순위로 매겼습니다. 1 위는 OpenAI 의 GPT-5.2 였으며, Google 과 Alibaba 모델이 그 뒤를 바짝 따라왔습니다. 흥미롭게도 오픈소스 모델 (Qwen3-235B) 은 매우 잘 수행되어 여러 고가의 독점 모델을 능가했습니다.

요약

이 논문은 AI 모델을 공정하게 순위 매기기 위해서는 심판들에게 모호한 '느낌'을 요구하는 것을 멈추고, 단순한 사실들로 구성된 엄격하고 필터링된 체크리스트를 사용하기 시작해야 한다고 주장합니다. 이 방식은 특정 심판의 편향을 제거하고, 순위를 훨씬 더 안정적으로 만들며, 비용을 절감합니다. 동시에 브라질의 실제 대화를 테스트 무대로 사용합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →