← 최신 논문
💬 NLP

compar:IA: The French Government's LLM arena to collect French-language human prompts and preference data

이 논문은 대규모 언어 모델(LLM)을 훈련하고 평가하기 위한 비영어권 데이터셋의 부족 문제를 해결하기 위해, 블라인드 쌍체 비교를 통해 대규모의 프랑스어 인간 선호도 데이터를 수집하는 오픈 소스 프랑스 정부 플랫폼인 compar:IA를 소개한다.

원저자: Lucie Termignon, Simonas Zilinskas, Hadrien Pélissier, Aurélien Barrot, Nicolas Chesnais, Elie Gavoty

게시일 2026-02-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Lucie Termignon, Simonas Zilinskas, Hadrien Pélissier, Aurélien Barrot, Nicolas Chesnais, Elie Gavoty

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능(AI)의 세계를 책들이 거의 영어로만 쓰여 있는 거대한 도서관이라고 상상해 보세요. 만약 당신이 프랑스어, 스페인어 또는 다른 언어로 된 책을 읽으려고 한다면, 이야기가 어색하게 느껴지거나 등장인물이 이상하게 행동하거나, 혹은 조언이 문화적으로 맞지 않을 수 있습니다. 이는 AI '학생들'이 대부분의 시간을 영어 책을 공부하며 보냈고, 다른 언어로 연습하는 일은 거의 없었기 때문에 발생하는 현상입니다.

이를 해결하기 위해 프랑스 정부는 compar:IA라는 특별한 놀이터를 만들었습니다. 이것을 거대한, 공공의 블라인드 맛 테스트 대회라고 생각하면 됩니다. 다만 아이스크림 대신, 질문에 대한 답변을 맛보는 것이죠.

작동 방식은 다음과 같이 간단한 부분으로 나뉩니다.

1. 블라인드 맛 테스트 (작동 방식)

당신이 방 안으로 걸어 들어가 두 명의 미스터리 셰프(AI 모델)가 당신의 질문에 대한 답을 요리하고 있는 것을 본다고 상상해 보세요. 당신은 아직 그들이 누구인지 모릅니다.

  • 1단계: 당신은 질문을 던집니다 (예: "크루아상은 어떻게 굽나요?" 또는 "농담 하나 해주세요").
  • 2단계: 두 셰프가 각각 답변을 작성합니다. 당신은 답변들을 나란히 놓고 읽습니다.
  • 3단계: 당신은 더 마음에 드는 쪽을 선택합니다.
  • 4단계: 당신이 투표를 마친 후에야 셰프들은 자신의 이름을 공개합니다.

이 "블라인드" 방식은 매우 중요합니다. 이는 당신이 단순히 이름이나 브랜드가 익숙하다는 이유로 특정 셰프를 선택하는 것을 방지합니다. 이는 오로ally 답변의 품질에 기반하여 투표가 이루어지도록 보장합니다.

2. 왜 이것을 만드는가? (문제점)

대부분의 AI 학습 데이터는 영어 음식만 먹고 자란 식단과 같습니다. 이 때문에 AI는 프랑스 문화, 속어, 그리고 안전 규칙을 다루는 데 어려움을 겪습니다. AI에게 프랑스어를 잘하도록 가르치려면, 수천 명의 프랑스 사람들이 "나는 이 답변은 좋았지만, 저 답변은 싫었다"라고 말해줄 데이터가 필요합니다.

compar:IA 이전에는 이 데이터가 거대 기술 기업들 내부에 숨겨져 있거나, 프랑스어 사용자를 위한 데이터 자체가 존재하지 않았습니다. compar:IA는 누구나 이 데이터를 만드는 데 기여할 수 있는 공공 주방이며, 그 레시피(데이터)는 모두와 자유롭게 공유됩니다.

3. 수확 (수집된 내용)

2024년 말 개장한 이후, 이 디지털 놀이터는 매우 바쁘게 움직였습니다. 2026년 초 기준으로, 이들은 다음과 같은 것들을 모았습니다:

  • 실제 사람들이 던진 60만 개 이상의 질문
  • 어떤 AI의 답변이 더 나은지를 결정한 25만 개 이상의 투표
  • 데이터의 89%가 프랑스어이며, 이는 영어 데이터가 지배하는 세상에서 매우 중대한 사건입니다.

그들은 단순히 투표만 수집한 것이 아니라, 사용자들이 답변의 특정 부분에 대해 반응하도록 하여, 프랑스어 사용자들이 실제로 무엇을 중요하게 여기는지에 대한 풍부한 지도를 만들어냈습니다.

4. 누가 사용하며 왜 사용하는가?

  • 일반 사람들을 위해: 다양한 AI 모델(유명한 모델부터 새로운 오픈 소스 모델까지)과 대화하며 그들이 어떻게 생각하는지 확인해 볼 수 있는 무료 방법입니다. 또한, AI가 답변하는 데 얼마나 많은 에너지(전기)를 사용하는지도 보여주어, 환경에 대해 생각하도록 유도합니다.
  • 과학자와 기업들을 위해: 그들은 자신만의 AI 모델이 프랑스어를 더 잘 말하도록 훈련시키기 위해 이 "레시피 북"(데이터)을 다운로드할 수 있습니다.
  • 학교를 위해: 교사들은 학생들이 AI가 어떻게 작동하는지 배울 수 있도록 이 플랫폼을 수업 도구로 활용하며, 학생들은 어떤 AI의 답변이 더 공정하거나 정확한지에 대해 토론합니다.

5. 게임의 규칙 (개인정보 보호 및 안전)

제작자들은 개인정보 보호에 매우 주의를 기울였습니다.

  • 가입 없음: 플레이를 위해 이름이나 이메일을 제공할 필요가 없습니다. 이는 진입 장벽을 낮추지만, 나중에 더 주의를 기울여야 함을 의미합니다end.
  • 필터: 데이터가 대중에게 공개되기 전, 스마트한 컴퓨터가 모든 대화를 스캔합니다. 만약 실제 사람의 이름, 주소 또는 개인 정보가 발견되면, 그 대화 전체를 폐기합니다. 몇 개의 데이터 포인트를 잃는 것이 누군가의 비밀을 실수로 유출하는 것보다 낫기 때문입니다.
  • 오픈 소스: 데이터는 프랑스 정부 라이선스 하에 공개됩니다. 즉, 규칙을 준수하는 한 누구나 연구나 새로운 도구를 만드는 데 사용할 수 있습니다.

6. 스코어보드

플랫폼은 또한 리더보드(순위 목록)를 유지합니다. 이것은 프랑스 사람들이 어떤 AI 모델을 가장 선호하는지를 보여주는 스포츠 스코어보드와 같습니다. 하지만 저자들은 이것이 "지능"에 대한 완벽한 테스트는 아니라고 경고합니다. 그것은 단지 사람들이 일상적인 상황에서 무엇을 좋아했는지를 보여줄 뿐입니다. 그것은 최종 시험이라기보다는 인기 투표에 가깝습니다.

7. 미래

프랑스 팀은 이것을 하나의 프로토타입으로 보고 있습니다. 그들은 이미 이 "맛 테스트"를 다른 언어(덴마크어로 시작)로 확장하여, 다른 국가들도 자신들만의 공공 데이터 정원을 구축할 수 있도록 준비하고 있습니다.

요약하자면: compar:IA는 프랑스어 사용자의 선호도를 크라우드소싱하여, AI가 인간 프랑스어 화자처럼 말하고, 생각하고, 행동하도록 가르치는 공공 서비스입니다. 동시에 이 과정은 모두에게 개방적이고, 사생활을 보호하며, 무료로 제공됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →