← 최신 논문
💬 NLP

CAPITU: A Benchmark for Evaluating Instruction-Following in Brazilian Portuguese with Literary Context

이 논문은 브라질 문학 작품의 문맥을 활용하여 자동 검증 가능한 지시어 추종 능력을 평가하는 새로운 벤치마크 'CAPITU'를 제안하고, 다양한 대형 언어 모델들의 성능과 비용 효율성을 분석한 결과를 제시합니다.

원저자: Giovana Kerche Bonás, Roseval Malaquias Junior, Marcos Piau, Thiago Laitz, Thales Sales Almeida, Hugo Abonizio, Celio Larcher, Ramon Pires, Rodrigo Nogueira

게시일 2026-03-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Giovana Kerche Bonás, Roseval Malaquias Junior, Marcos Piau, Thiago Laitz, Thales Sales Almeida, Hugo Abonizio, Celio Larcher, Ramon Pires, Rodrigo Nogueira

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"CAPITU"**라는 이름의 새로운 시험지를 소개합니다. 이 시험지는 인공지능 (LLM) 이 브라질 포르투갈어로 지시를 얼마나 정확하게 따르는지 테스트하기 위해 만들어졌습니다.

쉽게 비유하자면, CAPITU 는 인공지능에게 **"브라질 문학의 주인공이 되어, 아주 까다로운 규칙을 지키면서 이야기를 써보라"**는 미션을 주는 것입니다.

이 논문의 핵심 내용을 일상적인 언어와 비유로 설명해 드릴게요.


1. 왜 이 시험이 필요할까요? (기존 시험의 문제점)

지금까지 인공지능을 평가하는 시험들은 대부분 영어로 만들어졌습니다. 마치 "영어를 잘하는지"를 보기 위해 "한국어 문법"을 영어로 번역해서 물어보는 것과 비슷합니다.

하지만 포르투갈어는 영어와 완전히 다릅니다.

  • 비유: 영어는 "사과"라고 하면 그냥 사과지만, 포르투갈어는 "작은 사과 (사과+작은)"나 "큰 사과 (사과+큰)"처럼 단어를 붙여서 크기를 표현하는 방식이 매우 발달했습니다.
  • 문제: 영어 시험지를 번역해서 쓰면, 이런 포르투갈어 특유의 '작은/큰' 표현이나 문장 끝맺음 같은 미묘한 차이를 제대로 테스트할 수 없습니다. 그래서 브라질 문학이라는 특별한 배경을 깔고, 포르투갈어 고유의 규칙을 직접 만든 시험이 필요했던 것입니다.

2. CAPITU 시험은 어떻게 생겼나요? (시험지 구성)

이 시험지는 브라질의 고전 문학 8 권을 배경으로 합니다. (예: 마차도 데 아시스, 조제 데 알레낭 등 유명 작가들의 작품)

  • 상황: 인공지능에게 "《도스 카스무로》라는 소설을 분석해 줘"라고 시킵니다.
  • 까다로운 규칙 (지시사항): 단순히 분석만 하는 게 아니라, 아주 구체적인 규칙을 지켜야 합니다.
    • "단어 120~150 개 사이로 써줘."
    • "'-inho'로 끝나는 단어 (작은~) 를 3 개 이상 써줘."
    • "질문문은 절대 쓰지 마."
    • "문장 첫 글자를 모아서 '사랑 (AMOR)'이라는 단어를 만들어줘."
  • 특징:59 가지의 다양한 규칙이 있고, 이 규칙들은 사람이 일일이 확인하지 않아도 컴퓨터 프로그램이 자동으로 "맞다/틀리다"를 판정할 수 있도록 설계되었습니다.

3. 시험 결과: 누가 잘했을까요? (결과 분석)

연구진은 최신 인공지능 18 개 모델을 이 시험에 풀어보게 했습니다.

  • 최강자 (GPT-5.2): 논리적으로 생각하는 기능이 켜진 모델이 가장 잘했습니다. 규칙을 거의 99% 완벽하게 지켰습니다. 마치 "규칙을 외운 천재"처럼 행동했습니다.
  • 가성비 영웅 (Sabiazinho-4): 브라질에 특화된 작은 모델이 놀라운 성적을 냈습니다. 거대한 모델보다 성능은 조금 떨어지지만, 비용은 8 배나 저렴했습니다. "작지만 강한" 모델의 승리입니다.
  • 약점 발견:
    • 숫자 세기: "정확히 100 단어로 써"라는 지시를 가장 힘들어했습니다. (인공지능은 숫자를 세는 게 생각보다 어렵습니다.)
    • 문장 구조: "첫 글자를 합쳐서 단어를 만들어" 같은 복잡한 구조를 요구하면 실수가 잦았습니다.
    • 대화 지속성: 1 번 대화는 잘했지만, 2 번, 3 번 대화로 이어질수록 "아까 했던 규칙을 잊어버리는" 현상이 발생했습니다.

4. 왜 이 연구가 중요할까요?

이 연구는 인공지능이 단순히 "지식"을 가지고 있는지 확인하는 것을 넘어, **"사용자의 말을 얼마나 꼼꼼히 듣는지"**를 평가하는 새로운 기준을 제시했습니다.

  • 문화적 이해: 인공지능이 브라질 문학이라는 맥락 속에서 포르투갈어 특유의 감성과 규칙을 이해할 수 있는지 보여줍니다.
  • 실용성: 앞으로 브라질이나 포르투갈어를 사용하는 서비스 (법률, 의료, 고객 상담 등) 에서 인공지능이 실수 없이 지시를 따르는지 검증하는 데 이 시험지가 기준이 될 것입니다.

요약

CAPITU는 인공지능에게 **"브라질 고전 소설을 소재로, 포르투갈어 특유의 까다로운 문법 규칙을 지키면서 글을 써봐"**라고 시키는 시험입니다.

이 시험을 통해 우리는 인공지능이 영어 중심의 사고방식에서 벗어나, 포르투갈어라는 새로운 언어의 규칙을 얼마나 잘 따를 수 있는지를 명확하게 볼 수 있게 되었습니다. 결과는 "최고급 모델은 잘하지만, 아직 숫자 세기나 복잡한 구조에서는 실수가 많고, 대화할수록 규칙을 잊어버린다"는 교훈을 남겼습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →