CAPITU: A Benchmark for Evaluating Instruction-Following in Brazilian Portuguese with Literary Context
이 논문은 브라질 문학 작품의 문맥을 활용하여 자동 검증 가능한 지시어 추종 능력을 평가하는 새로운 벤치마크 'CAPITU'를 제안하고, 다양한 대형 언어 모델들의 성능과 비용 효율성을 분석한 결과를 제시합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
이 논문은 **"CAPITU"**라는 이름의 새로운 시험지를 소개합니다. 이 시험지는 인공지능 (LLM) 이 브라질 포르투갈어로 지시를 얼마나 정확하게 따르는지 테스트하기 위해 만들어졌습니다.
쉽게 비유하자면, CAPITU 는 인공지능에게 **"브라질 문학의 주인공이 되어, 아주 까다로운 규칙을 지키면서 이야기를 써보라"**는 미션을 주는 것입니다.
이 논문의 핵심 내용을 일상적인 언어와 비유로 설명해 드릴게요.
1. 왜 이 시험이 필요할까요? (기존 시험의 문제점)
지금까지 인공지능을 평가하는 시험들은 대부분 영어로 만들어졌습니다. 마치 "영어를 잘하는지"를 보기 위해 "한국어 문법"을 영어로 번역해서 물어보는 것과 비슷합니다.
하지만 포르투갈어는 영어와 완전히 다릅니다.
- 비유: 영어는 "사과"라고 하면 그냥 사과지만, 포르투갈어는 "작은 사과 (사과+작은)"나 "큰 사과 (사과+큰)"처럼 단어를 붙여서 크기를 표현하는 방식이 매우 발달했습니다.
- 문제: 영어 시험지를 번역해서 쓰면, 이런 포르투갈어 특유의 '작은/큰' 표현이나 문장 끝맺음 같은 미묘한 차이를 제대로 테스트할 수 없습니다. 그래서 브라질 문학이라는 특별한 배경을 깔고, 포르투갈어 고유의 규칙을 직접 만든 시험이 필요했던 것입니다.
2. CAPITU 시험은 어떻게 생겼나요? (시험지 구성)
이 시험지는 브라질의 고전 문학 8 권을 배경으로 합니다. (예: 마차도 데 아시스, 조제 데 알레낭 등 유명 작가들의 작품)
- 상황: 인공지능에게 "《도스 카스무로》라는 소설을 분석해 줘"라고 시킵니다.
- 까다로운 규칙 (지시사항): 단순히 분석만 하는 게 아니라, 아주 구체적인 규칙을 지켜야 합니다.
- "단어 120~150 개 사이로 써줘."
- "'-inho'로 끝나는 단어 (작은~) 를 3 개 이상 써줘."
- "질문문은 절대 쓰지 마."
- "문장 첫 글자를 모아서 '사랑 (AMOR)'이라는 단어를 만들어줘."
- 특징: 총 59 가지의 다양한 규칙이 있고, 이 규칙들은 사람이 일일이 확인하지 않아도 컴퓨터 프로그램이 자동으로 "맞다/틀리다"를 판정할 수 있도록 설계되었습니다.
3. 시험 결과: 누가 잘했을까요? (결과 분석)
연구진은 최신 인공지능 18 개 모델을 이 시험에 풀어보게 했습니다.
- 최강자 (GPT-5.2): 논리적으로 생각하는 기능이 켜진 모델이 가장 잘했습니다. 규칙을 거의 99% 완벽하게 지켰습니다. 마치 "규칙을 외운 천재"처럼 행동했습니다.
- 가성비 영웅 (Sabiazinho-4): 브라질에 특화된 작은 모델이 놀라운 성적을 냈습니다. 거대한 모델보다 성능은 조금 떨어지지만, 비용은 8 배나 저렴했습니다. "작지만 강한" 모델의 승리입니다.
- 약점 발견:
- 숫자 세기: "정확히 100 단어로 써"라는 지시를 가장 힘들어했습니다. (인공지능은 숫자를 세는 게 생각보다 어렵습니다.)
- 문장 구조: "첫 글자를 합쳐서 단어를 만들어" 같은 복잡한 구조를 요구하면 실수가 잦았습니다.
- 대화 지속성: 1 번 대화는 잘했지만, 2 번, 3 번 대화로 이어질수록 "아까 했던 규칙을 잊어버리는" 현상이 발생했습니다.
4. 왜 이 연구가 중요할까요?
이 연구는 인공지능이 단순히 "지식"을 가지고 있는지 확인하는 것을 넘어, **"사용자의 말을 얼마나 꼼꼼히 듣는지"**를 평가하는 새로운 기준을 제시했습니다.
- 문화적 이해: 인공지능이 브라질 문학이라는 맥락 속에서 포르투갈어 특유의 감성과 규칙을 이해할 수 있는지 보여줍니다.
- 실용성: 앞으로 브라질이나 포르투갈어를 사용하는 서비스 (법률, 의료, 고객 상담 등) 에서 인공지능이 실수 없이 지시를 따르는지 검증하는 데 이 시험지가 기준이 될 것입니다.
요약
CAPITU는 인공지능에게 **"브라질 고전 소설을 소재로, 포르투갈어 특유의 까다로운 문법 규칙을 지키면서 글을 써봐"**라고 시키는 시험입니다.
이 시험을 통해 우리는 인공지능이 영어 중심의 사고방식에서 벗어나, 포르투갈어라는 새로운 언어의 규칙을 얼마나 잘 따를 수 있는지를 명확하게 볼 수 있게 되었습니다. 결과는 "최고급 모델은 잘하지만, 아직 숫자 세기나 복잡한 구조에서는 실수가 많고, 대화할수록 규칙을 잊어버린다"는 교훈을 남겼습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.