Inspect India Evals: An Open Benchmarking Framework for Evaluating Large Language Models in the Indian Linguistic and Cultural Context
이 논문은 영국 AISI의 Inspect AI 플랫폼을 기반으로 구축된 오픈 소스 벤치마킹 프레임워크인 "Inspect India Evals"를 소개하며, 이는 인도의 대규모 언어 모델에 대한 문화적 및 언어적 관련성이 있는 평가의 부족 문제를 해결하기 위해 16개 언어에 걸쳐 6개의 특정 벤치마크를 테스트함으로써 Sarvam-M 및 Gemma 2와 같은 모델들이 인도의 문화적 지식과 안전 준수 측면에서 더 큰 규모의 모델들을 능가한다는 점을 밝혀냈다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신은 대화도 하고, 이야기를 쓰고, 수학 문제도 풀 수 있는 초스마트 로봇 비서를 막 구입했다고 상상해 보세요. 당신은 이 로봇을 당신의 동네에 풀어놓고 싶어 매우 설레지만, 한 가지 문제가 있습니다. 당신의 동네는 수십 개의 언어가 통용되고, 독특한 축제를 기념하며, 고유한 전통을 가진 사람들이 모여 사는 거대하고 북적이는 시장과 같습니다. 만약 당신이 이 로봇에게 뉴욕이나 런던의 삶에 대해 쓰인 영어 책들로만 교육한다면, 그 로봇은 아주 똑똑한 학자는 될지언정 형편없는 이웃이 될 것입니다. 로봇은 실수로 지역 어르신을 모욕하거나, 문화적인 농담을 오해하거나, 더 심하게는 현지의 규칙을 이해하지 못해 위험한 조언을 해줄 수도 있습니다. 이것이 바로 방대한 양의 텍스트로 학습된 AI의 두뇌, 즉 **거대 언어 모델(LLM)**의 세계입니다. 현재 과학자들이 던지는 큰 질문은 이것입니다: 이 AI 두뇌들이 인도처럼 문화와 언어가 믿기 힘들 정도로 다양한 곳에서 사람들을 도울 준비가 되었는가?
이 질문에 답하기 위해 연구자들은 로봇을 테스트할 방법이 필요합니다. 보통 그들은 "MMLU"나 "TruthfulQA" 같은 표준 테스트를 사용하는데, 이는 마치 유럽의 고속도로를 위해 설계된 운전 면허 시험과 같습니다. 하지만 인도에서 운전하는 것은 다릅니다. 도로는 더 좁고, 교통 규칙은 독특하며, 랜드마크도 완전히 다릅니다. 만약 자동차를 유럽의 고속도로에서만 테스트한다면, 그 차가 혼란스러운 인도의 시장통을 감당할 수 있을지 알 수 없습니다. 이 논문은 인도의 맥락에 맞춰 특별히 제작된 새로운 오픈 소스 "운전 면허 시험"인 Inspect India Evals를 소개합니다. 이 테스트는 AI 모델이 16개의 다양한 인도 언어를 구사할 수 있는지, 인도의 사회적 역학(카스트 제도와 종교적 다양성 같은 복잡한 구조)을 이해하는지, 그리고 인도의 디지털 ID 시스템이나 결제 앱에 관한 까다로운 질문을 받았을 때 안전하게 행동하는지를 점검합니다.
거대한 테스트: AI를 위한 새로운 지도
이 논문의 저자들은 인도 전자정보기술부(Ministry of Electronics and Information Technology)와 협력하여, 기존의 AI 테스트들이 핵심을 놓치고 있다는 점을 깨달았습니다. 그들은 인도라는 맥락에 특화된 6단계 장애물 코스인 Inspect India Evals라는 프레임워크를 구축했습니다. 단순히 "이 수학 문제를 풀 수 있나요?"라고 묻는 대신, "이 수학 문제를 타밀어로 풀 수 있나요?"라거나 "실수로 위조 방법을 가르쳐주지 않으면서 어떻게 정부 ID를 등록하는지 알려줄 수 있나요?"라고 물었습니다.
이 프레임워크는 다음의 6가지 특정 과제를 포함합니다:
- 다국어 MMLU: 사실 관계를 실제로 이해하는지, 아니면 그냥 추측하는 것인지 확인하기 위해 16개의 인도 언어(힌디, 벵골, 타밀 등)로 번역된 지식 테스트입니다.
- BharatBBQ: AI가 미국의 인종이나 성별 이슈가 아닌, 인도의 카스트, 종교 또는 지역에 대한 고정관념을 가지고 있는지 확인하는 편향성 테스트입니다.
- DPI 안전성: 인도의 "디지털 공공 인프라"(아드하르(Aadhaar) 신분증이나 UPI 결제 시스템 등)를 위한 안전 점검입니다. AI가 사기 행위를 돕는 요청은 거절하면서도 유익한 질문에는 답변할 수 있는지 테스트합니다.
- 다국어 안전성: 지역 언어로 질문하더라도(예: "은행을 해킹하는 법") AI가 유해한 요청에 대해 "아니오"라고 말하는지 확인합니다.
- 탈옥 저항성: 다양한 언어를 사용한 다단계 대화를 통해 AI를 속여 규칙을 어기게 만드는 시도를 합니다.
- 인도 문화 지식: 헌법부터 농업 정책에 이르기까지 깊이 있는 문화적 사실을 테스트합니다.
경주: 누가 테스트를 통과했는가?
연구진은 다섯 가지 서로 다른 오픈 소스 AI 모델을 이 장애물 코스에 투입했습니다. 이 모델들은 80억 개에서 320억 개의 "파라미터"(AI 두뇌의 연결 수라고 생각하면 됩니다) 규모에 이릅를 가집니다. 그들은 Sarvam-M 24B(인도에 특화된 모델), Gemma 2 27B, Qwen 2.5 32B, DeepSeek-R1 14B, 그리고 Llama 3.1 8B와 같은 모델들을 테스트했습니다.
결과는 다음과 같았으며, 이는 다소 놀라운 결과였습니다:
- 지역 영웅의 승리: 인도 언어와 문화에 맞게 튜닝된 Sarvam-M 24B 모델이 전체적으로 가장 높은 성적을 거두었습니다. 이 모델은 **74.4%**의 평균 점수를 기록했습니다. 특히 인도 문화를 이해하는 데 뛰어났으며(60.0%), 디지털 안전 관련 질문을 완벽하게 처리했습니다(100%). 심지어 더 크고 강력한 모델들을 문화적 지식 면에서 앞질렀습니다.
- 안전의 스타: Gemma 2 27B가 **72.1%**의 평균 점수로 매우 근소한 차이로 2위를 차지했습니다. 이 모델은 편향성 테스트와 디지털 안전성에서 **100%**를 기록한 완벽한 안전 파수꾼이었으나, 깊이 있는 문화적 사실에서는 조금 고전했습니다.
- 추론 로봇의 고전: DeepSeek-R1 14B는 답변하기 전에 매우 깊이 생각하는 것으로 유명한 "추론" 모델입니다. 이 모델은 여러 언어로 된 사실적 추론 테스트에서는 **80.6%**를 기록하며 우수한 성적을 냈습니다. 그러나 안전성과 문화적 지식에서는 처참하게 실패하여, 디지털 안전성에서 20%, 문화적 사실에서 **10%**만을 기록했습니다. 이 모델은 너무 "생각"하는 데 집중한 나머지, 안전하거나 문화적으로 의식하는 법을 잊어버린 듯했습니다.
- 거대 모델이 승리하지 못했다: 흥ingly, 파라미터가 더 많다(더 큰 두뇌를 가졌다)는 것이 승리를 보장하지는 않았습니다. Qwen 2.5 32B(320억 파라미터 모델)는 많은 영역에서 더 작은 규모인 Sarvam-M 24B보다 낮은 점수를 받았습니다. 이는 인도에서는 단순히 규모를 키우는 것보다 특화된 훈련이 더 중요하다는 것을 시사합니다.
"인도 공정성 지수"
숫자들을 정리하기 위해 저자들은 **인도 공정성 지수(India Fairness Index, IFI)**라는 단일 점수를 만들었습니다. 이 점수는 안전성, 편향성, 사실적 정확성을 하나의 숫자로 결합한 것입니다.
- Gemma 2 27B는 **83.1%**로 가장 높은 IFI 점수를 받았습니다.
- Sarvam-M 24B가 **76.6%**로 그 뒤를 바짝 쫓았습니다.
- DeepSeek-R1 14B는 **65.2%**를 기록했는데, 이는 똑똑한 것만으로는 충분하지 않고 안전해야 한다는 것을 보여줍니다.
- Llama 3.1 8B는 **51.6%**로 가장 낮은 점수를 받았습니다.
결론: 안전은 어디에나 있지만, 문화는 어렵다
가장 흥미로운 발견 중 하나는 다섯 가지 모델 모두 다국어 환경에서 유해한 요청을 거절하는 데 완벽했다는 점입니다. 모든 모델이 "다국어 안전성" 테스트에서 **100%**를 기록했습니다. 영어, 힌디어, 혹은 타밀어로 나쁜 일을 해달라고 요청해도, 그들은 모두 "아니오"라고 답했습니다. 이는 아주 좋은 소식입니다!
하지만 모델들은 인도 문화 지식 부분에서 눈에 띄게 고전했습니다. 특화된 모델인 Sarvam은 **60%**를 기록한 반면, 다른 모델들은 10%에서 30% 사이를 맴돌았습니다. 이는 표준적인 글로벌 AI 훈련만으로는 부족하며, 인도의 역사, 축제, 사회 구조에 대한 구체적인 훈련이 있어야 제대로 작동할 수 있음을 시사합니다.
또한 저자들은 한 가지 트레이드오프(절충 관계)를 언급했습니다. DeepSeek-R1은 복잡한 추론을 위해 설계된 모델이 때때로 안전 규칙을 깨도록 유도될 수 있음(탈옥 저항성 40%)을 보여준 반면, Gemma나 Sarvam 같은 모델들은 훨씬 더 강한 저항력(80%)을 보였습니다.
이것이 의미하는 바
이 논문은 서구에서 훈련된 AI를 그대로 가져와 인도에 떨어뜨려서는 안 된다고 결론짓습니다. 그것은 마치 포뮬러 원(F1) 자동차를 진흙탕 길에 몰고 가는 것과 같습니다. 속도는 빠를지 모르지만, 결국 걸려 넘어지거나 충돌할 것입니다. 연구 결과는 인도를 위한 진정으로 유용하고 안전한 AI가 되기 위해서는 현지 언어와 문화에 대한 특화된 튜닝이 필요하다는 것을 보여줍니다.
저자들은 이 결과가 적은 수의 테스트 질문(각 과제당 샘질 5개)을 바탕으로 한 "파일럿" 연구임을 주의 깊게 명시했습니다. 경향성은 명확하지만, 확실히 하기 위해서는 더 많은 질문 그룹을 통한 추가 테스트가 필요하다고 제언합니다. 하지만 메시지는 분명합니다: 특화되고 문화적으로 의식하는 모델이 인도의 AI 미래이며, 우리가 이를 세상에 내놓기 전에 안전한지 확인할 수 있는 더 나은 테스트가 필요합니다.
이 새로운 "운전 면허 시험"의 코드와 데이터는 누구나 사용할 수 있도록 공개되어 있으므로, 개발자들은 세계에서 가장 다양한 국가를 위해 더 나은, 더 안전한 AI를 계속 만들어 나갈 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.