상상해 보세요. 전 세계 최고의 요리사들이 모여 요리 대회를 열고 있습니다. 그런데 심사위원은 한 명뿐인데, 그분은 영국인입니다.
기존의 문제 (영어만 쓰는 심사)
지금까지는 모든 요리 (코드) 를 영어로 된 설명서만 보고 평가했습니다.
그래서 "영어를 잘 이해하는 심사위원 (예: GPT-4o)"이 가장 좋은 점수를 주는 것으로 알려졌습니다. 마치 "영국인 심사위원이 가장 맛을 잘 안다"는 믿음이 있었던 셈이죠.
이 연구의 실험 (다국어 심사위원 투입)
연구자들은 이 믿음이 맞는지 확인하기 위해 실험을 했습니다.
5 가지 다른 언어 (영어, 아랍어, 터키어, 중국어, 힌디어) 로 된 설명서를 준비했습니다.
그리고 6 명의 다른 AI 심사위원 (GPT-4o, Gemini, Claude 등) 을 불러와 각자 자신의 모국어 (또는 익숙한 언어) 로 요리를 평가하게 했습니다.
🔄 놀라운 결과: "누가 1 등일까?"
결과가 완전히 뒤집혔습니다!
영어로 평가할 때: GPT-4o 가 압도적으로 1 등 (가장 잘 평가함) 을 했습니다.
아랍어나 힌디어로 평가할 때: 갑자기 Gemini가 1 등으로 뛰어올랐습니다! GPT-4o 는 점수가 뚝 떨어졌습니다.
비유하자면:
"영국인 심사위원은 영국 요리를 가장 잘 평가하지만, 인도 요리를 평가할 때는 인도 출신 심사위원이 훨씬 더 맛을 잘 알아채는 것과 같습니다."
즉, **"어떤 AI 가 가장 똑똑한가?"**라는 질문에 답할 때, **"어떤 언어로 평가하느냐"**가 정답을 바꿔버린다는 것입니다.
🔍 왜 이런 일이 일어났을까?
연구자들은 두 가지 중요한 사실을 발견했습니다.
심사위원마다 '강한 언어'가 다릅니다.
어떤 AI 는 영어로 된 복잡한 지시사항을 잘 이해하지만, 아랍어로 된 지시사항은 헷갈려서 엉뚱한 점수를 줍니다. 반대로 다른 AI 는 아랍어에서는 천재처럼 작동하지만 영어에서는 평범해집니다.
마치 특정 악기 (언어) 에만 능숙한 음악가처럼, AI 도 언어에 따라 실력이 천차만별입니다.
지시문 (명령어) 을 번역하는 게 핵심입니다.
단순히 요리 재료 (코드) 만 번역하고, 심사위원에게 주는 지시문 (평가 기준) 은 영어로 남겨두면 안 됩니다.
특히 힌디어 같은 언어는 지시문까지 완벽하게 번역해주지 않으면, AI 가 혼란을 겪어 점수가 절반으로 뚝 떨어졌습니다. (42% → 23%)
비유: "요리사가 힌디어로 만든 요리를 평가할 때, 심사위원에게 '영어로 된 평가 기준서'만 주면, 심사위원은 요리사의 의도를 오해하고 엉뚱한 점수를 줄 수 있습니다."
💡 우리가 무엇을 배웠나요? (실생활 조언)
이 연구는 우리에게 세 가지 중요한 교훈을 줍니다.
단일 언어 평가는 위험합니다.
"이 AI 가 최고야!"라고 말하려면, 반드시 여러 언어로 테스트해봐야 합니다. 영어에서만 1 등인 AI 가 다른 나라에서는 꼴찌일 수 있기 때문입니다.
AI 의 실력은 '언어'에 따라 달라집니다.
AI 모델을 고를 때, "무조건 GPT-4o 가 최고야"라고 생각하지 마세요. 우리가 사용하는 **언어 (아랍어, 힌디어 등)**에 따라 가장 잘하는 AI 가 다릅니다.
평가 기준도 번역해야 합니다.
외국어를 사용하는 AI 를 평가할 때는, 평가하는 질문과 기준도 그 언어로 완벽하게 번역해야 정확한 결과를 얻을 수 있습니다.
🎯 한 줄 요약
"AI 를 평가할 때 언어를 무시하면, 마치 영어만 아는 심사위원에게 전 세계 요리를 평가하게 하는 것과 같습니다. 언어와 AI 의 조합에 따라 1 등과 꼴찌가 뒤바뀔 수 있으니, 반드시 여러 언어로 검증해야 합니다!"
이 연구는 앞으로 AI 를 개발하거나 평가할 때, 언어를 단순한 '도구'가 아니라 평가의 핵심 변수로 생각해야 한다고 경고하고 있습니다.
1. 연구 배경 및 문제 제기 (Problem)
현재 에이전트 코드 벤치마크 (Agent-as-a-Judge, AAAJ) 평가는 대부분 **영어 (English)**를 기본 평가 언어로 고정하고 있습니다. 그러나 본 연구는 평가 언어가 변경될 때 평가 모델 (Judge Backbone) 의 순위가 뒤바뀔 수 있다는 중요한 문제를 제기합니다.
핵심 문제: 기존 연구들은 평가 언어를 고정된 환경 변수로 간주했으나, 실제로는 평가 프롬프트의 언어와 사용하는 LLM 백본 (Backbone) 간의 **상호작용 (Interaction)**이 존재하여 평가 결과에 결정적인 편향을 일으킵니다.
위험성: 영어 기반 평가만으로는 다국어 환경에서의 에이전트 성능을 왜곡하여 비교할 수 있으며, 이는 잘못된 모델 선정으로 이어질 수 있습니다.
2. 연구 방법론 (Methodology)
저자들은 DevAI 벤치마크를 기반으로 한 다국어 에이전트-as-저지 (Agent-as-a-Judge) 평가를 수행했습니다.
데이터셋 및 태스크:
55 개의 실제 AI 개발 태스크 (데이터 처리, 모델링, 훈련, 평가 등) 를 사용했습니다.
각 태스크는 **365 개의 명시적 요구사항 (Requirements)**으로 세분화되어 있으며, 단계별 진행 상황을 분석할 수 있도록 설계되었습니다.
평가 언어 (5 개):
언어적 다양성을 위해 **영어 (EN), 아랍어 (AR), 터키어 (TR), 중국어 (ZH), 힌디어 (HI)**를 선택했습니다.
평가 모델 (6 개 백본):
GPT-4o, GPT-5.4, Claude Sonnet 4.6, Gemini 3 Flash Preview, DeepSeek V3.2, Qwen3.5-9B 등 6 개의 주요 LLM 을 평가자 (Judge) 로 사용했습니다.
개발자 에이전트 프레임워크 (3 개):
MetaGPT, GPT-Pilot, OpenHands 등 3 개의 개발 에이전트 프레임워크를 통해 태스크를 실행했습니다.
실험 설계:
총 4,950 회의 평가 실행 (55 태스크 × 5 언어 × 3 프레임워크 × 6 백본) 을 수행했습니다.
프롬프트 현지화 (Localization): 평가자 프롬프트 스택 (요구사항 설명, 평가 기준, 정당화 지시 등) 을 각 언어로 번역하여 적용했습니다.
Ablation Study: 평가자 지시문 (Instruction) 만 영어로 남기고 벤치마크 내용만 번역하는 '부분 현지화'와 전체를 번역하는 '완전 현지화'를 비교하여 언어의 영향을 분리했습니다.
3. 주요 기여 (Key Contributions)
언어 - 백본 상호작용의 체계적 증명: 평가 언어에 따라 백본 모델의 순위가 역전됨을 처음 체계적으로 증명했습니다. (예: 영어에서는 GPT-4o 가 최강이지만, 아랍어와 힌디어에서는 Gemini 가 우세함).
다국어 벤치마크 연구: 55 개 개발 태스크와 6 개 백본을 대상으로 한 대규모 다국어 평가 데이터를 구축하고 공개했습니다.
프롬프트 현지화 방법론: AAAJ 프롬프트 스택의 구조와 증거 기반 워크플로우를 유지하면서 언어만 현지화하는 실용적인 방법을 제시했습니다.
개방형 데이터 공개: 요약 지표뿐만 아니라 요구사항 수준의 전체 판단 (Judgments) 과 런타임 통계를 공개하여 재현성을 보장했습니다.
4. 주요 결과 (Results)
A. 언어에 따른 백본 순위 역전 (Ranking Inversion)
영어 (EN):GPT-4o가 가장 높은 만족도 (44.72%) 를 보였습니다.
아랍어 (AR) 및 힌디어 (HI):Gemini가 가장 높은 성능을 보였습니다 (아랍어 51.72%, 힌디어 53.22%). 특히 아랍어에서 Gemini 는 GPT-4o 보다 통계적으로 유의미하게 (p < 0.001) 높은 성능을 기록했습니다.
결론: 단일 언어 (영어) 평가는 다국어 배포 환경에서 모델의 실제 성능을 왜곡하여 비교할 수 있음을 시사합니다.
B. 백본 능력과 언어 효과의 관계
강력한 백본 (GPT-4o, Gemini): 언어에 따라 성능 편차가 크고 순위가 역전되는 현상이 뚜렷하게 나타났습니다.
약한 백본 (DeepSeek, Qwen): 모든 언어에서 성능이 낮아 (Floor tier) 언어에 따른 차이를 관찰하기 어려웠습니다. 즉, 언어 효과는 백본의 기본 능력이 일정 수준 이상일 때만 관찰됩니다.
C. 요구사항 유형별 민감도
데이터 로딩, 훈련과 같은 운영적 (Operational) 요구사항은 언어에 관계없이 비교적 안정적이었습니다.
모델 구축, 평가 지표와 같이 의미론적으로 밀집된 (Semantically dense) 요구사항은 언어에 따라 만족도 편차가 매우 컸습니다. (예: GPT-4o 에서 아랍어 '평가 지표' 만족도는 14.67% 였으나 영어에서는 58.67% 였음).
D. Ablation Study: 프롬프트 현지화의 중요성
힌디어 (Hindi) 사례: 평가자 지시문을 영어로 유지하고 벤치마크 내용만 번역한 '부분 현지화' 조건에서 만족도가 42.8% 에서 23.2% 로 급감했습니다.
아랍어 (Arabic) 사례: 부분 현지화 조건에서도 큰 변화가 없었습니다. 이는 아랍어가 LLM 학습 데이터에 더 많이 포함되어 있어 영어 지시문으로도 어느 정도 추론이 가능하지만, 힌디어와 같은 저자원 언어는 평가자 지시문의 현지화가 필수적임을 보여줍니다.
D. 백본 간 합의도 (Inter-Backbone Agreement)
6 개 백본 간의 요구사항 만족도 판단에 대한 Fleiss' κ 값은 0.231 이하로 매우 낮았습니다. 이는 백본 모델마다 어떤 요구사항이 충족되었는지에 대해 이견이 크다는 것을 의미하며, 단일 모델의 평가 결과만 신뢰할 수 없음을 시사합니다.
5. 의의 및 결론 (Significance & Conclusion)
이 연구는 언어가 중립적인 평가 변수가 아님을 강력하게 주장합니다.
평가 프로토콜의 변화 필요: 에이전트 벤치마크 평가 시 '평가 언어'와 '평가자 백본'을 명시적인 메타데이터로 보고해야 하며, 다국어 환경에서는 최소 두 개 이상의 백본을 사용하여 교차 검증해야 합니다.
프로세스 인식 평가의 가치: 단순한 태스크 완료율 (Task Solve Rate) 보다는 요구사항 단위의 부분적 진행 (Partial Progress) 을 평가하는 것이 다국어 환경에서 더 유익한 통찰을 제공합니다.
실무적 제언: 다국어 에이전트 배포 시, 평가 프롬프트의 현지화는 단순한 번역을 넘어 평가 안정성을 결정하는 핵심 요소이므로, 지시문 (Instruction) 까지 완전히 현지화해야 합니다.
결론적으로, 본 논문은 다국어 LLM 에이전트 평가에서 언어와 모델 간의 복잡한 상호작용을 무시할 수 없으며, 이를 고려하지 않은 평가는 신뢰할 수 없는 결과를 초래할 수 있음을 경고합니다.