EuroExec: Frontier Language Models Fall Short of Expert Judgment on European Executive Decision Tasks
이 논문은 인간 전문가가 평가한 413개의 실제 유럽 경영진 업무로 구성된 벤치마크인 EuroExec을 소개하며, 가장 강력한 최첨단 거대 언어 모델들조차 단 56.9%의 과제만을 해결하여 전문적인 인간 기준에 크게 미치지 못하고 전문가가 작성한 참조 모델에 지속적으로 뒤처진다는 사실을 밝혀냈다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대하고 복잡한 기업을 운영하는 데 도움을 줄 새로운 비서를 채용한다고 상상해 보십시오. 당신에게는 단순히 교과서의 사실을 암송할 수 있는 사람이 아니라, 무질서한 현실 세계의 문제를 바라보고, 현지의 규칙을 이해하며, 실제로 작동하는 탁월한 계획을 세울 수 있는 전략가가 필요합니다. 이것이 바로 '거대 언어 모델(LLM)'의 세계입니다. 이는 방대한 양의 텍스트를 학습하여 이야기를 쓰고, 질문에 답하며, 퍼즐을 풀 수 있는 매우 똑똑한 컴퓨터 프로그램입니다. 한동안 우리는 이 AI 비서들을 네 가지 선택지 중 정답을 고르게 하는 단순한 객관식 퀴즈로 테스트해 왔습니다. 하지만 현실 세계의 문제들은 선택지를 가지고 나타나는 법이 거의 없습니다. 문제들은 개방적이고, 무질서하며, 깊은 판단력을 요구합니다. 모든 이들의 머릿속에 있는 큰 의문은 이것입니다. 이 AI '천재'들이 실제로 경영진이 매일 내리는 고도의 이해관계가 걸린 결정을 처리할 수 있을 것인가, 아니면 그저 시험을 아주 잘 치르는 것뿐인가?
Sovrano AI의 연구팀은 이를 알아내기 위해 EuroExec이라는 완전히 새롭고 매우 어려운 도전 과제를 만드는 것으로 결론을 내렸습니다. 연구진은 단순한 퀴즈 대신, 유럽의 실제 비즈니스 시나리오를 바탕으로 한 413개의 복잡하고 긴 형태의 질문으로 구성된 거대한 시험을 구축했습니다. 그들은 단순히 AI가 추측하게 만든 것이 아니라, 재무, 마케팅, 비즈니스 및 제품 관리 분야에서 수십 년의 경력을 가진 47명의 실제 전문가를 고용하여 질문을 작성하고 답변을 채점하게 했습니다. 이 전문가들은 모든 답변에 대해 엄격한 요구 사항 체크리스트를 만들었는데, 이는 마치 주니어 직원의 업무를 확인하는 엄격한 상사와 같았습니다. 그런 다음 연구진은 세계에서 가장 발전된 6개의 AI 모델에게 이 문제들을 해결하도록 요청했고, AI의 성과를 인간 전문가와 비교했습니다.
결과는 일종의 현실 자각 타임이었습니다. 세계에서 가장 똑똑한 AI 모델들조차 전문가들을 따라잡기 위해 고군분투했습니다. 가장 뛰어난 AI 모델조차 작업의 약 **56.9%**만을 "해결"했을 뿐이며, 이는 AI가 절반 가까운 질문에서 전문가 수준의 기준을 충족하는 데 실패했음을 의미합니다. 반면, 인간 전문가들은 자신의 이상적인 답변을 작성하도록 요청받았을 때 **92.4%**라는 완벽에 가까운 비율로 문제를 해결했습니다. 연구진이 인간 전문가들에게 블라인드 테스트 방식으로 답변의 순위를 매기도록 요청했을 때, 전문가들은 AI의 답변보다 인간이 작성한 답변을 **74%**의 비율로 더 선호했습니다.
연구는 또한 AI가 어떻게 실패했는지도 살펴보았습니다. 모델들은 구조화된 텍스트를 작성하고 명확하게 소통하는 데는 준수했지만, 실제적인 추론과 논리 측면에서는 한계를 드러냈습니다. 그들은 종종 유럽 시장의 특정 현지 규칙을 놓치거나 현실적이고 실행 가능한 계획을 세우는 데 실패했습니다. 흥-미롭게도, 연구진은 시간과 비용을 절약하기 위해 다른 AI 프로그램을 사용하여 답변을 자동으로 채점하는 시도를 했습니다. 그러나 이러한 "AI 판사"들은 신뢰할 수 없었습니다. 그들은 최고의 모델들의 성과를 과대평가하는 경향이 있었고, 인간 전문가들이 포착해내는 미묘한 뉘앙스를 놓쳤습니다.
결론적으로, 이 논문은 AI가 텍스트를 생성하는 데는 매우 능숙해지고 있지만, 고차원적인 의사결정에서 인간 전문가를 대체할 준비는 아직 되지 않았음을 시사합니다. 최고 AI의 '해결률(Solve Rate)'은 가장 쉬운 질문에서도 겨우 50%를 넘겼으며, 가장 유능한 모델들조차 경영 업무에 요구되는 전문가 수준에는 훨씬 못 미쳤습니다. 연구진은 이러한 종류의 복잡한 현실 세계 과업에 있어서는 여전히 인간의 판단이 황금 표준이며, 컴퓨터가 정말로 전문가처럼 "생각"하고 있는지 알려주기 위해 자동화된 측정이나 AI 판사에 의존할 수는 없다고 결론지었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.