BEAR-Bench: A Bilingual Enterprise and Academic Reasoning Benchmark for Multimodal Models
이 논문은 텍스트가 풍부한 기업 및 학술 문서를 기반으로 인간이 주석을 달아 작성한 1,000개의 질문으로 구성된 이중 언어(영어-러시아어) 벤치마크인 BEAR-Bench를 소개하며, 이를 통해 멀티모달 거대 언어 모델의 복잡한 추론 능력과 환각 탐지 신뢰도를 평가함으로써 최첨단 시스템들 사이에서도 상당한 성능 격차가 존재함을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 사회에서 컴퓨터는 사진을 보고 그 안의 글자를 읽는 데 매우 능숙해졌습니다. 기계에게 거리 표지판 사진을 보여주면 그 표지판이 무엇이라고 쓰여 있는지 말할 수 있습니다. 뉴스 보고서의 그래프를 보여주면 선이 만드는 추세를 설명할 수 있는 경우가 많습니다. 멀티모달 이해(multimodal understanding)라고 알려진 이 능력은 시각과 언어를 하나의 기술로 결합한 것입니다. 오랫동안 과제는 단순히 기계가 텍스트를 명확하게 읽도록 하는 것이었습니다. 하지만 그다음 단계인 더 어려운 과제는 추론입니다. 이는 복잡한 문서를 보고 페이지 곳에 흩어져 있는 여러 가지 서로 다른 정보를 찾아내어, 어디에도 적혀 있지 않은 질문에 답하기 위해 이들을 연결하는 능력입니다. 표, 차트, 텍와 텍스트 단락으로 가득 찬 재무 보고서를 상상해 보십시오. 인간 전문가는 표의 숫자를 보고, 차트의 추세와 비교한 다음, 그 숫자가 왜 변했는지 이해하기 위해 텍스트의 문장을 읽을 수 있습니다. 컴퓨터에게 이와 같은 종류의 사고를 하도록 가르치는 것, 특히 문서가 정보로 밀집되어 있고 영어 이외의 언어로 작성된 경우, 이는 여전히 어려운 경계로 남아 있었습니다.
Yandex와 Applied AI Institute의 연구진은 이러한 종류의 복잡한 사고를 위해 특별히 설계된 새로운 테스트를 제작함으로써 이 문제를 해결하는 데 중요한 진전을 이루었습니다. 그들은 자신들의 창작물을 BEAR-Bench라고 부릅니다. 단순한 읽기에 집중하거나 컴퓨터가 외부 사실을 알고 있어야 했던 이전의 테스트들과 달리, 이 새로운 벤치마크는 기계가 단 하나의 페이지에 존재하는 정보만을 사용하여 문제를 해결하도록 요구합니다. 이 테스트는 영어와 러시아어를 모두 포함하는 이중 언어 체제로, 이는 기계가 영어와 중국어 이외의 언어에서 종종 어려움을 겪는 기술적 격차를 강조합니다. 연구진은 기업 재무 보고서, 투자자 발표 자료, 학술 과학 논문에 이르는 1,000개의 실제 문서를 수집했습니다. 이 페이지들은 단순하지 않습니다. 텍스트, 표, 차트, 다이어그램, 수학 공식들로 빽빽하게 채워져 있습니다.
이 테스트를 구축하기 위해 연구진은 단순히 컴퓨터에게 질문을 생성하도록 요청하지 않았습니다. 그들은 기술 분야의 학위를 가진 13명의 인간 전문가를 고용하여 질문과 답을 직접 손으로 작성하게 했습니다. 모든 페이지 이미지마다 전문가는 해결하기 위해 여러 단계가 필요한 질문을 만들어야 했습니다. 예를 들어, 질문은 컴퓨터에게 표에서 특정 값을 찾고, 관련 차트를 보고 그 값이 시간이 지남에 따라 어떻게 변했는지 확인한 다음, 그 변화의 이유를 설명하기 위해 텍스트의 문장을 읽도록 요구할 수 있습니다. 컴퓨터는 어떤 외부 지식도 사용할 수 없었으며, 제공된 이미지 내에서만 답을 찾아야 했습니다. 이는 테스트가 인터넷에서 사실을 암기하는 능력이 아니라, 눈앞의 문서로 추론하는 기계의 능력을 측정하도록 보장했습니다. 또한 연구진은 작업이 도전적이 될 수 있도록 다이어그램이나 방정식과 같은 시각적 복잡성이 충분히 포함되도록 문서를 신중하게 필터링했습니다.
연구진이 16개의 인공지능 모델을 이 테스트에 투입했을 때, 결과는 오늘날 기술이 어디에 와 있는지에 대한 명확한 그림을 보여주었습니다. 가장 성능이 좋은 모델들, 즉 현재 사용 가능한 가장 발전된 시스템들은 질문의 약 75%를 정확하게 답변했습니다. 이것이 인상적으로 들릴 수도 있지만, 이는 가장 똑똑한 기계조차도 네 문제 중 한 문제 꼴로 실수를 하고 있다는 것을 의미하기도 합니다. 연구는 이 모델들이 영어를 사용할 때보다 러시아어 문서를 다룰 때 눈에 띄게 성능이 떨어진다는 것을 발견했으며, 이는 언어가 여전히 중요한 장애물임을 확인시켜 줍니다. 더욱이, 문서의 유형도 중요했습니다. 모델들은 과학 논문보다는 비즈니스 보고서에서 더 어려움을 겪는 경향이 있었으며, 항목을 세거나 페이지의 서로 다른 부분에서 정보를 결합해야 하는 질문에서 특히 어려움을 겪었습니다.
연구진은 또한 기계가 왜 실패하는지를 면밀히 살펴보았습니다. 그들은 가장 흔한 오류가 논리의 부족 때문이 아니라, 단순한 지각 문제 때문이라는 것을 발견했습니다. 컴퓨터는 종종 표의 숫자를 잘못 읽거나, 차트의 특정 라벨을 놓치거나, 다이어그램의 화살표가 어디를 가리키는지 혼동했습니다. 일단 기계가 하나의 시각적 세부 사항을 잘못 읽으면, 나머지 추론 과정은 무너지게 됩니다. 이는 이러한 시스템이 문서를 분석하는 진정한 전문가가 되기 전에, 작은 세부 사항들을 훨씬 더 명확하게 보는 능력을 갖춰야 함을 시사합니다.
연구진은 모델을 테스트하는 것을 넘어, 기계가 실수를 하고 있는지 판단할 방법이 있는지 확인하기 위해 결과를 사용했습니다. 많은 실제 상황에서는 컴퓨터가 틀릴 수도 있다는 것을 아는 것만으로는 부족하며, 오류가 해를 끼치기 전에 이를 감지할 방법이 필요합니다. 연구팀은 이러한 실수를 포착하기 위한 여러 가지 다른 방법들을 테스트했습니다. 그들은 내부 작동 방식을 볼 수 없는 폐쇄형 독점 시스템의 경우, 또 다른 강력한 AI 모델을 판사로 사용하여 답을 검토하게 하는 것이 오류를 감지하는 가장 좋은 방법임을 발견했습니다. 내부 코드를 들여 들여다볼 수 있는 개방형 시스템의 경우, 컴퓨터 자체의 내부 확신 신호를 확인하는 것이 짧은 답변에는 효과적이었지만, 컴퓨터가 매우 길고 상세한 설명을 생성할 때는 어려움을 겪는다는 것을 발견했습니다. 연구는 우리가 진전을 이루고 있기는 하지만, 여전히 모든 오류를 잡아낼 완벽한 방법은 가지고 있지 않으며, 최고의 시스템들도 여전히 개선의 여지가 많다는 것으로 결론지었습니다.
이 연구는 단순한 읽기를 넘어 대화의 흐로를 옮겨놓는다는 점에서 중요합니다. 이는 기계가 텍스트를 읽을 수는 있지만, 그것을 가지고 생각하는 법은 여전히 배우는 중임을 보여줍니다. 어렵고, 이중 언어이며, 실제 문서에 초점을 맞춘 테스트를 만듦으로써 연구진은 기술이 강한 부분과 약한 부분을 보여주는 명확한 지도를 제공했습니다. 그들은 앞으로 나아가는 길이 단순히 더 큰 모델을 만드는 것이 아니라, 여러 언어로 된 전문적인 문서의 무질서하고 상세한 현실을 처리하는 더 나은 방법을 찾는 것임을 보여주었습니다. 기계가 차트를 신뢰성 있게 읽고, 표와 교차 참조하며, 세부 사항 속에서 길을 잃지 않고 그 연결 고리를 설명할 수 있을 때까지, 금융이나 과학과 같은 고위험 분야에서의 기계 사용에는 세심한 인간의 감독이 필요할 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.