← 최신 논문
💻 computer science

Sci-Rho: A Multilingual Visually-Grounded Symbolic Benchmark for STEM Problems

이 논문은 5개 과목과 7개 언어에 걸쳐 4,242개의 실행 가능한 STEM 문제 템플릿으로 구성된 다국어, 시각적 근거 기반 심볼릭 벤치마크인 Sci-Rho를 소개하며, 이는 정적인 평균값이 아닌 최악의 경우의 변형들을 대상으로 평가했을 때 최첨단 시각-언어 모델(Vision-Language Models)에서 나타나는 상당한 강건성 격차를 드러낸다.

원저자: Muhammad Falensi Azmi, Ikhlasul Akmal Hanif, Vallerie Alexandra Putra, Adi Yeltay, Abdullah Mubarak, Fajri Koto

게시일 2026-06-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Muhammad Falensi Azmi, Ikhlasul Akmal Hanif, Vallerie Alexandra Putra, Adi Yeltay, Abdullah Mubarak, Fajri Koto

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 새로운 학생의 과학 문제 해결 능력을 테스트하고 있다고 상상해 보십시오. 과거에 연구자들은 학생에게 단 하나의 정적인 그림과 질문이 담긴 워크시트 한 장을 건네주곤 했습니다. 학생이 맞히면 통과였습니다. 하지만 이 논문은 그것이 마치 운전자에게 빈 직선 도로에서만 운전 테스트를 하는 것과 같다고 주장합니다. 그것은 운전자가 갑작스러운 포트홀이나 우회로, 혹은 다른 날씨 조건도 감당할 수 있는지 알려주지 않습니다.

이 논문의 저자들인 Sci-ρ는 AI "학생"(구체적으로는 시각-언어 모델, 즉 VLM)을 위한 훨씬 더 까다롭고 역동적인 운전 테스트를 구축하기로 했습니다.

다음은 그들이 무엇을 했고 무엇을 발견했는지에 대한 간단한 요약입니다:

1. "모양 변형" 테스트 (데이터셋)

연구자들은 AI에게 606개의 정적인 과학 질문을 주는 대신, 디지털 공장을 구축했습니다.

  • 설계도: 그들은 수학, 물리, 화학, 생물학, 컴퓨터 과학 분야의 문제들을 위한 606개의 "템플릿"을 만들었습니다. 이것들은 마스터 설계도라고 생각하면 됩니다.
  • 공장: 그들은 이 설계도를 가져와서 각 문제의 약간씩 다른 버전 10개를 즉석에서 찍어내는 컴퓨터 코드(Python)를 작성했습니다.
    • 예시: 만약 수학 문제가 정사각형의 넓이를 묻는다면, 공장은 한 변의 길이가 5인 버전, 7인 버전, 색상이 다른 버전, 혹은 아예 다른 모양인 버전 등을 출력할 수 있습니다.
  • 다국어의 변주: 그들은 영어로만 작업하지 않았습니다. 그들은 이미지는 동일하게 유지하면서 지시 사항을 7개의 언어(스와힐리어, 힌디어, 아랍어 포함)로 번역했습니다.
  • 결과: 그 결과 42,420개의 고유한 문제를 얻었습니다. 이는 AI에게 모든 책이 핵심 논리는 같지만 겉모습은 조금씩 다른 10가지 판본을 가진 거대한 도서관을 제공하는 것과 같습니다.

2. "평균" vs "최악의 경우"의 함정

연구자들은 17개의 서로 다른 AI 모델을 이 방대한 라이브러리로 테스트했습니다. 그들은 두 가지 점수를 살펴보았습니다:

  • 평균 정확도: AI가 문제의 10개 버전 중 얼마나 자주 정답을 맞혔는가.
  • 최악의 경우 정확도: AI가 10개의 버전 모두를 얼마나 자주 맞혔는가.

중요한 발견:
AI 모델들은 "평균" 점수에서는 훌륭해 보였습니다. 하지만 연구자들이 "최악의 경우" 점수를 확인했을 때, 모델들은 무너졌습니다.

  • 비유: 어떤 학생이 수학 문제 10개 중 9개를 맞혔다고 가정해 봅시다. 그 학생은 똑똑해 보입니다. 하지만 숫자를 약간만 바꿔서 똑같은 10문제를 다시 풀게 했을 때, 이번에는 4개를 틀린다면, 그 학생은 실제로 수학적 "추론"을 하고 있는 것이 아닙니다. 그들은 아마도 단순히 패턴을 암기하거나 숫자의 형태를 보고 추측하고 있는 것일 가능성이 높습니다.
  • 결과: 가장 똑똑하고 비싼 AI 모델(GPT-5.4 같은)조차도 큰 격차를 보였습니다. 모델들은 문제를 쉽게 풀 수 있었지만, 그래프의 색상을 바꾸거나 숫자를 약간만 바꿔도 종종 실패했습니다. 작고 저렴한 모델들은 훨씬 더 처참하게 실패했습니다.

3. 언어 장벽

연구자들은 AI가 영어 이외의 언어로 지시를 받았을 때 더 어려움을 겪는지 확인했습니다.

  • 거대 모델: 거대하고 비싼 모델들은 다국어 구사자 같았습니다. 그들은 영어, 중국어, 스와힐리어를 거의 대등하게 잘 처리했습니다.
  • 작은 모델: 작고 오픈 소스인 모델들은 영어만 할 줄 아는 관광객 같았습니다. 지시 사항이 덜 흔한 언어(스와힐리어 등)로 바뀌면 성능이 급격히 떨어졌습니다. 과학 문제는 동일함에도 불구하고, 그들은 언어의 변화만으로 혼란을 느끼는 듯 보였습니다.

4. "눈 vs 뇌" 문제

연구자들은 AI 모델 내부를 들여다보며 모델이 어떻게 "생각하는지" 측정했습니다. 그들은 모델이 그림텍스트 중 어디에 얼마나 주의를 기울이는지 측정했습니다.

  • 결과: 모델의 주의력은 언어에 따라 달라졌습니다.
    • 중국어로 되어 있을 때, 모델은 그림에 덜 의존하고 텍스트에 더 의존했습니다.
    • 카자흐어나 힌디어로 되어 있을 때, 모델은 그림에 매우 크게 의존했습니다.
  • 비유: 이는 마치 AI가 "이 언어를 잘 이해하지 못하니, 그림을 보고 때려 맞히자"라고 생각하는 것과 같습니다. 언어를 완벽하게 이해할 때는 단어를 더 신뢰합니다. 이는 AI가 인간처럼 이미지를 진정으로 "보는" 것이 아니라, 텍스트가 혼란스러울 때 이미지를 일종의 지팡이(crutch)로 사용하고 있음을 시사합니다.

5. AI가 막혔던 지점

AI가 실패했을 때, 연구자들은 오류를 다음과 같이 분류했습니다:

  1. 그림을 잘못 읽음 (63%): AI가 도표의 점 개수를 세지 못하거나 그래프의 숫자를 제대로 읽지 못했습니다.
  2. 잘못된 논리 (29%): AI가 올바른 공식은 알고 있었지만, 그것을 엉뚱한 곳에 적용하거나 존재하지 않는 사실을 만들어냈습니다.
  3. 수학적 오류 (8%): AI가 논리는 맞았으나 단순 산술에서 실수했습니다.

결론

이 논문은 정적인 테스트가 우리를 속이고 있다고 결론짓습니다. AI가 특정 과학 문제를 한 번 풀 수 있다고 해서 그것이 과학을 이해한다는 뜻은 아닙니다. 그것은 단지 훈련 과정에서 본 패턴을 인식하고 있는 것일 수도 있습니다.

AI가 정말 똑똑한지 알기 위해서는, 테이블을 흔들고, 숫자를 바꾸고, 언어를 교체하여 여전히 문제를 풀 수 있는지 확인해야 합니다. 만약 풀지 못한다면, 그것은 추론하는 것이 아니라 그저 추측하고 있는 것입니다. Sci-ρ는 바로 그 테이블을 흔들기 위해 설계된 도구입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →