← 최신 논문
💬 NLP

Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains

Relay-Bench는 단일 프롬프트 내에서 코딩, 수학, 웹 검색과 같은 다양한 기술을 통합해야 하는 미포화 복합 문제를 제시함으로써 대규모 언어 모델의 다중 도메인 추론 체인을 평가하도록 설계된 총체적인 텍스트 전용 벤치마크이며, 선도적인 모델인 GPT-5.5 (xHigh)는 43.3%의 점수를 달성했습니다.

원저자: Liam Swayne

게시일 2026-07-22
📖 3 분 읽기☕ 가벼운 읽기

원저자: Liam Swayne

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 가장 좋아하는 스마트 비서가 단순히 상식 퀴즈를 풀거나 코드를 짜는 수준을 넘어, 진정한 멀티태스킹의 마법사가 되는 세상을 상상해 보십시오. 급변하는 인공지능 분야에서 연구자들은 이 디지털 두뇌들이 실제로 얼마나 똑똑한지 확인하기 위해 본질적으로 표준화된 시험인 '벤치마크'를 끊임없이 구축하고 있습니다. 오랫동안 이러한 테스트는 학교의 개별 과목과 같았습니다. 수학 시험 하나, 역사 시험 하나, 그리고 코딩 시험 하나가 따로 있었던 것이죠. 하지만 실제 삶은 그렇게 작동하지 않습니다. 당신이 사람에게 여행 계획을 세워달라고 요청할 때, 그들은 단순히 거리만 계산하는 것이 아닙니다. 날씨를 확인하고, 리뷰를 읽고, 호텔을 예약하며, 어쩌면 친구에게 보낼 재미있는 이메일을 쓰는 일까지 한 번에 수행합니다. 이 논문은 AI 연구의 특정 영역인 '추론 체인(reasoning chains)'을 깊이 파고듭니다. 여기서 목표는 모델이 공을 놓치지 않고 동시에 여러 종류의 작업을 얼마나 잘 다룰 수 있는지 확인하는 것입니다. 모두가 관심을 갖는 핵심 질문은 이것입니다. AI 모델들이 현실 세계의 무질서하고 복잡한 다단계 문제들을 처리할 수 있을까요, 아니면 상황이 너무 복잡해지면 혼란에 빠져 포기해 버릴까요?

여기에 AI 모델들이 정신적인 '이어달리기'를 할 수 있는지 확인하기 위해 설계된 새롭고 매우 도전적인 테스트인 Relay-Bench가 등장합니다. 이 테스트의 제작자들은 모델에게 수학 문제 하나를 풀거나 시 한 편을 쓰라고 요구하는 대신, 하나의 거대한 프롬프트 안에 수학 퍼즐 풀기, 웹에서 특정 사실 찾기, 코드 일부 작성하기, 암호 해독하기와 같은 서로 다른 작업들을 하나의 긴 체인으로 엮어 놓았습니다. 마치 비디오 게임 레벨에서 구덩이를 뛰어넘고, 문을 열기 위해 수수께끼를 풀고, 그다음 보스와 싸우는 동안 '리셋' 버튼을 누르지 않아야 하는 상황을 생각해보십시오. 연구진은 이 중에서도 특히 어떤 것들은 단 하나의 숫자를 찾기 위해 소설 한 권을 읽는 것처럼 느껴질 정도로 길고 가짜 정보로 가득 찬 31개의 복잡한 챌린지를 구축했습니다. 또한 그들은 모든 지시문의 단어를 이상한 세 글자 코드로 대체하는 '비밀 코드' 레이어를 추가하여, AI가 문제를 풀기 시작하기도 전에 메시지를 먼저 해독해야 하도록 만들었습니다.

당시 최고의 AI 모델 3종(GPT-5.5, Gemini 3.1 Pro, Claude Opus 4.7)을 이 시련에 통과시켜 보았을 때, 결과는 다소 충격적이었습니다. 가장 똑똑한 모델인 GPT-5.5조차 정답률이 약 **43.3%**에 불가교했습니다. 절반에도 미치지 못하는 수치입니다! 다른 모델들의 점수는 훨씬 더 낮았으며, 그중 하나는 겨우 **16.7%**를 기록했습니다. 이 논문은 AI 모델들이 단일 작업에는 매우 능숙해지고 있지만, 여러 가지 다른 기술을 하나로 엮어 달라고 요청받을 때, 특히 지시사항이 혼란스럽거나 작업이 매우 길 때 상당한 어려움을 겪는다는 점을 시사합니다. 실제로 이 테스트는 너무 어려워서 많은 모델이 단순히 포기하거나 루프에 빠져 경주를 끝내지 못했습니다.

연구진은 또한 이 모델들이 때때로 '환각(hallucinate)'을 일으킨다는 사실도 발견했는데, 이는 답을 모를 때 답을 지어내는 것을 의미하는 멋진 표현입니다. Claude Opus 4.7 모델은 매우 신중했습니다. 이 모델은 인코딩된 질문들에 대해 답변하기를 거부했는데, 이는 아마도 안전 필터가 너무 엄격했기 때문일 것입니다. Gemini 3.1 모델은 더 자주 추측을 시도했지만 결국 더 많은 오답을 냈습니다. 이 연구는 현재의 AI 모델들이 우리가 바라는 전천후 전문가가 되기에는 아직 갈 길이 멀다는 점을 강조합니다. 이들은 수학 시험은 만점을 받을 수 있지만, 수학을 푸는 동시에 시를 번역하고 레시피를 검색하라고 하면 패닉에 빠질 수 있는 우수한 학생들과 같습니다. 저자들은 AI 모델이 이러한 종류의 '이어달리기' 테스트를 일관되게 통과할 수 있을 만큼 숙련되기까지 또 다른 1~2년이 걸릴 수 있다고 제안하며, 모델이 똑똑해짐에 따라 이 테스트들도 이를 따라잡기 위해 더욱 어려워져야 한다고 경고합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →