ASI-Bench: At the Dawn of Artificial Superintelligence
이 논문은 AI가 자율적이고 혁신적인 과학 연구를 수행하는 능력을 평가하기 위해 설계된 11개 과학 분야의 60개 프로젝트 수준 연구 과제로 구성된 포괄적인 벤치마크인 ASI-Bench를 소개하며, 인간의 가이드를 점진적으로 줄여나감으로써 현재의 최첨단 시스템들이 여전히 인간의 입력에 크게 의존하고 있으며 진정한 인공 일반 초지능(ASI)에 도달하기에는 아직 멀었다는 점을 밝혀냈다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인간처럼 생각할 수 있는 기계를 향한 여정은 오랫동안 컴퓨터가 얼마나 잘 사실을 기억하고, 알려진 퍼즐을 풀며, 특정 답에 도달하기 위해 일련의 지침을 따를 수 있는지에 초점을 맞춰왔습니다. 수년 동안 가장 진보된 인공지능 시스템들은 이러한 과업에서 탁월한 능력을 보였으며, 방대한 인간의 지식 라이브러리를 흡수하고 이를 놀라운 속도로 적용해 왔습니다. 하지만 다른 종류의 지능이 여전히 미지의 영역으로 남아 있습니다. 그것은 바로 미지의 세계로 발을 내딛고, 무질서하고 설명되지 않은 문제를 바라보며, 단순히 답을 찾는 것을 넘어 그 답을 찾아가는 경로 자체를 파악하는 능력입니다. 이것은 과학적 발견의 영역이며, 여기서 목표는 공식을 회상하는 것이 아니라 공식을 발명하고, 실험을 설계하며, 모호한 질문을 검증된 결과로 바꾸는 것입니다. 새로운 연구를 이끄는 질문은 현재의 기계들이 진정으로 스스로 이를 할 수 있는지, 아니면 여전히 모든 단계마다 인간의 손길에 전적으로 의존하고 있는지에 관한 것입니다.
전 세계의 대학과 연구소 소속 연구진은 이 질문에 답하기 위해 ASI-Bench라고 불리는 새로운 테스트 환경을 구축했습니다. 그들은 물리학과 화학부터 생물학과 공학에 이르기까지 11개의 서로 다른 과학 분야에 걸쳐 60개의 복잡한 연구 프로젝트를 만들었습니다. 각 프로젝트는 원시 데이터, 구체적인 목표, 그리고 작동하는 솔루션을 만들어내야 하는 요구 사항을 갖추어 실제 과학적 조사를 모방하도록 설계되었습니다. 이 설계의 탁월함은 기계들을 어떻게 테스트했느냐에 있습니다. 모든 연구 프로젝트에 대해, 그들은 동일한 AI 시스템을 네 번 실행하되, 제공하는 도움의 양을 변경했습니다. 첫 번째 시나리오에서 AI는 문제를 해결하는 정확한 방법이 담긴 완전한 단계별 매뉴얼을 받았습니다. 두 번째에서는 마치 망치를 사용하는 법을 보여주지 않고도 "망치를 사용하라"고 말하는 것처럼, 일반적인 방법만을 전달받았습니다. 세 번째에서 AI는 진행 방법에 대한 지침 없이 오직 문제와 데이터만을 받았으며, 이로 인해 스스로 방법을 결정해야 했습니다. 마지막으로 네 번째 시나리오에서는 기계가 실제 과업에 집중할 수 있는지 확인하기 위해 혼란스럽고 무관한 정보를 추가했습니다.
결과는 현재 인공지능의 상태에 대한 냉혹한 현실을 보여줍니다. 기계들이 완전한 지침을 받았을 때, 그들은 평균적으로 100점 만점에 약 51점을 기록하며 준수한 성과를 보였습니다. 그러나 연구자들이 단계별 안내를 제거하고 AI에게 스스로 절차를 파악하도록 요청하자, 성능이 급락했습니다. AI가 스스로 방법을 선택해야 했을 때, 평균 점수는 약 27점으로 떨어졌습니다. 이러한 급격한 하락은 오늘날의 시스템들이 인간이 이미 닦아놓은 길을 따르는 데는 뛰어나지만, 스스로 길을 만드는 데는 엄청난 어려움을 겪는다는 점을 시사합니다. 가장 큰 장애물은 적절한 도구를 선택하는 것이 아니라, 일반적인 아이디어를 작동 가능한 상세한 계획으로 번역하는 것이었습니다. 심지어 AI가 어떤 방법을 사용할지 알고 있었음에도 불구하고, 필요한 단계들을 구성하는 데 실패하여 상세한 지침이 제거되었을 때 점수가 크게 하락했습니다.
연구진은 또한 추가적인 방해 정보가 기계를 혼란스럽게 만드는 정도가 지침을 제거했을 때만큼 크지 않다는 것을 발견했습니다. AI에게 어려운 과업을 주면서 프롬프트에 관련 없는 사실들과 잡담을 덧붙였을 때, 그 성능은 지침이 전혀 없을 때와 거의 동일하게 유지되었습니다. 이는 현재 시스템의 주요 약점이 집중력 부족이나 노이즈를 걸러내는 능력의 부재가 아니라, 인간이 정의한 로드맵 없이는 작동할 수 없는 근본적인 무능력에 있다는 것을 나타냅니다. 이 연구에는 18가지의 서로 다른 AI 모델과 소프트웨어 에이전트 조합이 포함되었으며, 가장 강력한 추론 능력을 사용하는 가장 진보된 구성조차 스스로의 힘으로 수행했을 때 약 52점에 불과했습니다. 이는 완만한 성공이긴 하지만, 독립적인 과학 연구를 수행하는 데 필요한 신뢰성에는 훨씬 못 미치는 수준입니다.
이러한 자율성의 대가는 또한 높습니다. AI가 스스로 단계를 파악해야 했을 때, 기계는 단순히 명령을 따를 때보다 훨씬 더 많은 컴퓨팅 파워와 시간을 소비했습니다. 어떤 경우에는 가이드 없이 동일한 과업을 시도하는 것만으로도 컴퓨팅 자원을 거의 60% 더 많이 사용했으며, 종종 루프에 빠지거나 비효율적인 경로를 시도하기도 했습니다. 이는 진정한 자율성이 지능의 문제일 뿐만 아니라 효율성의 문제임을 시사합니다. 인간의 안내가 없으면, 기계들은 어떻게 해야 하는지 안내받았다면 빠르게 해결했을 문제들을 풀기 위해 막대한 노력을 낭비하게 됩니다. 연구는 우리가 아직 인공 일반 지능(Artificial Superintelligence)의 서막, 즉 기계가 인간의 개입 없이 미지의 영역을 탐구하고 새로운 지식을 창조하는 상태에 도달하기에는 멀리 있다고 결론짓습니다. 대신, 우리는 기계가 복잡한 과업을 수행할 수 있는 강력한 조수이지만, 전략을 정의하는 데 있어서는 여전히 인간에게 크게 의l의존하는 단계에 머물러 있습니다.
이 새로운 벤치마크는 최종적인 판결이 아니라 과학계의 출발점이 되도록 의도되었습니다. 연구진은 자신들의 60개 과업과 테스트 방법을 세상에 공개하여, 다른 과학자와 엔지니어들이 새로운 문제를 기여하고 자신들의 시스템을 이 도전 과제들에 대해 테스트할 수 있도록 초대했습니다. 그들은 새로운 어렵고 까다로운 연구 프로젝트를 지속적으로 추가하고 테스트를 정교화함으로써, 커뮤니티가 발전을 더욱 정확하게 추적할 수 있다고 믿습니다. 목표는 단순한 기억력과 논리의 테스트를 넘어, 기계가 미지의 영역을 항해하고 빈 페이지를 발견으로 바꿀 수 있는 진정한 과학자처럼 생각할 수 있는지 측정하는 미래로 나아가는 것입니다. 현재로서는, 데이터가 보여주듯 우리 기계들이 점점 더 똑똑해지고는 있지만, 여次に 다음 단계로 무엇을 해야 할지 우리에게 말해주기를 기다리고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.