← 최신 논문
🤖 AI

Agentic AI Scientists Are Not Built For Autonomous Scientific Discovery

본 정책 제안서는 현재 에이전트형 AI 시스템이 문제 선정의 근본적 한계, 암묵적 실험실 지식에 관한 훈련 데이터의 공백, 선호도 최적화로 인한 출력의 동질화, 그리고 부적절한 벤치마킹 등 근본적인 제약으로 인해 완전한 자율 과학 발견에 적합하지 않다고 주장하며, 시뮬레이션 기반 검증, 지속적 세계 모델, 그리고 필요 주도형 응용을 중심으로 한 재설계가 필요함을 역설합니다.

원저자: Harshit Bisht, Vinay Kumar, Kevin Maik Jablonka, Mausam, N. M. Anoop Krishnan

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Harshit Bisht, Vinay Kumar, Kevin Maik Jablonka, Mausam, N. M. Anoop Krishnan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 "자율적 과학적 발견을 위해 에이전트 AI 과학자는 설계되지 않았다"는 제목의 논문을 간단한 언어와 창의적인 비유로 번역한 설명입니다.

핵심 아이디어: "코파일럿" 대 "선장"

미지의 바다를 항해하여 새로운 섬을 찾아보려 한다고 상상해 보세요.

  • 현재의 AI: 그것은 놀라울 정도로 똑똑한 코파일럿입니다. 지도를 읽고, 가장 빠른 경로를 계산하며, 당신이 정확히 어디로 가야 하는지 말해 주면 배를 조종할 수도 있습니다. 인간이 제시한 문제를 해결하는 데는 탁월합니다.
  • 논문의 주장: 저자들은 이 코파일럿이 선장이 될 준비가 되지 않았다고 말합니다. 어떤 섬을 찾아야 할지 결정할 수 없고, 지도가 잘못되었을 때 무엇을 해야 할지 모르며, 다른 사람들이 이미 보고 있는 섬과 정확히 같은 섬을 제안하는 경향이 있습니다.

이 논문은 AI 가 과학자들을 돕는 데 훌륭한 도구이지만, 과학적 전 과정을 AI 에게 맡기려고 한다면 근본적으로 결함이 있다고 주장합니다.


네 가지 주요 장애물

저자들은 AI 가 아직 "자율적 과학자"가 될 수 없는 네 가지 구체적인 이유를 지적합니다.

1. "맥나마라 함정": 측정하기 쉬운 것만 측정하기

비유: 경찰서장이 티켓 수를 세기 쉽다는 이유로 횡단보도 위반만 체포하고, 추적하기 어려운 은행 강도와 같은 실제 범죄는 무시한다고 상상해 보세요.
논문의 주장: AI 시스템은 측정 가능한 것 (데이터 수치 등) 을 최적화하도록 훈련됩니다. 이로 인해 가장 중요하고 어렵고 "측정 불가능한" 과학적 질문들을 무시하게 됩니다.

  • 실제 사례: 배터리 연구에서 AI 는 계산할 수 있는 "전도도"에만 집중할 수 있습니다. "이 재료가 실제로 제조에 안전한가?"나 "10 년 동안 지속될 것인가?"와 같이 messy 하고 점수 매기기 어려운 정량화되지 않은 요소들은 무시합니다.

2. "침묵하는 도서관": 실수를 놓치다

비유: 시험 공부를 하는 학생이 모든 정답을 나열하지만, 저자가 실수를 하거나 혼란스러워하거나 실패한 방법을 시도했던 페이지는 모두 삭제된 교과서만 가지고 있다고 상상해 보세요.
논문의 주장: AI 는 출판된 과학 논문에서 학습합니다. 하지만 과학에는 "출판 편향"이 있습니다. 학술지는 성공 사례만 인쇄하고 "실패한 실험"과 "암묵적 지식" (과학자들이 수행을 통해 배우는 기록되지 않은 비법, 예: "비 오는 날에는 이 화학 물질들을 섞지 마세요") 은 폐기합니다.

  • 결과: AI 는 과학이 성공의 직선이라고 생각합니다. 실패를 처리하는 방법을 모르기 때문에, 현실 세계에서 막다른 길에 부딪히면 방향을 전환하는 방법을 모릅니다. 마치 레시피만 읽고 실제로 요리를 태워본 적도, 나쁜 재료를 어떻게 조절하는지 배운 적도 없는 요리사와 같습니다.

3. "군집 정신": 모두 같은 생각을 하다

비유: 다섯 명의 천재에게 새로운 아이스크림 맛을 발명해 달라고 요청한다고 상상해 보세요. 만약 그들이 모두 같은 학교에 다녔고, 같은 책을 읽었으며, "딸기"를 좋아하는 같은 선생님에게 평가를 받았다면, 모두 딸기 아이스크림을 발명할 것입니다.
논문의 주장: 논문은 이를 "다양성 압축"이라고 부릅니다. AI 모델은 동일한 출판 문헌으로 훈련된 후, 인간이 정중하고 동의하는 어조로 들리도록 "튜닝"됩니다.

  • 실험: 저자들은 서로 다른 회사에서 개발한 다양한 AI 모델들에게 새로운 과학적 아이디어를 제안하도록 요청했습니다. 비록 모델들은 달랐지만, 모두 정확히 같은 아이디어를 생각해 냈습니다. 그들은 "인기 있는" 답변 (특정 유형의 배터리 재료 등) 으로 수렴하고 기발하거나 새로운, 혹은 위험한 아이디어는 무시했습니다. 열 명의 AI 과학자에게 가설을 물어보면, 실제로는 한 명의 과학자가 열 번 반복한 답변을 얻는 것과 같습니다.

4. "비디오 게임" 문제: 현실 세계의 피드백 부재

비유: 정답을 맞히면 점수를 얻지만, 추측한 것을 실제로 만들어 볼 필요는 없는 비디오 게임을 한다고 상상해 보세요. 현실 세계를 건드리지 않고도 게임을 이길 수 있습니다.
논문의 주장: 현재의 AI 벤치마크 (시험) 는 비디오 게임과 같습니다. AI 에게 한 번 결과를 예측하게 하고, 맞으면 금별을 줍니다. 실제 과학은 순환 과정입니다: 추측하고, 테스트하고, 테스트가 실패하면 추측을 바꾸고 다시 테스트합니다.

  • 격차: AI 는 "추측" 부분에서는 훌륭합니다. 하지만 "순환" 부분에서는 형편없습니다. 실험이 실패하면 AI 는 종종 이를 "노이즈"로 취급하고 생각을 바꾸는 단서로 삼지 않습니다. "좋아, 내 시뮬레이션이 틀렸구나; 물리학에 대한 내 이해를 다시 써야겠다"라고 말할 수 있는 메커니즘이 없습니다.

해결책: AI 를 어떻게 고칠 것인가

저자들은 AI 사용을 중단해야 한다고 말하지 않습니다. 우리가 AI 를 어떻게 구축할지 바꿔야 한다고 말합니다.

  1. "숨겨진 규칙" 가르치기: 최종 논문뿐만 아니라 실험실 작업 영상과 실패한 실험 기록으로 AI 를 훈련시켜야 합니다. AI 는 실제 과학의 messy 함에서 배워야 합니다.
  2. "군집 정신" 중단하기: AI 가 인간 심사원을 기쁘게 하려고만 하지 않도록 훈련 방식을 바꿔야 합니다. 기발하고 다양할 수 있도록 장려해야 합니다.
  3. "사전 등록" 규칙: AI 가 실험을 수행하기 전에 공개 로그에 계획과 가설을 기록해야 합니다. 이렇게 하면 한 번에 백만 가지 일을 시도하다가 성공한 것 하나만 보여주는 "p-hacking"이라는 속임수를 막을 수 있습니다.
  4. 시뮬레이터를 교사로서 활용하기: 책만 읽는 대신 AI 는 과학을 위한 "비행 시뮬레이터"처럼 작용하는 고정밀 컴퓨터 시뮬레이션에서 연습해야 합니다. 이를 통해 실제 자원을 낭비하지 않고 추락하고 배울 수 있습니다.
  5. "세계 모델": AI 는 어제 배운 것을 기억하고 오늘 신념을 업데이트하는 지속 가능한 기억이 필요합니다. 창문이 닫히는 순간 대화를 잊어버리는 챗봇이 되어서는 안 됩니다.

결론

이 논문은 결론적으로 **AI 는 인간이 일을 더 빠르게 수행하도록 돕는 훌륭한 "공동 과학자"**라고 말합니다. 하지만 길을 이끄는 능력을 갖춘 "자율적 과학자"는 아직 아닙니다.

지금 당장 AI 에게 주도권을 맡기려 한다면, 우리는 단지 같은 오래된 아이디어를 더 빠르게 얻게 될 뿐입니다. 인간의 판단, 직관, 그리고 실패에서 배우는 능력이 필요한 어렵고 messy 하며 진정한 획기적인 질문들은 무시될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →