← 최신 논문
💬 NLP

Agentic Auto-Research is Fuzz Testing

이 논문은 자율 연구 에이전트가 희소한 피드백과 비효율적인 샘플링 문제로 인해 어려움을 겪는 현재의 "생성 및 순위 지정(generate-and-rank)" 방식 대신, 탐색을 동적으로 유도하기 위해 인식적 진전의 조밀한 중간 신호를 활용하는 퍼즈 테스팅(fuzz testing)에서 영감을 얻은 "생성 및 탐색(generate-and-search)" 패러다임을 채택해야 한다고 주장한다.

원저자: Yifeng He, Jicheng Wang, Yinzhe Zhao, Jiachen Liu, Hao Chen

게시일 2026-08-11
📖 6 분 읽기🧠 심층 분석

원저자: Yifeng He, Jicheng Wang, Yinzhe Zhao, Jiachen Liu, Hao Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

발견을 향한 경주: 왜 "더 많은 추측"이 정답이 아닌가

초지능 로봇 과학자가 인간이 커피 한 잔을 타는 시간 동안 수천 개의 새로운 아이디어를 구상하고, 이를 테스트할 코드를 작성하며, 실험을 수행할 수 있는 세상을 상상해 보십시오. 이것이 바로 **자율 연구 에이전트(autonomous research agents)**가 만들어내는 흥미진진한 현실입니다. 이러한 AI 시스템은 가설을 생성하는 속도가 너무 빨라져서, 그 아이디어가 실제로 참인지 확인해야 하는 인간의 속도를 앞지르고 있습니다. 이는 병목 현상을 만듭니다. 로봇은 선생님이 숙제를 채점하는 속도보다 더 빠르게 정답을 외쳐대고 있는 셈입니다.

이를 해결하기 위해 많은 연구자가 "생성 및 순위 매기기(Generate and Rank)"라는 단순한 전략을 시도해 왔습니다. 로봇에게 백만 개의 추측을 하게 하고, 두 번째 AI를 사용하여 그 점수를 매긴 뒤, 상위권에 있는 것들만 남기는 방식입니다. 이는 마치 백만 명의 가수를 오디션 보고 가장 높은 점수를 받은 한 명을 뽑는 재능 경연 대회와 같습니다. 하지만 문제가 있습니다. 그 백만 개의 추측 중 대부분은 틀린 것이며, "채점"은 종종 무엇이 옳은지 또는 어떻게 개선할 수 있는지를 알려주는 것이 아니라, 단지 무엇이 가장 덜 틀렸는지만을 알려준다는 점입니다. 여러분이 읽게 될 이 논문은 이러한 "추측하고 확인하기" 방식이 한계에 부딪혔다고 주장합니다. 논문은 진정한 발견을 하기 위해서는 연구를 재능 경연 대회처럼 다루는 것을 멈추고, "뜨겁다 차갑다(hot and cold)" 게임처럼 다루어야 한다고 주장합니다.

논문의 핵심 아이디어: 연구는 "뜨겁다 차갑다" 게임이다

컴퓨터 과학자들과 연구자들로 구성된 저자들은 이러한 AI 과학자를 구축하는 방식에 대한 근본적인 변화를 제안합니다. 그들은 **에이전트 기반 자동 연구(Agentic Auto-Research)는 본질적으로 퍼즈 테스팅(Fuzz Testing)**이라고 주장합니다.

이제 "퍼즈 테스팅"이라는 용어는 이상한 게임 이름처럼 들릴 수 있지만, 사실 소프트웨어 엔지니어들이 버그를 찾기 위해 사용하는 유명한 기법입니다. 비디오 게임을 망가뜨리려고 한다고 가정해 봅시다. 당신은 단순히 게임을 정상적으로 플레이하는 것이 아니라, 모든 버튼을 동시에 누르는 것과 같은 무작위적이고 이상한 입력들을 던져서 게임이 멈추는지 확인합니다. 하지만 똑똑한 퍼저(fuzzer)는 단순히 무작위 노이즈를 던지는 것이 아닙니다. 그것은 게임이 실행되는 동안 무슨 일이 일어나는지 관찰합니다. 만약 게임이 새로운 화면이나 새로운 레벨에 도달했다면, 퍼저는 "헤이! 이거 흥미로운데! 이런 걸 더 해보자!"라고 말합니다. 퍼저는 게임이 끝날 때까지 기다려 승리 여부를 확인하는 대신, (새로운 문에 도달했다는 것과 같은) 즉각적이고 미세한 단서들을 사용하여 다음 움직임을 유도합니다.

논문은 과학적 연구도 이와 똑같이 작동해야 한다고 제안합니다. 현재 AI 연구자들은 실험이 100% 완료되어 "승리"인지 확인할 때까지 기다리는 경우가 많습니다. 저자들은 이것이 너무 느리고 비용이 많이 든다고 말합니다. 대신, 모든 실험은 진행되는 도중에 AI에게 진행 상황에 대한 **저렴하고 밀도 높은 신호(cheap, dense signal)**를 주어야 합니다.

어두운 동굴을 손전등으로 탐험하는 것을 생각해 보십시오.

  • 과거의 방식 (생성 및 순위 매기기): 어두운 동굴에 돌을 던집니다. 돌이 바닥에 닿을 때까지 기다립니다. 큰 소리가 나면 그것을 유지하고, 조용하면 다른 돌을 던집니다. 당신은 돌이 왜 조용했는지, 혹은 어디로 갔는지 알지 못한 채 너무 늦게까지 기다리게 됩니다.
  • 새로운 방식 (퍼즈 테스팅): 당신은 숨겨진 보물에 가까워질수록 더 밝게 빛나는 손전등을 가지고 있습니다. 당신은 보물을 찾을 때까지 기다리지 않습니다. 빛이 조금 더 밝아지자마자, 당신은 "좋아, 내가 올바른 경로에 있구나, 다음에는 왼쪽으로 가보자"라고 알 수 있습니다.

새로운 접근 방식의 세 가지 황금률

논문은 이 "퍼즈 테스팅" 접근 방식을 모든 AI 연구자가 따라야 할 세 가지 간단한 규칙으로 나눕니다.

1. 진행 상황을 가시화하라 ("손전등" 규칙)
대부분의 과학 실험이 즉시 노벨상을 가져다주지는 않습니다. 실제로 대부분은 실패합니다. 하지만 실패한 실험조차 우리에게 무언가를 가르쳐 줍니다. 논문은 AI가 실험이 끝난 후뿐만 아니라 실험 도중에 무엇을 배웠는지 알려주는 "도구"를 구축해야 한다고 주장합니다.

  • 비유: 완벽한 케이크 레시피를 찾는다고 가정해 봅시다. 과거의 방식은 케이크 1,000개를 굽고 마지막에 모두 맛본 뒤 가장 좋은 것을 고르는 것입니다. 새로운 방식은 "이 반죽이 적절한 질감에 가까워지고 있다"라거나 "이 온도가 범위를 좁히고 있다"라고 알려주는 센서를 갖는 것입니다. AI는 이 미세한 단서들을 사용하여 단순히 완성된 케이크 더미에서 승자를 고르는 것이 아니라, 다음에 무엇을 구울지 결정합니다.

2. 피드백을 순위 매기기가 아닌 탐색에 사용하라
AI가 이러한 미세한 단서(손전등)를 얻었다면, 단순히 승자를 고르는 데만 사용해서는 안 됩니다. 그것을 전략을 바꾸는 데 사용해야 합니다.

  • 비유: 당신이 "뜨겁다 차갑다" 게임을 하고 있는데 누군가 "더 따뜻해졌어!"라고 말한다면, 당신은 단순히 그 말을 기록하고 새로운 지점을 무작위로 고르는 것이 아닙니다. 당신은 따뜻함을 향해 이동합니다. 논문은 AI 에이전트도 이와 같아야 한다고 제안합니다. 만약 실험이 특정 경계선을 보여주거나 나쁜 아이디어를 배제한다면, AI는 즉시 그 정보를 사용하여 다음 실험을 더 똑똑한 방향으로 조종해야 합니다. 이것은 단순히 무작위로 표본을 추출하는 것이 아니라, 지도를 가지고 **탐색(searching)**하는 것에 관한 것입니다.

3. "심판"과 "가이드"를 분리하라
이것이 가장 중요한 안전 규칙입니다. "손전등"(진행 신호)은 탐색을 안내하는 데는 훌륭하지만, 그것이 최종적인 증거는 아닙니다.

  • 비유: 범죄를 해결하는 형사를 상상해 보십시오. 형사는 자신이 어디를 살펴봐야 할지 알려주는 직관(진행 신호)을 가지고 있습니다. "집사가 범인인 것 같으니 주방을 확인해보자." 하지만 형사는 단지 그 직감이 좋았다는 이유만으로 집사를 체포할 수는 없습니다. 그들에게는 형사의 직감과는 별개로 증거를 살펴보는 보호된 검증자(protected validator)—예를 들어 판사나 배심원—가 필요합니다. 만약 형사가 자신의 탐색을 유도하는 데 계속해서 동일한 직감을 사용한다면, 그는 실제로는 범인을 찾지 못했음에도 불구하고 범인을 찾았다고 스스로를 속일 수 있습니다. 최종적인 "발견"은 탐색을 조종하는 데 사용되지 않은 독립적인 별도의 확인을 통해 인증되어야 합니다.

저자들이 말하고 있는 것과 말하지 않는 것

저자들은 이것이 마법의 지팡이가 아니라는 점을 매우 주의 깊게 명시하고 있습니다. 그들은 "우리가 과학을 해결했다!"라고 말하는 것이 아닙니다. 대신, 그들은 테스트 가능하다고 믿는 세 가지 구체적인 예측을 하고 있습니다.

  1. 신호 예측: 만약 우리가 AI에게 좋은 "진행 신호"(손전락처럼)를 준다면, AI는 단순히 추측하고 순위를 매기는 AI보다 동일한 비용과 시간 내에 더 많은 실제 발견을 찾아낼 수 있을 것입니다.
  2. 탐색 예측: 피드백을 사용하여 다음 움직임을 바꾸는 AI는 단순히 무작위로 다트를 던지는 AI보다 더 많은 "승리하는" 실험을 찾아낼 것입니다.
  3. 안전 예측: 만약 우리가 최종 심판을 탐색 가이드와 분리한다면, 더 적은 "가짜" 발견을 찾아낼 것입니다.

논문은 우리가 단지 AI를 더 똑똑하게 만들거나 더 많은 추측을 생성하기만 하면 된다는 생각에 명시적으로 반대합니다. 그들은 단순히 더 많은 후보를 생성하고 순위를 매기는 방식은 노력 대비 가치가 점점 줄어드는 벽에 부딪힌다는 것을 보여줍니다. 또한 하나의 단일한 점수를 사용하여 모든 것(탐색 가이드와 승자 선언 모두)을 수행할 수 있다는 생각에도 반대합니다. 그것은 AI가 스스로를 속이게 만든다고 그들은 말합니다.

이것이 왜 중요한가

이 논문은 AI 과학의 미래를 향한 행동 촉구입니다. 진정한 자동 발견을 위해서는 AI를 단순히 답을 내뱉는 기계로 취급하는 것을 멈추고, 매 단계에서 배우는 호기심 많은 탐험가로 대우해야 한다고 제사합니다.

저자들은 만약 우리가 진행 상황을 가시화하는 "도구"를 구축할 수 있고, "가이드"와 "심판"을 분리할 수 있다면, 단순히 더 많은 소음을 생성하는 것이 아니라 실제로 과학의 숨겨진 보물을 찾아내는 AI 시스템을 구축할 수 있다고 믿습니다. 이것은 "더 많은 것이 더 낫다"에서 "더 똑똑한 것이 더 낫다"로의 전환이며, 발견의 혼란스러운 과정을 유도되고 효율적이며 신뢰할 수 있는 여정으로 바꾸는 것입니다.

논문은 과학계에 과제를 던지며 끝을 맺습니다. 우리는 과학을 위한 이러한 "손전등"을 만들 수 있을까요? 이 "퍼즈 테스팅" 접근 방식이 기존의 방식보다 실제로 더 효과적이라는 것을 증证明할 수 있을까요? 저자들은 그 답이 "예"라고 믿지만, 최종적인 증명은 우리가 내일 수행할 실험에 맡깁니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →