← 최신 논문
💻 computer science

Multi-Turn Agentic Scientific Literature Search via Workflow Induction

PaperPilot는 검색을 실행 가능한 연산자들의 유도 및 편집 가능한 워크플로로 구성하는 멀티 턴 과학 문헌 검색 에이전트로, 이러한 접근 방식이 표준 도구 기반 에이전트와 비교하여 검색 성능을 크게 향상시키고 실행 오류를 제거함을 실험을 통해 입증한다.

원저자: Jisen Li (University of Illinois Urbana-Champaign, Together AI), Bingxuan Li (University of Illinois Urbana-Champaign), Nanyi Jiang (University of Pennsylvania), Xuying Ning (University of Illinois Ur
게시일 2026-07-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jisen Li (University of Illinois Urbana-Champaign, Together AI), Bingxuan Li (University of Illinois Urbana-Champaign), Nanyi Jiang (University of Pennsylvania), Xuying Ning (University of Illinois Urbana-Champaign), Xiyao Wang (University of Pennsylvania), Yifan Shen (University of Illinois Urbana-Champaign), Heng Wang (University of Illinois Urbana-Champaign), Yuqing Jian (Together AI), Xiaoxia Wu (Together AI), Ben Athiwaratkun (Together AI), Pan Lu (Stanford University), Jiaxuan You (University of Illinois Urbana-Champaign), Bingxin Zhao (University of Pennsylvania)

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대하고 혼란스러운 요리책 도서관에서 특정 레시 recipe를 찾으려고 한다고 상상해 보십시오. 당신은 사서에게 이렇게 말합니다. "지난주에 제가 만들었던 이 요리와 연관된 레시피를 찾고 싶어요."

전통적인 검색 엔진(또는 기본적인 AI)에게 물어본다면, 그것은 단지 당신의 요청과 같은 단어가 포함된 책 몇 권을 가져올 뿐일 것입니다. 이는 사서가 "제목에 '치킨'이 들어간 책 다섯 권 여기 있습니다!"라고 외치며 책을 건네주는 것과 같습니다. 운이 좋으면 찾을 수도 있겠지만, 대개 너무 오래되었거나, 너무 현대적이거나, 혹은 완전히 다른 종류의 치킨 요리에 관한 책들을 받게 될 것입니다.

만약 표준 AI 에이전트에게 물어본다면, 그것은 당신의 요청을 읽고 당신이 무엇을 의미하는지 추측하며 똑똑하게 행동하려 할 것입니다. 하지만 이는 질문을 던지기는커녕 당신의 마음을 읽으려고 애쓰는 사서와 같습니다. 만약 당신이 "너무 광범위해요"라고 말한다면, AI는 검색 방식을 실제로 바꾸는 대신 단순히 당신의 문장을 더 짧게 다시 쓰는 데 그칠 것입니다. 그것은 추측의 굴레에 갇혀 있는 셈입니다.

여기, PAPERPILOT이 등장합니다.

이 논문의 저자들은 PAPERPILOT이라는 새로운 종류의 "슈퍼 사서" 에이전트를 만들어냈습니다. 단순히 키워드를 외치거나 추측하는 대신, PAPERPILOT은 논문을 찾는 과정을 맞춤형 기계를 만드는 것(또는 워크플로우를 구축하는 것)처럼 취급합니다.

그 작동 방식은 다음과 같은 쉬운 비유를 통해 설명할 수 있습니다.

1. "레고 설계도" (워크플로우)

단순히 검색하는 대신, PAPERPILOT은 "레고 블록"을 사용하여 단계별 설계도(DAG 또는 유향 비순환 그래프)를 구축합니다. 각 블록은 특정 도구입니다:

  • 블록 A: "이 논문을 인용한 논문들을 찾아라."
  • 블록 B: "2020년 이전의 것은 필터링하여 제외하라."
  • 블록 C: "수학적 유사도에 따라 정렬하라."
  • 블록 D: "초록을 읽고 'AI'가 언급되어 있는지 확인하라."

에이전트는 단 한 번의 검색을 수행하는 것이 아니라, 당신의 요청에 딱 맞게 설계된 고유한 기계를 조립합니다.

2. "대화" (다회차 상호작용)

마법은 당신이 에이전트와 대화할 때 일어납니다.

  • 당신: "이것을 바탕으로 발전시킨 논문들을 원해요."
  • PAPERPILOT: "알겠습니다. 기계를 하나 만들었습니다. 하지만 실행하기 전에, 최근 5년 이내의 논문을 원하시나요, 아니면 전체 기간을 원하시나요? 그리고 동일한 방법론을 사용하는 논원을 원하시나요, 아니면 단순히 동일한 주제를 다루는 논문을 원하시나요?"
  • 당신: "최근 5년 이내의 논문이어야 하고, 동일한 방법론을 사용해야 합니다."
  • PAPERPILOT: "알겠습니다."

단순히 "알겠습니다"라고 말하는 대신, PAPERPILOT은 설계도를 물리적으로 수정합니다. "시간" 블록을 가져와서 "전체 기간"에서 "최근 5년"으로 변경합니다. "주제" 블록을 "방법론" 블록으로 교체합니다. 즉, 피드백을 바탕으로 기계 자체를 정교하게 다듬습니다.

3. "훈련" (더 나은 기계를 만드는 법 배우기)

연구진은 완벽한 설계도의 수천 가지 사례를 보여줌으로써 PAPERPILOT에게 이 방법을 가르쳤습니다.

  • 먼저, 완벽한 기계를 만드는 "올바른" 방법(지도 학습)을 보여주었습니다.
  • 그다음, 게임을 진행했습니다. 좋은 기계를 가져온 뒤 그것을 망가뜨렸습니다(예: 필터를 제거하거나 잘못된 도구를 사용함). 그리고 AI에게 "어떤 버전이 더 나은가?"라고 물었습니다. AI는 작동하는 기제를 망가진 기제보다 선호하는 법을 배웠습니다. 이것을 **선호도 최 optimization(Preference Optimization)**이라고 합니다.

결과: 왜 중요한가?

논문은 이 시스템을 다른 스마트 검색 도구들과 비교 테스트했습니다. 결과는 다음과 같습니다.

  • 더 높은 정확도: PAPERPILOT이 대화하고 기계를 정교하게 다듬을 수 있었을 때, 훨씬 더 자주 올바른 논문을 찾아냈습니다. 정답 논문을 찾는 비율이 58%에서 **77%**로 높아졌습니다.
  • 고장 난 기계 제로: AI 에이전트의 주요 문제 중 하나는 존재하지 않는 도구로 필터링을 시도하는 등 작동하지 않는 기계를 만들려 한다는 점입니다. PAPERPILOT은 이러한 오류를 9.5%에서 0%로 줄였습니다. 이를 통해 작동 가능한 안정적인 워크플로우를 구축하는 법을 배웠습니다.
  • 더 저렴하고 빠름: 훨씬 더 크고 비싼 시스템보다 성능이 뛰어난 이유는, 이 모델이 더 작고 저렴한 컴퓨터 모델임에도 불구하고 추측하는 데 시간을 낭비하지 않고 처음부터 올바른 도구를 구축했기 때문입니다.

핵심 요약

이 논문은 과학 논문을 찾는 과정이 단 한 번의 추측(one-shot guess)이 되어서는 안 된다고 주장합니다. 그것은 AI가 맞을 때까지 자신만의 검색 전략을 구축하고, 사용자가 피드백을 주며, AI가 그 전략을 스스로 수정하는 협력적인 과정이어야 합니다.

PAPERPILOT은 만약 AI에게 단순히 당신의 말을 읽는 능력이 아니라, (자동차 엔진을 튜닝하는 정비사처럼) 자신의 검색 계획을 구축하고 편집할 수 있는 능력을 부여한다면, 훨씬 더 강력하고 신뢰할 수 있는 연구 조수가 될 수 있음을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →