← 최신 논문
💬 NLP

DORA Explorer: Improving the Exploration Ability of LLMs Without Training

이 논문은 학습 없이 LLM 에이전트의 탐험 능력을 향상시키기 위해 다양한 행동 후보를 생성하고 토큰 로그 확률로 점수를 매겨 선택하는 'DORA Explorer'라는 프레임워크를 제안하며, 이를 통해 기존 방법들보다 MAB 및 텍스트 어드벤처 환경에서 우수한 성능을 입증했습니다.

원저자: Priya Gurjar, Md Farhan Ishmam, Kenneth Marino

게시일 2026-04-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Priya Gurjar, Md Farhan Ishmam, Kenneth Marino

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🧠 문제: 인공지능은 왜 '똑같은 실수'를 반복할까요?

생각해 보세요. 낯선 도시에서 길을 찾을 때, 인공지능은 보통 가장 확신 있는 길만 선택합니다.

  • "아, 여기가 가장 유명한 길이야. 여기로 가자!"
  • 하지만 그 길이 막혔거나, 더 좋은 길이 옆에 있을 수도 있는데, 인공지능은 다른 길을 시도해 보지 않고 계속 그 길만 고집하다가 같은 곳에서 맴돌게 됩니다 (루프에 갇힘).

기존의 인공지능은 "창의성"을 높이기 위해 무작위성을 조금 섞어주기도 했지만 (온도 조절), 이는 마치 눈을 감고 주사위를 굴리는 것과 비슷합니다.

  • "아무거나 해보자!"라고 하면, 엉뚱한 말만 하거나 오히려 더 엉망이 될 뿐, 진짜 필요한 새로운 정보를 찾아내는 '탐색'은 잘 못합니다.

💡 해결책: DORA Explorer (다양한 행동을 체계적으로 골라내는 나침반)

이 논문은 인공지능에게 **"무작위로 헤매지 말고, 체계적으로 다양한 길을 시도해 보라"**는 새로운 전략을 가르쳤습니다. 이 전략의 이름은 DORA입니다.

🎭 비유: "맛있는 식당 찾기"

인공지능이 새로운 도시에서 최고의 식당을 찾아야 한다고 상상해 보세요.

  1. 기존 방식 (그리디/무작위):

    • 그리디: "가장 유명한 식당 A 로 바로 가자!" (하지만 A 는 이미 문을 닫았을 수도 있음).
    • 무작위: "눈을 감고 아무 식당이나 가자!" (하지만 엉뚱한 쓰레기통 옆에 있을 수도 있음).
    • 결과: 좋은 식당을 찾지 못하거나, 같은 식당만 반복해서 방문하게 됩니다.
  2. DORA 방식 (체계적인 탐색):

    • 1 단계: 후보 목록 만들기 (생각하기)
      인공지능에게 "주변에 있을 만한 식당 5 개를 나열해 봐"라고 말합니다. 이때 인공지능은 자연스럽게 **다양한 후보 (A, B, C, D, E)**를 떠올립니다.
    • 2 단계: 점수 매기기 (평가하기)
      각 식당에 대해 "이 식당이 맛있을 확률은 얼마나 될까?"를 계산합니다. 하지만 단순히 확률만 보는 게 아니라, **"이 식당을 가보면 새로운 정보를 얻을 수 있을까?"**도 고려합니다.
    • 3 단계: 선택하기 (탐험 vs 활용)
      • 초반 (탐험 모드): 아직 정보가 부족하니, 확률이 조금 낮더라도 **새로운 식당 (B 나 C)**을 가볼 기회를 줍니다.
      • 후반 (활용 모드): 좋은 식당을 찾았다면, 이제 그 식당으로 확실하게 가도록 합니다.
    • 핵심: DORA 는 언제 탐색하고 언제 확신을 가지고 행동할지 스스로 조절하는 '스마트한 나침반' 역할을 합니다.

🚀 DORA 가 뛰어난 이유

  1. 학습이 필요 없습니다 (Training-Free):
    인공지능을 다시 가르칠 필요 없이, 기존에 있는 인공지능에 이 '나침반'만 끼워주면 바로 작동합니다. 마치 스마트폰에 새로운 앱을 설치하는 것처럼 쉽습니다.

  2. 함정에 빠지지 않습니다:
    실험 결과, DORA 를 사용하면 인공지능이 같은 문장이나 행동을 반복하는 '함정'에서 빠져나오는 능력이 기존 방법보다 5 배에서 20 배나 좋아졌습니다.

  3. 실제 성과가 좋습니다:

    • 게임 (텍스트 어드벤처): "리드 (납) 를 녹여라" 같은 미션을 해결할 때, DORA 를 쓴 인공지능은 성공률이 29% 에서 45% 로 크게 향상되었습니다.
    • 복잡한 문제: 기존에 인공지능이 못 풀던 문제들도 새로운 정보를 찾아내며 해결했습니다.

📝 한 줄 요약

"인공지능이 낯선 환경에서 똑같은 실수를 반복하며 헤매지 않도록, DORA 는 '체계적으로 다양한 길을 시도하고, 언제 멈출지 판단하는' 지능적인 나침반을 제공하여 더 빠르고 정확하게 목표를 달성하게 합니다."

이 기술은 인공지능이 단순히 말만 잘하는 것을 넘어, 실제 세상에서 문제를 해결하는 '탐험가'가 되는 데 큰 도움을 줄 것으로 기대됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →