← 최신 논문
🤖 AI

Beyond Reactivity: Measuring Proactive Problem Solving in LLM Agents

이 논문은 LLM 에이전트를 평가하기 위해 주도성을 탐색, 식별, 미지정 문제 해결로 분해한 새로운 벤치마크인 PROBE를 소개하며, GPT-5 및 Claude Opus-4.1과 같은 최첨단 모델조차 최고 점수가 40%에 불과할 정도로 높은 자율적 성능을 달성하는 데 어려움을 겪고 있음을 밝힌다.

원저자: Gil Pasternak, Dheeraj Rajagopal, Julia White, Dhruv Atreja, Matthew Thomas, George Hurn-Maloney, Ash Lewis

게시일 2026-07-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Gil Pasternak, Dheeraj Rajagopal, Julia White, Dhruv Atreja, Matthew Thomas, George Hurn-Maloney, Ash Lewis

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: "명령 대기"에서 "필요 예측"으로

당신에게 매우 똑똑하고 속도가 빠른 개인 비서가 있다고 상상해 보세요. 현재 대부분의 비서들은 식당의 주문 받이와 같습니다. 당신이 메뉴를 보고 무엇을 원하는지 결정한 뒤, "버거 하나 주세요"라고 말해야 합니다. 그러면 비서는 가서 버거를 가져옵 점. 이들은 *반응적(reactive)*입니다. 즉, 당신이 명령을 내려야만 움직입니다.

이 논문의 저자들은 우리가 더 사려 깊은 집사 같은 비서를 만들 수 있는지 확인하고 싶어 합니다. 훌륭한 집사는 당신을 관찰하다가, 당신이 시계를 보며 한숨을 쉬는 것을 보고는 이렇게 말합니다. "회의가 10분 남았는데 아직 발표 자료를 챙기지 못하셨군요. 제가 이미 가방에 넣어두고 차를 불렀습니다." 이것이 바로 *주도적(proactive)*인 행동입니다.

이 논문은 다음과 같은 질문을 던집니다: 현재의 AI 에이전트가 실제로 이 일을 할 수 있을까? AI가 당신의 이메일, 캘린더, 문서들이 뒤섞인 엉망진창인 더미를 보고, 당신이 말하지 않아도 무엇이 잘못되었는지 파악하여 스스로 해결할 수 있을까요?

문제점: "건초더미 속 바늘 찾기" 테스트

이것을 테스트하기 위해 연구진은 기존의 테스트들이 너무 쉽다는 것을 깨달았습니다. 기존 테스트가 작은 서랍에서 빨간 양말을 찾는 것이라면, 실제 삶은 훨씬 더 어렵습니다. 그것은 마치 수천 개의 점심 메뉴나 날씨에 관한 메모가 섞여 있는 거대한 창고 안에서, 3주 전의 메모에 언급되었을지도 모르는 빨간 양말을 찾는 것과 같습니다.

이를 해결하기 위해 그들은 PROBE(Proactive Resolution of Bottlenecks, 병목 현상의 주도적 해결)라는 새로운 테스트를 구축했습니다.

PROBE의 작동 방식:

  1. 설정: 그들은 235명의 서로 다른 가상 인물(예: 선임 회계사 또는 프로젝트 매니저)을 위해 1,000개의 가짜 "업무일"을 생성했습니다. 각 가상 인물은 수백 개의 이메일, 캘린더 초대장, 텍스트 파일이 담긴 방대한 디지털 "데이터 저장소"를 가집니다.
  2. 숨겨진 문제: 각 시나리오에는 특정 문제(병목 현상)가 숨겨져 있습니다. 예를 들어, 중요한 보고서에 서명이 누락되었거나, 파일 형식이 잘못되어 마감 기한을 놓친 경우 등입니다.
  3. 함정: 문제는 명확하지 않습니다. 증거는 5~6개의 서로 다른 이메일과 캘린더 이벤트에 흩어져 있습니다. 또한, AI를 혼란스럽게 만들기 위해 점심 식사나 날씨에 관한 수백 개의 "방해 요소(distractor)" 문서들도 설계되었습니다.
  4. 목표: AI 에이전트는 다음을 수행해야 합니다:
    • 탐색(Search): 건초더미를 뒤져서 관련 단서를 찾아내야 합니다.
    • 식별(Identify): 정확히 무엇이 문제인지 파악해야 합니다 (예: "마감 기한이 문제가 아니라 파일 형식이 잘못되었다").
    • 실행(Act): 가능한 25가지 행동 목록 중에서 문제를 해결하기 위한 단 하나의 올바른 행동을 선택해야 합니다 (예: "IT 팀에 이메일 보내기" vs "회의 일정 변경하기").

결과: "40%의 천장"

연구진은 가장 똑똑한 AI 모델들(GPT-5 및 Claude Opus 등)과 다양한 "에이전트 프레임워크"(AI가 생각하는 방식을 프로그래밍하는 다양한 방법)를 테스트했습니다.

충격적인 결과: 최고의 AI 모델조차 성공률이 **40%**에 불과했습니다.

이것을 의학 시험에 비유해 봅시다. 만약 세계 최고의 의사들이 환자의 상태를 진단하라는 테스트(환자가 무엇이 잘못되었는지 말해주지 않아도 진단하는 테스트)에서 40%의 정답률만 기록했다면, 우리는 아직 갈 길이 멀다는 것을 알 수 있습니다.

그들은 어디에서 실패했을까요?

  • 탐색: 그들은 종종 단서를 놓쳤습니다. 엉뚱한 이메일을 보거나 캘린더를 무시했습니다.
  • 진단: 단서를 찾았더라도 잘못된 문제를 추측하는 경우가 많았습니다. 예를 들어, 실제로는 "파일 누락"이 문제인데 "업무 과다"가 문제라고 생각하는 식입니다.
  • 해결: 때로는 문제를 알고 있었음에도 잘못된 해결책을 골랐습니다 (예: 배관공이 필요한 상황에 경찰을 부르는 것과 같습니다).

인간과의 비교

연구진은 인간에게도 이 테스트를 수행하게 했습니다.

  • 함정: 이 테스트는 너무 길어서 인간이 한 번에 다 읽을 수 없었습니다 (무려 100,000단어에 달했습니다!).
  • 해결책: 그래서 인간에게는 중요한 부분을 요약한 "짧은 버전"을 제공했습니다.
  • 결과: 인간은 짧은 버전에서 훨씬 더 높은 성적(약 70~80% 성공률)을 보였습니다. 이는 주요 난관이 논리 자체의 문제가 아니라, 정보의 길이와 복잡성에 있다는 것을 증명했습니다. AI는 방대한 데이터 더미 속에서 모든 것을 추적하고 관리하는 데 어려움을 겪습니다.

결론: 우리는 여전히 "반응적"입니다

이 논문은 AI가 지시를 따르는 능력은 좋아지고 있지만, 스스로 문제를 예측하는 능력은 여전히 형편없다고 결론짓습니다.

  • 격차: "시키는 대로 하는 것"과 "무엇을 해야 할지 알아내는 것" 사이에는 거대한 간극이 존재합니다.
  • 미래: "집사" 수준에 도달하려면, AI는 긴 문서를 읽고, 시간에 따라 점들을 연결하며, 인간 관계(누구에게 이메일을 보내고 누구를 무시해야 하는지 등)를 이해하는 능력을 훨씬 더 발전시켜야 합니다.

요약하자면: 우리는 매우 똑똑한 엔진을 만들었지만, 여전히 인간이 핸들을 잡고 어디를 봐야 할지 알려줘야 합니다. AI는 아직 스스로 자동차를 운전할 준비가 되지 않았습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →