ProEvent: An Event-centric Benchmark for Proactive Agents
이 논문은 인스턴트 메시징 채팅으로부터 사용자의 이벤트를 자율적으로 추적하는 프로액티브 에이전트(proactive agents)의 능력을 평가하기 위한 최초의 이벤트 중심 벤치마크인 ProEvent을 소개하며, 현재의 거대 언어 모델들이 타이밍, 이벤트 취소, 그리고 암시적 추론 측면에서 상당히 어려움을 겪고 있음을 밝힙니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 도움을 요청하기를 기다리는 것이 아니라, 당신의 삶을 매처럼 지켜보며 당신이 말하기도 전에 무엇이 필요한지 알아내는 초지능형 디지털 비서를 상상해 보세요. 이것이 바로 '프로액티브 에이전트(proactive agents, 선제적 에이전트)'의 꿈입니다. 버튼을 누를 때까지 가만히 있는 일반적인 로봇과 달리, 프로액티브 에이전트는 마늘 냄새를 맡자마자 채소를 다지기 시작하는 개인 요리사나, 하늘이 흐려지는 순간 우산을 건네주는 친구와 같습니다. 현재 컴퓨터 과학의 큰 과제는 이러한 디지털 두뇌가 인간 삶의 무질서하고 혼란스러운 현실에 혼동되지 않도록 가르치는 것입니다. 우리는 컴퓨터가 엄격한 규칙을 따르는 데 뛰어나다는 것을 알고 있지만, 현실 세계는 숨겨진 힌트, 겹치는 대화, 그리고 "취소"라고 말하지 않고도 마음을 바꾸는 사람들로 가득 차 있습니다. 만약 이 에이전트들이 진정으로 도움이 되기를 원한다면, 그들은 텍_스트 메시지를 듣는 것만으로도 우리의 미래 계획(예: 하이킹 여행이나 회의)을 추적할 수 있어야 하며, 언제 말을 하고 언제 침묵해야 하는지를 정확히 알아야 합니다.
여기에 연구자들이 이러한 디지털 비서들이 정말로 현실 세계에 준비되었는지 테스트하기 위해 설계한 새로운 '훈련장'인 PROEVENT가 있습니다. PROEVENT를 플레이어가 인간의 일정을 관리하는 AI인 거대한, 고난도의 비디오 게임 레벨이라고 생각해 보세요. 연구자들은 AI에게 깔끔한 약속 목록을 주는 대신, 현실적이고 무질서한 텍스트 채팅 스트림을 제공합니다. AI는 친구, 동료, 가족 사이의 대화를 경청하며 어떤 이벤트가 계획되고 있는지 파악하고, 그에 따라 일정을 업데이트해야 합니다. 하지만 여기서 반전이 있습니다. 채팅 내용에는 방해 요소가 가득합니다. 아무 의미 없는 잡담, 도중에 계획을 변경하는 사람들, 그리고 실제 취소는 아니지만 취소처럼 들리는 메시지들이 존재합니다. AI는 탐정, 서기, 그리고 시간 관리자 역할을 동시에 수행해야 합니다.
연구자들은 매우 현실적인 수천 개의 가짜 채팅 로그를 만들어 이 테스트를 구축했습니다. 그들은 서로 다른 성격과 목표를 가진 '캐릭터'들을 프로그래밍했고, 사람들이 회의 시간을 협상하거나, 몸이 아파서 계획을 취소하거나, 실제로 일어나지 않을 일을 계획하는 복잡한 시나리오를 시뮬레이션했습니다. 심지어 AI가 주의를 분산될 수 있도록 메인 이벤트와 아무 상관 없는 무작위 메시지인 '노이즈'까지 추가했습니다. 목표는 간단했습니다. AI가 이 채팅들을 읽는 것만으로 올바르게 시간표를 구축하고 업데이트할 수 있는가?
여덟 가지의 강력한 AI 모델을 이 테스트에 투입했을 때, 결과는 "나쁘지 않음"과 "오 이런" 사이의 혼합된 모습이었습니다. 가장 큰 놀라움은 AI들이 지나치게 의욕적이라는 점이었습니다. 움직이는 모든 잎사귀에 짖어대는 개를 상상해 보세요. 이 AI들은 변화가 없어야 할 때도 끊임없이 일정을 업데이트하려고 노력했습니다. 실제로 DeepSeek-V3.2와 같은 일부 모델의 경우, 침묵해야 할 때조차 96% 이상의 시간 동안 변경을 시도했습니다. 도움을 줄 기회를 놓칠까 봐 너무 두려워한 나머지 오히려 혼란을 야기한 것입니다.
또 다른 주요 장애물은 취소였습니다. 만약 사용자가 "몸이 안 좋아서 못 갈 것 같아요"라고 말한다면, 인간은 그것이 취소임을 압니다. AI는 삭제가 필요할 수도 있다는 점을 포착하는 데는 꽤 능숙했지만(실제 취소의 약 절반을 잡아냄), 그것에 대해 확신을 갖는 데는 어려움을 겪었습니다. 그들은 여전히 진행 중인 이벤트를 삭제하거나 엉뚱한 계획을 제거하는 실수를 자주 저질렀습니다. 이 논문은 GPT-5.1이라는 이름의 가장 발전된 모델조차 까다로운 시나리오에서 약 **26.7%**의 확률로만 정답을 맞혔다고 제안합니다. 즉, 대략 4번 중 3번의 경우에 AI가 일정을 망쳤다는 뜻입니다.
또한 이 연구는 이러한 디지털 두뇌들이 이상한 사각지대를 가지고 있음을 발견했습니다. 그들은 자신이 누구를 돕고 있는지를 제대로 이해하지 못합니다. 사용자가 "파티에 못 가겠어"라고 말하면, AI는 종종 사용자의 이름만 명단에서 빼고 파티 자체는 달력에 그대로 남겨둡니다. 이는 마치 손님이 "배가 불러요"라고 말했을 때, 웨이터가 손님의 이름만 예약에서 빼고 테이블 세팅은 그대로 두는 것과 같습니다. AI는 사용자의 입장에 서서 "아, *나(사용자)*는 안 가는 것이니 이 이벤트는 나에게 끝난 것이구나"라고 깨닫는 대신, 외부 관찰자로서 이벤트를 바라보고 있습니다.
요약하자면, AI 에이전트들이 점점 똑똑해지고는 있지만, 아직 당신의 선제적인 인생 관리자가 될 준비는 되지 않은 것 같습니다. 그들은 너무 경거망동하고, 복잡한 대화에 혼란스러워하며, "아마도"와 "아니오"의 차이를 이해하는 데 어려움을 겪습니다. 연구자들은 PROEVENT를 통해 AI가 어디에서 실패하는지를 정확히 보여줌으로써, 미래의 버전들이 더 인내심 있고, 더 정확하며, 마침 finally, 당신에게 우산을 건네줄 타이밍을 정확히 아는 도움이 되는 인간 친구처럼 되기를 희망합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.