Benchmarking In-context Experiential Learning Through Repeated Product Recommendations
이 논문은 실제 제품과 합성 고객 페르소나를 사용하여 반복적인 제품 추천 시나리오에서의 경험적 학습을 위한 벤치마크인 BELA를 소개하며, 이는 현재의 LLM 기반 에이전트들이 개별 상호작용 내에서는 적응할 수 있는 반면, 공유된 잠재 구조를 추론함으로써 여러 에피소드에 걸쳐 전략을 개선하는 데는 어려움을 겪는다는 점을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 미스터리를 풀려는 탐정이라고 상상해 보십시오. 하지만 단서들은 대화 속에 숨겨져 있습니다. 인공지능의 세계에서도, 단 하나의 퍼즐을 푸는 것과 퍼즐을 더 잘 푸는 법을 배우는 것 사이에는 큰 차이가 있습니다. 오늘날 대부분의 AI 테스트는 학생에게 모든 숫자가 이미 적혀 있는 단 하나의 수학 문제를 주는 것과 같습니다. 목표는 그저 지금 당장 정답을 맞히는 것입니다. 하지만 현실 세계는 훨씬 더 복잡합니다. 그것은 마치 목격자와 대화를 나누고, 몇 가지 질문을 던지고, 답변을 얻은 뒤, 그 경험을 바탕으로 다음 목격자를 더 효과적으로 인터뷰해야 하는 탐정과 같습니다. 이 논문은 "경험적 학습(experiential learning)"이라 불리는 AI 연구의 특정 영역을 깊이 파고듭니다. 이 논문은 다음과 같은 단순하면서도 까다로운 질문을 던집니다. "AI가 사람들과 반복해서 대화함으로써 사람들이 무엇을 원하는지 파악하는 능력을 더 똑똑하게 키울 수 있을까?" 연구진은 이 디지털 에이전트들이 단순히 하나의 고립된 사건을 해결하는 데 그치지 않고, 미래의 더 나은 탐정이 되기 위해 과거의 대화로부터 배울 수 있는지 테스트하고 있습니다.
이 논문의 저자인 컬럼비아 경영대학원과 순와트선 대학교의 연구팀은 우리에게 익숙한 시나리오를 사용하여 이 아이디어를 테스트하기로 했습니다: 바로 제품 쇼핑입니다. 그들은 BELA(경험적 학습 및 능동적 탐색을 위한 벤치마크)라는 거대하고 가상의 놀이터를 구축했습니다. BELA를 무한히 넓은 쇼핑몰이라고 생각하십시오. 이 쇼핑몰에서 AI는 판매원 역할을 맡습니다. 이 쇼핑몰에서 AI는 고객(실제로는 특정한 취향을 가진 사람들을 시뮬레이션한 컴퓨터 프로그램)들과 대화하며 그들에게 어떤 제품을 추천해야 할지 알아내야 합니다. 반전은 AI에게 기회가 단 한 번뿐이 아니라는 점입니다. AI는 고객과 대화하고, 추천을 하고, 피드백을 받은 뒤, 새로운 고객에게로 넘어갑니다. 핵심 테스트는 AI가 첫 번째 고객으로부터 배운 것을 기억하고, 그 지식을 사용하여 두 번째, 세 번째, 그리고 열 번째 고객에게 더 나은 질문을 던질 수 있는지 여부입니다.
이 테스트를 공정하고 거대하게 만들기 위해, 연구진은 단순히 몇 명의 가짜 사람을 만든 것이 아닙니다. 그들은 아마존의 71,000개 실제 제품과 2,000개의 서로 다른 제품 그룹(예: 헤어 젤 그룹이나 쌀 요리 그룹 등)을 포함하는 시스템을 만들었습니다. 그런 다음 이를 매우 구체적이고 일관된 호불호를 가진 100만 개의 서로 다른 고객 페르소나(다른 AI에 의해 시뮬레이션됨)와 결합했습니다. 이는 "고객 + 제품 그룹"의 조합이 무려 20억 개에 달하는 엄청난 규모를 만들어냅니다. 이는 당신이 상상할 수 있는 모든 쇼핑 여행의 도서관을 보유한 것과 같으며, 이를 통해 연구진은 AI가 군중 속에서 패턴을 포착할 수 있는지 확인할 수 있습니다.
연구진은 GPT-5.4, Gemini-3.1, Claude-Opus와 같은 오늘날 가장 똑똑한 AI 모델들을 사용하여 실험을 진행했습니다. 그들은 이 모델들이 10번의 쇼핑 여정(에피소드라고 불림)에 걸쳐 제품을 판매하는 과정을 관찰했습니다. 그들은 두 가지를 확인하고 싶었습니다. 첫째, AI가 단일 대화 중에 학습할 수 있는가(적절한 후속 질문을 던지는가)? 둘째, AI가 대화 전반에 걸쳐 학습할 수 있는가(경험이 쌓임에 따라 업무 능력이 향상되는가)?
여기서 놀라운 결과가 나왔습니다. AI 모델들은 첫 번째 부분에는 꽤 능숙했습니다. 단 한 명의 고객과 대화할 때, 그들은 대화로부터 학습하여 대화가 진행됨에 따라 더 나은 질문을 던질 수 있었습니다. 하지만 그들은 두 번째 부분에서 완전히 실패했습니다. 아홉 명의 서로 다른 고객과 대화한 후에도, AI는 열 번째 고객이 무엇을 원하는지 추측하는 데 있어 첫 번째 고객과 다를 바 없이 나아지지 않았습니다. 이는 마치 한 사람의 취향은 잘 파악하지만, 새로운 사람이 들어올 때마다 모든 것을 처음부터 다시 시작하며 이전 아홉 명에게서 배운 것을 모두 잊어버리는 판매원과 같았습니다.
이 논문은 현재의 "프런티어(frontier)" 모델들이 결정적인 기술을 놓치고 있다고 시사합니다. 그들은 과거의 경험을 되돌아보며 "아, 이런 패턴이 있구나. 다음에는 이런 종류의 질문을 던져야겠다"라고 말하지 못합니다. 대신, 그들은 마치 방금 전 다섯 분 전에 매우 유사한 취향을 가진 사람을 만났음에도 불구하고, 매번 새로운 고객을 완전히 새로운 미스터리로 취급하는 것처럼 보입니다. 또한 연구진은 AI가 자신이 얼마나 확신을 가져야 하는지에 대한 예측 능력도 개선하지 못했다는 것을 발견했습니다. AI는 질문을 덜 해야 할 때조차도 계속해서 똑같은 횟수의 질문을 던졌습니다.
이 과제가 단순히 너무 어려워서 그런 것이 아님을 증명하기 위해, 연구진은 "이상적인 경로(ideal path)"를 만들었습니다. 연구진은 최선의 질문들을 통해 AI를 수동으로 안내했으며, 만약 AI가 과거의 경험을 올바르게 사용했다면 추천의 질을 획기적으로 높이고 질문 횟수를 줄일 수 있었음을 보여주었습니다. 이는 학습할 수 있는 정보가 존재했음에도 불구하고, 현재의 모델들이 그것을 제대로 포착하지 못했다는 것을 입증합니다.
요약하자면, 이 논문은 현재의 AI가 단일하고 스마트한 대화를 나누는 데는 매우 능숙해지고 있지만, 전체 경력에 걸쳐 점점 더 똑똑해지는 "학습 기계"가 되는 법은 아직 터득하지 못했음을 시사합니다. 이는 마치 전날 밤에 열심히 공부하면 시험에서 만점을 받을 수 있지만, 종이 울리는 순간 배운 것을 모두 잊어버려 월요일에 배운 내용을 화요일에 활용하지 못하는 학생과 같습니다. 저자들은 AI가 진정으로 복잡하고 변화무쌍한 현실 세계를 다루기 위해서는, 오늘날 가장 진보한 모델들조차 여전히 숙제로 남아 있는 기술인 '여러 에피소드에 걸친 경험으로부터의 학습 능력'을 개발해야 한다고 결론지었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.