STOCKTAKE: Measuring the Gap Between Perception and Action in LLM Agents with a Fair Oracle
이 논문은 상태 추정과 제어 동작을 분리하는 공정한 오라클(oracle)을 특징으로 하는 26주 기간의 공급망 벤치마크인 STOCKTAKE를 소개하며, 고급 LLM 에이전트들이 숨겨진 결함을 정확하게 진단할 수는 있지만 이러한 지식을 효과적인 결정으로 번역하는 데는 종종 실패하여, 일부 모델들이 더 나은 탐지 능력에도 불구하고 증상을 알지 못하는 베이스라인보다도 낮은 성능을 보이는 성능 격차를 드러낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 안개 낀 군도를 항해하는 선장의 모습을 상상해 보십시오. 당신이 들고 있는 지도는 불완전합니다. 숨겨진 암초나 변화하는 해류를 직접 볼 수는 없습니다. 대신, 당신은 선체에 부딪히는 파도, 물의 색깔, 그리고 바람의 소리만을 볼 수 있습니다. 안전하게 항해하기 위해, 당신은 이러한 단서들을 바탕으로 수면 아래에서 무슨 일이 일어나고 있는지 추측해야 합니다. 이것이 바로 AI 에이전트가 장기적인 의사결정을 내리려고 노력하는 세계입니다. 이 분야에서 과학자들은 인공지능이 인간 선장처럼 되어, 노이즈가 섞인 증상으로부터 숨겨진 위험을 추론하고 몇 주 또는 몇 달에 걸쳐 비용을 절감하거나 재앙을 방지하는 선택을 얼마나 잘 할 수 있는지 테스트하고 있습니다.
연구자들이 던지는 핵심 질문은 이것입니다: AI가 실패했을 때, 그것은 단서를 이해하지 못했기 때문인가, 아니면 단서를 완벽하게 이해했음에도 불구하고 끔찍한 선택을 했기 때문인가? 이를 "아는 것과 행하는 것 사이의 간극(knowing-doing gap)"이라고 부릅니다. 이는 수학 문제를 풀 줄 알면서도 당황해서 틀린 숫자를 적어내는 학생과 같습니다. 오랫동안 이를 구분하는 것은 어려웠는데, 왜냐하면 '정답'은 대개 AI에게 보여주지 않은 숨겨진 암초를 보는 것을 전제로 하기 때문입니다. AI가 실패했을 때, 우리가 그것이 눈이 먼 것인지 아니면 그저 서투른 것인지 알 수 없었습니다.
거대한 공급망 재고 조사 (The Great Supply Chain Stocktake)
이 논문에서 연구자들은 이 미스터리를 해결하기 위해 STOCKTAKE라는 디지털 놀이터를 구축했습니다. 그들은 AI가 전자제품 수입업자의 관리자 역할을 수행하는 26주간의 시뮬레이션을 만들었습니다. 관리자는 매주 얼마나 많은 제품을 주문할지 결정해야 합니다. 문제는 무엇일까요? 세상은 숨겨진 문제들로 가득 차 있습니다. 공급업체가 무너지거나, 운송 운하가 막히거나, 수요가 갑자기 급증할 수 있습니다. AI는 이러한 문제들을 직접 볼 수 없습니다. 오직 "선석 대기 시간이 길다"라거나 "운송 견적이 올랐다"와 같이 노이즈가 섞이고 혼란스러운 주간 대시보드만을 볼 수 있습니다.
AI가 '눈이 먼' 것인지 아니면 단순히 '서투른' 것인지 알아내기 위해, 연구자들은 **페어 오라클(Fair Oracle)**을 발명했습니다. 이것은 AI 옆에 앉아 있는 매우 똑똑하고 완벽하게 논리적인 로봇이라고 생각하십시오. 이 로봇은 AI와 정확히 똑같은 혼란스러운 대시보드를 봅니다. 이 로봇 역시 숨겨진 문제들을 엿볼 수는 없습니다. 하지만 이 로봇은 수학 천재입니다. 이 로봇은 완벽한 확률 규칙(베이즈 필터)을 사용하여 무슨 일이 일어나고 있는지 추측하고, 그 추측을 바탕으로 가능한 최선의 주문량을 계산합니다.
이 페어 오라클과 AI의 성능을 비교함으로써, 연구자들은 두 가지를 별도로 측정할 수 있었습니다:
- 지각(Perception): AI가 무엇이 잘못되었는지 올바르게 추측했는가? (숨겨진 문제를 찾아냈는가?)
- 행동(Action): AI가 추측한 후에 올바른 조치를 취했는가? (올바른 양을 주문했는가?)
그들은 네 가지 최첨단 AI 모델(Claude Sonnet 5, GPT-5.4, DeepSeek-V4-Pro, Grok 4.5)을 사용하여 50개의 서로 다른 "시드(seed, 서로 다른 버전의 숨겨진 세계)"에 대해 실험을 진행했습니다.
발견된 사실: "아는 것과 행하는 것"의 간극은 실재한다
결과는 놀랍기도 하고 다소 우스꽝스럽기도 했습니다.
1. AI의 시력은 충분히 좋다
먼저, 연구자들은 AI가 숨겨진 문제를 포착할 수 있는지 확인했습니다. 답은 명확한 **"예"**였습니다. 네 가지 모델 모두 "보는 것"에는 탁월했습니다. 그들은 숨겨진 스트레스 상황(예: 항구 폐쇄 또는 공급업체 실패)을 **84%에서 88%**의 사례에서 정확히 식별해 냈습니다. 훨씬 더 나아가, 그들은 문제가 시작된 지 일주일 이내에 보통 문제를 파악했습니다. 실제로, 결과적으로 재정적 성과가 가장 나빴던 모델들이 오히려 문제를 가장 빨리 찾아냈습니다. 따라서 실패의 원인은 AI가 눈이 멀었기 때문이 아니었습니다.
2. AI는 행동할 수 없다 (때때로)
여기서부터 이야기가 흥미로워집니다. AI는 무엇이 잘못되었는지 알았음에도 불구하고, 종종 잘못된 움직임을 보였습니다.
- "과소 대응자(Under-Responders)": Claude Sonnet 5와 같은 일부 모델은 문제를 정확히 진단했지만, 그 후 얼어붙었습니다. 예를 들어, 항구가 막힌 것을 보면 현재 재고로 충분하다고 생각하여 주문을 중단해 버립니다. 하지만 항구가 막혔기 때문에 재고는 도착하지 않았고, 결국 제품이 바닥나 손실을 입게 됩니다. 그들은 문제를 알고 있었지만 너무 조심스럽게 행동했습니다.
- "과잉 대응자(Over-Responders)": DeepSeek-V4-Pro나 Grok 4.5 같은 다른 모델들은 정반대였습니다. 그들은 문제를 포착하면 패닉에 빠져 비싼 항공 화물을 엄청나게 주문하거나 높은 가격에 계약을 확정해 버립니다. 그들은 문제를 알았지만, 필요 이상으로 과하게 반응하여 훨씬 더 많은 돈을 썼습니다. 실제로, 이 모델들은 테스트 횟수의 약 절반 정도에서, 단순한 규칙(증상을 무시하는 전략)을 따르는 것이 돈을 더 아낄 수 있었을 정도로 형편없는 성과를 냈습니다. 이들의 "기술 점수(skill score)"는 실제로 음수(구체적으로 -0.23 및 -0.13)였으며, 이는 증상을 무시하는 기본 전략보다도 못한 성과를 냈음을 의미합니다.
3. "아는 것과 행하는 것"의 간극이 병목 구간이다
연구 결과, 좋은 AI와 위대한 AI 사이의 가장 큰 차이는 지능이나 세상을 명확히 보는 능력이 아니었습니다. 그것은 바로 **제어(Control)**였습니다.
- "지속적인(Persistent)" 스트레스 시나리오(문제가 여러 주 동안 지속되는 경우)에서, AI가 문제를 정확히 진단했음에도 불구하고, **34%에서 43%**의 확률로 재고가 바닥났습니다.
- 연구자들은 AI가 완벽한 페어 오라클에 얼마나 근접했는지 측정하기 위해 "기술 점수"를 계산했습니다. 두 모델(DeepSeek과 Grok)은 음수를 기록했는데, 이는 증상을 무시하는 단순한 규칙보다 성과가 낮았음을 의미합니다. 그럼에도 불구하고, 이 모델들은 서술형 설명에서 문제를 가장 빠르게 언급했습니다.
시사점
논문은 현재의 AI 에이전트들에게 있어 문제는 세상이 어떻게 돌아가는지 파악하지 못하는 것이 아니라고 결론짓습니다. 그들은 추론에 매우 뛰어납니다. 문제는 올바른 생각을 올바른 행동으로 바꾸는 것이 매우 어렵다는 것입니다.
AI는 "운하가 폐쇄되었으므로 더 많이 주문해야 합니다"라는 완벽한 문장을 쓸 수 있지만, 정작 주문은 너무 적게 하거나, 너무 늦게 하거나, 혹은 해결책을 위해 너무 많은 비용을 지불할 수 있습니다. "아는 것과 행하는 것의 간극"은 실재합니다: 이 모델들은 올바른 신념을 가질 수는 있지만, 그것을 효과적인 행동으로 옮기는 데는 실패합니다. 연구자들은 이를 해결하기 위해서 단순히 더 잘 보는 똑똑한 AI가 필요한 것이 아니라, AI가 자신의 지식을 적절한 비용을 들여 행동으로 번역하는 법을 가르치는 더 나은 방법이 필요하다고 제안합니다.
요약하자면, AI는 눈이 먼 것이 아닙니다. 그저 손이 서투를 뿐입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.