Event-Time Confounding Under Bursty Human Dynamics
이 논문은 디지털 행동을 사용자 주도 이벤트에 정렬하는 것이, 이벤트 이후의 활동 급증이 인과적 효과가 아니라 진행 중인 과업의 자연스러운 지속을 반영하는 결과인 '에피소드 선택 편향(episode-selection bias)'을 생성함을 입증하며, 이는 표준적인 사용자 고정 효과로는 해결할 수 없으나 제안된 진단 프로토콜과 '버스트체크(burstcheck)' 감사 도구를 사용하여 탐지 및 교정될 수 있다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
디지털 세상에서 우리는 클릭하거나, 검색하거나, 질문을 던질 때마다 빵부스러기 같은 흔적을 남깁니다. 수년 동안 연구자들과 기업들은 인과관계를 이해하기 위해 이 흔적들을 읽으려 노력해 왔습니다. 그들은 인공지능에게 도움을 요청하는 것과 같은 특정한 행동이 실제로 그 다음에 일어나는 사람의 행동을 변화시키는지 알고 싶어 합니다. 이를 알아내기 위한 표준적인 방법은 특정 순간, 예를 들어 사용자가 챗봇에 질문을 입력하는 바로 그 초를 정한 뒤, 그 직후 몇 분 동안 얼마나 많은 활동이 일 발생하는지를 측정하는 것입니다. 만약 사용자가 그 순간 이후에 더 많은 제품을 검색하거나 더 많은 기사를 읽는다면, 챗봇이 그 급증을 유발했다는 가정을 세웁니다. 이는 논리적인 사고 방식이지만, 여기에는 숨겨진 가정이 전제되어 있습니다. 즉, 사용자가 행동하기로 선택한 그 순간이 마치 경주의 출발 신호처럼 중립적인 시작점이라는 가정입니다.
하지만 인간의 행동은 단 하나의 출발 신호가 있는 경주처럼 작동하지 않습니다. 대신, 우리의 주의력은 파도처럼 밀려옵니다. 우리는 종-종 문제를 해결하거나 호기심을 충족시키기 위해 여러 웹사이트, 검색 엔진, 도구 사이를 20~30분 동안 넘나들며 주제에 깊이 빠져듭니다. 이러한 활동의 폭발은 강렬하고 집중적이며, 이후에는 긴 정적의 시기가 뒤따릅니다. 문제는 연구자가 이 바쁜 파도 속의 한 지점을 연구 대상으로 선택할 때 발생합니다. 만약 어떤 사람이 이미 조사 세션에 깊이 몰입해 있는 상태에서 질문을 던진다면, 그 후에 이어지는 활동은 반드시 그 질문에 대한 반응인 것은 아닙니다. 그것은 단지 그들이 이미 타고 있던 파도의 연속일 뿐입니다. 질문이 파도를 일으킨 것이 아니라, 단지 연구자가 시계를 내려다본 순간에 그 질문이 있었을 뿐입니다. 이 환경에서 원인과 우연을 구별하는 것은 어렵습니다. 왜냐로 인해, 순간을 선택하는 사람과 활동을 주도하는 사람이 동일하기 때문입니다.
이것이 바로 Scrunch AI의 마이클 이아넬리(Michael Iannelli)와 알란 에이아이(Alan Ai)가 진행한 새로운 연구가 다루는 핵심적인 퍼즐입니다. 그들은 디지털 행동을 측정하는 표준적인 방법이 실제로 사건 자체를 측정하고 있는 것인지, 아니면 그 사건이 우연히 떨어진 바쁜 기간을 측정하고 있는 것인지를 조사했습니다. 이를 해결하기 위해 그들은 이론에만 의존하지 않았습니다. 대신, 자신의 브라우징 기록, 검색 쿼리, 그리고 AI 어시스턴트와의 상호작용을 공유하기로 동의한 수천 명의 사용자로부터 얻은 실제 데이터를 사용하여 테스트를 구축했습니다. 연구진은 자신들의 측정 도구가 존재하지 않는 '원인'을 찾아내도록 스스로를 속일 수 있는지 확인하고자 했습니다.
연구팀은 그들이 "알려진 영(known-null)" 타임스탬프라고 부르는 것을 사용하여 영리한 실험을 설계했습니다. 그들은 동일한 사용자와 동일한 활동 패턴을 사용하되, 사용자가 바쁘기는 하지만 AI에게 질문을 던지지는 않았던 순간들을 선택했습니다. 그들은 이 무작위적인 순간들을 마치 실제 사건인 것처럼 취급했습니다. 이 순간들은 실제 개입이 없는 무작위적인 시점이었으므로, 행동의 변화를 일으키는 것이 불가능했습니다. 만약 표준 측정 도구들이 제대로 작동하고 있다면, 이 가짜 순간들 이후에는 아무런 효과가 나타나지 않아야 했습니다. 그러나 결과는 달랐습니다. 도구들은 이 가짜 순간들 이후에도 엄청난 활동의 급증을 보고했습니다. 연구진이 데이터를 살펴보았을 때, 이 무작위의 가짜 순간들은 실제 AI 응답 이후에 나타나는 증가량과 거의 맞먹는 수준의 검색 활동 증가를 만들어냈습니다. 구체적으로, 가짜 순간들은 평소보다 약 3.4배의 검색 활동을 생성한 반면, 실제 AI 순간들은 평소보다 약 4.3배의 검색 활동을 생성했습니다.
이 결과는 충격적이었습니다. 왜냐하면 AI의 '효과'가 상당 부분 타이밍에 의해 만들어진 환상임을 보여주었기 때문입니다. 연구진은 활동이 AI가 응답하는 순간에 급증한 것이 아님을 발견했습니다. 대신, 활동은 AI 응답이 있기 약 8분 전부터 이미 상승하고 있었고, 정점에 도달했다가 서서히 감소하고 있었습니다. AI 응답은 이미 본격적으로 진행 중인 과업의 중간에 찍힌 타임스탬프에 불과했습니다. 사용자는 이미 '태스크 에피소드(task episode)', 즉 높은 참여도가 나타나는 기간 속에 있었기 때문에 검색과 브라우징을 하고 있었던 것입니다. AI 응답은 그 에피소드의 표식이었을 뿐, 그것을 시작한 불꽃이 아니었습니다.
이것이 AI만의 특이한 현상이 아니라 일반적인 문제임을 증명하기 위해, 연구진은 다른 유형의 디지털 이벤트들도 살펴보았습니다. 그들은 사용자가 쇼핑 링크를 클릭하거나, 뉴스 사이트를 방문하거나, 코딩 문서를 여는 순간들을 조사했습니다. 모든 경우에서 동일한 패턴이 나타났습니다. 사용자가 링크를 클릭하기 전부터 웹의 다른 부분에서의 활동은 이미 높았습니다. 이벤트는 항상 더 큰 활동의 상승 파도 안에 자리 잡고 있었습니다. 연구진은 심지어 어떤 이벤트도 행동을 변화시킬 힘이 전혀 없는 세상을 시뮬레이션했습니다. 컴퓨터 시뮬레이션에서 그들은 사용자의 활동이 자연스럽게 급증했다가 사라지는 시나리오를 만들고, 그 급증하는 구간 안에 "처치(treatment)" 이벤트를 무작위로 배치했습니다. 이벤트가 아무것도 하지 않았음에도 불구하고, 표준 분석 방법들은 여전히 거대한 양의 긍정적 효과를 보고했습니다. 분석 방법들이 사용자의 주의력이 자연스럽게 오르내리는 것을 계산하여, 그것을 이벤트에 대한 반응으로 착각했기 때문에 발생한 오류였습니다.
연구진은 또한 흔히 쓰이는 통계적 기법들이 이 문제를 해결할 수 있는지 테스트했습니다. 연구자들은 사용자를 다른 시간대의 자신과 비교하거나, 사용자의 최근 이력을 매칭함으로써 이를 통제하려고 노력합니다. 저자들은 이러한 방법들이 작동하지 않는다는 것을 발견했습니다. "바쁜 상태"는 숨겨져 있으며 매 분마다 빠르게 변하기 때문에, 한 시간 전의 이력을 보는 것은 어제의 날씨를 보고 오늘 폭풍을 예측하려는 것과 같습니다. 높은 참여라는 숨겨진 상태는 이러한 오래된 데이터 포인트들에 의해 포착되지 않습니다. 연구진은 사용자를 유사한 활동 수준을 가진 순간들과 매칭하려고 시도했을 때조차 편향이 남아 있음을 보여주었습니다. 이벤트와 에피소드를 진정으로 분리하는 유일한 방법은 단일 클릭을 이야기의 시작으로 보는 것이 아니라, 전체 기간을 비교하는 것입니다. 즉, AI를 사용하는 전체 연구 세션과 AI 없이 진행되는 전체 연구 세션을 비교하는 것입니다. 단순히 클릭 직후의 몇 분만을 보는 것이 아니라 말입니다.
이 발견이 갖는 함의는 디지털 삶을 이해하는 방식에 있어 매우 중요합니다. 이는 특정 도구나 광고가 활동의 급증을 유도한다는 많은 보고들이 데이터를 잘못 읽고 있을 수 있음을 시사합니다. 그 급증은 이미 일어나고 있었을 수도 있습니다. 연구진은 AI나 광고가 아무런 효과가 없다고 말하는 것이 아닙니다. 다만 그들을 측정하는 표준적인 방식이 결함이 있다고 주장하는 것입니다. 만약 어떤 사람이 이미 쇼핑 여행의 한복판에 있다면, AI 어시스턴트가 제품을 찾는 데 도움을 줄 수는 있지만, 그 어시스턴트가 쇼핑 여행 자체를 만든 것은 아닙니다. 연구는 결론적으로, 올바른 답을 얻기 위해서는 단 한 번의 클릭을 이야기의 시작으로 취급하는 것을 멈추고, 전체 장(chapter)을 바라봐야 한다고 말합니다. 우리는 특정 이벤트가 있고 없고에 따라 사용자의 하루 중 유사한 장들을 비교해야 합니다. 그렇게 하지 않는 한, 디지털 로그에서 우리가 보는 '효과'들은 아마도 이미 부서지고 있는 파도의 메아리에 불과할 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.