← 최신 논문
💬 NLP

ShareChat: A Dataset of Chatbot Conversations in the Wild

본 논문은 95 개 언어에 걸쳐 네이티브 인터페이스 affordance 를 보존하는 142,808 개의 실제 챗봇 대화로 구성된 대규모 다중 플랫폼 데이터셋인 ShareChat 를 소개하며, 이를 통해 균일한 텍스트 전용 벤치마크를 넘어 대규모 언어 모델에 대한 보다 진정한 평가를 가능하게 합니다.

원저자: Yueru Yan, Tuc Nguyen, Bo Su, Melissa Lieffers, Thai Le

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yueru Yan, Tuc Nguyen, Bo Su, Melissa Lieffers, Thai Le

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇과 사람들이 어떻게 대화하는지 연구해 왔다고 상상해 보세요. 하지만 당신은 오직 하나의 투명한 유리창을 통해서만 그들을 지켜봤을 뿐입니다. 그들이 입력하는 단어는 보이지만, 그들이 있는 방의 고유한 특징들은 놓치고 맙니다. 벽에 걸린 구체적인 도구들, 로봇이 소리 내어 생각하는 방식, 또는 서로 다른 로봇들이 도움을 주기 위해 설계된 다양한 방법들 말입니다.

이 논문, SHARECHAT의 저자들이 바로 이 문제를 해결하려고 노력하고 있습니다. 그들은 인간과 다섯 가지 다른 AI 채팅봇 (ChatGPT, Perplexity, Grok, Gemini, Claude) 간의 실제 대화로 이루어진 방대한 새로운 도서관을 구축하여, AI 와 대화하는 장소가 대화하는 방식을 어떻게 바꾸는지를 보여주고자 합니다.

그들이 무엇을 했으며 무엇을 발견했는지에 대한 간단한 개요는 다음과 같습니다:

1. "유리창" 문제

대부분의 이전 연구들은 AI 대화를 "일률적"인 렌즈를 통해 바라보았습니다. 데이터가 동일해 보이도록 각 앱의 고유한 특징들을 모두 제거해 버린 것입니다.

  • 비유: 사람들이 음식을 주문하는 방식을 연구할 때, 패스트푸드 드라이브스루, 고급 시트다운 레스토랑, 아니면 푸드트럭에 있는지 여부는 무시하고 단순히 재료 목록만 보고 있다고 상상해 보세요. 당신은 맥락을 놓치게 됩니다!
  • 해결책: SHARECHAT 은 바로 그 다섯 곳 모두에서 주문하는 사람들을 고화질 비디오로 녹화한 것과 같습니다. 그것은 "드라이브스루 스피커"(Grok 의 소셜 미디어 링크), "셰프의 특별 메모"(Claude 의 코드 도구), 그리고 "메뉴 인용"(Perplexity 의 출처 링크) 을 모두 유지합니다.

2. 도서관에는 무엇이 들어 있을까요?

연구자들은 온라인에서 자발적으로 채팅 링크를 공유한 사람들로부터 142,808 개의 대화(66 만 개 이상의 주고받는 메시지) 를 수집했습니다.

  • 규모: 엄청납니다. 다른 도서관들이 짧은 단편적인 대화 (빠른 문자 메시지 같은) 를 가지고 있었던 반면, SHARECHAT 은 사용자가 후속 질문을 하고, 생각을 바꾸며, 여러 차례에 걸쳐 복잡한 문제를 해결하는 길고 깊은 대화를 포함합니다.
  • 다양성: 영어뿐만 아니라 95 개 이상의 언어를 다룹니다.
  • 개인정보 보호: 그들은 채팅에서 모든 이름, 이메일, 전화번호를 삭제하여 누구도 식별할 수 없도록 했습니다. 마치 군중 사진에서 얼굴을 흐리게 만드는 것과 같습니다.

3. 세 가지 주요 발견 (사례 연구)

저자들은 이 도서관을 사용하여 로봇들이 실제로 얼마나 다른지 확인하기 위해 세 가지 구체적인 테스트를 수행했습니다:

A. "이해했니?" 테스트 (대화 완성도)
그들은 AI 가 실제로 사용자가 요청한 것을 끝까지 수행했는지 확인했습니다.

  • 발견: 일부 로봇은 항상 책 전체를 찾아주는 신뢰할 수 있는 사서 (ChatGPT 와 Claude) 와 같습니다. 반면 다른 것들은 훌륭한 첫 페이지를 제공하지만 정답을 찾기 전에 멈추는 검색 엔진 (Perplexity 와 Grok) 과 더 비슷합니다. 현실 세계에서는 많은 대화가 사용자가 부분적으로만 만족하는 상태로 끝납니다. 이전 연구들은 단일 질문만 살펴보았기 때문에 이러한 뉘앙스를 놓쳤습니다.

B. "어디를 찾아봤니?" 테스트 (출처 기반)
그들은 검색 중심의 두 로봇 (Grok 과 Perplexity) 이 어떻게 답변을 찾았는지 살펴보았습니다.

  • 발견: 그들은 두 가지 다른 탐정들과 같습니다.
    • Grok소셜 미디어에 집착합니다. 주로 X(트위터) 의 게시물과 뉴스 사이트를 인용하며 실시간 뉴스 티커처럼 행동합니다.
    • Perplexity연구자입니다. 위키피디아, 학술 저널, 레딧과 같은 포럼을 인용하며 기록을 파고드는 사서처럼 행동합니다.
    • 교훈: 그들은 단순히 "AI"가 아닙니다. 서로 다른 작업을 위해 서로 다른 도구로 구축된 것입니다.

C. "생각의 속도" 테스트 (타이밍)
그들은 AI 가 말한 후 사용자가 답변을 입력하는 데 걸린 시간을 측정했습니다.

  • 발견: 대화의 리듬은 로봇에 따라 달라집니다.
    • ChatGPT와 함께하면 로봇이 채팅이 진행됨에 따라 더 빨라집니다 (아마도 사용자의 스타일을 학습하거나 답변을 캐싱하고 있을 것입니다).
    • Grok과 함께하면 로봇이 채팅이 길어질수록 더 느려집니다 (아마도 모든 기록에 압도당하고 있을 것입니다).
    • 이는 대화의 "성격"이 단어에만 관한 것이 아니라 타이밍과 흐름에 관한 것임을 보여줍니다.

4. 왜 이것이 중요한가

이 논문은 우리가 AI 를 일반화되고 단순화된 렌즈를 통해서만 연구한다면 가장 중요한 부분, 즉 사용자의 현실을 놓치고 있다고 주장합니다.

  • 현실은 messy 합니다: 사람들은 단순히 한 가지 질문을 하고 떠나지 않습니다. 그들은 길고 구불구불한 대화를 나눕니다.
  • 도구가 중요합니다: 사용자는 서로 다른 AI 를 서로 다른 도구로 취급합니다. 하나는 코딩용, 다른 하나는 뉴스용, 또 다른 하나는 창의적 글쓰기용으로 사용합니다.
  • 더 나은 훈련: 연구자들에게 고유한 특징들이 모두 intact 한 "현실 세계" 데이터를 제공함으로써, 우리는 AI 가 무엇을 말할지뿐만 아니라, 그것이 속한 앱의 특정 맥락에서 어떻게 말해야 하는지도 이해하는 더 나은 AI 를 구축할 수 있습니다.

요약하자면: SHARECHAT 은 현실 세계의 AI 채팅을 방대한 다양성으로 수집한 것으로, 이러한 로봇들을 진공 상태에서 바라보아서는 이해할 수 없다는 것을 증명합니다. 우리는 그들이 실제로 어떻게 작동하는지 이해하기 위해 그들의 자연 서식지에서 그들을 지켜봐야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →