← 최신 논문
💬 NLP

User eXperience Perception Insights Dataset (UXPID): Synthetic User Feedback from Public Industrial Forums

본 논문은 UX 분석, 요구사항 추출, AI 기반 피드백 처리 연구를 지원하면서 개인정보 보호 및 라이선스 제약을 해결하기 위해 LLM 으로 주석 처리된 산업 포럼의 7,130 개 익명화 사용자 피드백 분기로 구성된 합성 데이터셋인 UXPID 를 소개합니다.

원저자: Mikhail Kulyabin, Jan Joosten, Choro Ulan uulu, Nuno Miguel Martins Pacheco, Fabian Ries, Filippos Petridis, Jan Bosch, Helena Holmström Olsson

게시일 2026-05-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mikhail Kulyabin, Jan Joosten, Choro Ulan uulu, Nuno Miguel Martins Pacheco, Fabian Ries, Filippos Petridis, Jan Bosch, Helena Holmström Olsson

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 배의 선장이라고 상상해 보세요. 하지만 바다를 항해하는 대신 산업용 소프트웨어와 하드웨어의 복잡한 세계를 항해하고 있습니다. 당신의 승무원(사용자들)은 거대하고 혼란스러운 게시판으로 끊임없이 메모, 불만, 아이디어를 보냅니다. 일부 메모는 냅킨에 낙서처럼 적혀 있고, 일부는 소음 위로 외쳐지며, 많은 메모는 작성자만 이해하는 비밀 코드로 쓰여 있습니다.

이 논문은 당신과 같은 선장들이 그 혼란을 이해하는 데 도움이 되는 새로운 도구인 UXPID(User eXperience Perception Insights Dataset, 사용자 경험 인식 통찰 데이터셋)를 소개합니다.

이것이 어떻게 만들어졌는지, 어떤 내용이 들어 있는지, 그리고 왜 중요한지 간단히 설명합니다:

1. 문제: 방 안의 "소음"

수년 동안 기업들은 공개 포럼에 있는 수천 개의 사용자 댓글이라는 금광을 보유하고 있었습니다. 하지만 이 금은 흙 속에 묻혀 있습니다.

  • 지저분함: 댓글은 비정형적이고, 지저분하며, 산재해 있습니다.
  • 프라이버시 장벽: 실제 메모를 그냥 가져올 수 없습니다. 개인 이름, 기업 비밀, 특정 제품 코드 등이 포함되어 있기 때문입니다. 금고에 잠긴 일기를 읽으려 하는 것과 같습니다.
  • 지도 부재: 이러한 메모를 분석하는 기존 도구들은 자석 없이 건초더미에서 바늘을 찾으려는 것과 같습니다. 문제의 심각성(작은 스크래치인지 선체에 구멍이 뚫린 것인지)이나 구체적인 주제(엔진에 관한 것인지 항해 시스템에 관한 것인지)를 종종 놓칩니다.

2. 해결책: "합성 거울"

연구자들은 그 지저분한 게시판의 완벽하게 연마되고 익명화된 거울과 같은 UXPID를 만들었습니다.

  • 만드는 방법: 그들은 산업 자동화 포럼에서 7,130 개의 실제 대화 스레드를 가져왔습니다.
  • 마법의 트릭 (AI): 그들은 초지능 AI(대규모 언어 모델) 를 "번역가"이자 "프라이버시 경비원"으로 활용했습니다.
    • 1 단계: AI 는 실제 지저분한 댓글을 읽고 의미를 추출했습니다. "사용자가 화가 났다", "제품이 고장 났다", "새로운 기능이 필요하다"는 식입니다.
    • 2 단계: AI 는 댓글을 다시 썼습니다. 의미는 정확히 그대로 유지하면서 모든 비밀을 교체했습니다. "시멘스의 존 스미스" 대신 "[사용자 이름] 의 [회사 이름]"으로, "버전 2.1 의 제품 X" 대신 "[제품 이름] [버전 번호]"로 바꾼 것입니다.
  • 결과: 당신은 실제 생활과 정확히 같은 느낌을 주지만 누구와도 공유해도 안전한 데이터셋을 얻게 됩니다. 재료는 실제이지만 요리사가 알레르기를 유발하는 성분을 제거한 맛있는 요리를 제공하는 것과 같습니다.

3. 상자 안에는 무엇이 들어 있을까요?

이 데이터셋은 단순한 텍스트 더미가 아니라 구조화된 도서관입니다. 모든 대화 스레드에는 다음을 포함하는 "태그된 요약"이 함께 제공됩니다:

  • "고통 포인트": 사용자가 무엇에 좌절하고 있는가?
  • "기쁨 포인트": 그들이 무엇을 좋아하는가?
  • "심각성": 사소한 불만인가 치명적인 비상 사태인가?
  • "감정": 행복한가, 슬픈가, 중립적인가?
  • "주제": 이 내용은 어떤 범주에 속하는가?

혼란스러운 외침을 각 불만이 색상으로 구분된 태그로 라벨링된 깔끔하게 정리된 파일 캐비닛으로 바꾸는 것이라고 생각하세요.

4. 작동했는가? (테스트 드라이브)

연구자들은 상자만 만든 것이 아니라, 이것이 실제로 컴퓨터가 학습하는 데 도움이 되는지 테스트했습니다. 그들은 이 새로운 데이터셋을 사용하여 두 가지 다른 유형의 "학생"(컴퓨터 모델) 에게 가르쳤습니다:

  1. 오래된 학생: "고장"이 몇 번 나타나는지 세는 것과 같은 키워드를 찾는 전통적인 방법.
  2. 새로운 학생: 맥락과 뉘앙스를 이해하는 현대적 AI(DistilBERT).

결과:

  • 새로운 학생은 훨씬 더 빠르고 잘 학습했습니다. 높은 정확도로 대화의 주제와 사용자의 기분을 올바르게 추측할 수 있었습니다.
  • 오래된 학생은 어려움을 겪었으며, 종종 잘못 추측하거나 드문 단어에 혼란을 겪었습니다.
  • 핵심 발견: 새로운 AI 는 단어 뒤에 숨겨진 의미를 이해하는 데 매우 능숙하여, 단어가 약간 다르더라도 사용자가 무엇을 원하는지 예측할 수 있었습니다.

5. "정밀도" 점검: 영혼을 잃었는가?

주요 우려 사항은 다음과 같았습니다: "이름과 숫자를 바꿀 때, 텍스트의 느낌도 바뀌었는가?"

  • 그들은 원래의 지저분한 메모와 깔끔한 합성 메모를 비교했습니다.
  • 판결: 대화의 구조는 정확히 그대로 유지되었습니다. 질문의 수와 답변의 길이는 동일했습니다.
  • 작은 변화 하나: 합성 텍스트는 약간 더 "공식적"이 되었습니다. AI 는 프라이버시를 보호하기 위해 일부 외침(감탄사) 과 대문자 외침을 제거했습니다. 이는 이 데이터로 컴퓨터를 훈련시킬 경우 실제 생활의 "외침"에 대한 민감도가 약간 낮아질 수 있음을 의미하지만, 핵심 메시지는 온전하게 유지됩니다.

요약

간단히 말해, 이 논문은 컴퓨터를 위한 안전하고 고품질의 훈련 매뉴얼을 제시합니다. 이를 통해 연구자와 기업들은 실제 사람의 개인 이름이나 기업 비밀 데이터를 한 번도 보지 않고도 AI 에게 고객 피드백을 듣는 법, 그들이 얼마나 화났거나 행복한지 이해하는 법, 그리고 그들이 무엇을 필요로 하는지 파악하는 법을 가르칠 수 있습니다. 이는 혼란스러운 목소리의 군중을 명확하고 실행 가능한 신호로 바꿔줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →