← 최신 논문
💻 computer science

User Reviews as a Source for Usability Requirements: A Precursor Study on Using Large Language Models

본 논문은 사용자 리뷰를 활용하여 사용성 요구사항을 분석하는 데 있어 대규모 언어 모델의 잠재력을 조사하며, 코딩된 데이터셋과 프롬프트 엔지니어링을 통해 프롬프트가 신중하게 설계될 경우 대규모 언어 모델이 사용성 문제를 식별하는 데 인간과 비교할 만한 성과를 달성할 수 있음을 입증한다.

원저자: Cedric Wellhausen, Laura Reinhardt, Kurt Schneider

게시일 2026-05-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Cedric Wellhausen, Laura Reinhardt, Kurt Schneider

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

바쁜 레스토랑의 셰프가 되어 있다고 상상해 보세요. 메뉴를 개선하기 위해 고객들이 음식에 대해 어떻게 생각하는지 정확히 알고 싶습니다. 전문 음식 평론가 팀을 고용해 모든 요리를 시식하고 상세한 보고서를 작성하게 할 수도 있지만, 이는 비용이 많이 들고 느립니다. 대신, 사람들이 웹사이트에 남긴 수천 건의 지저분하고 감정적이며 때로는 혼란스러운 리뷰를 읽는 방법도 있습니다.

이 논문은 바로 그 지저분한 리뷰를 읽고, 실제로 사용성(즉, 앱 사용의 난이도) 에 관한 리뷰를 찾아내도록 초지능 컴퓨터 (대규모 언어 모델, LLM) 를 가르치려는 시도와 관련이 있습니다.

다음은 그들의 실험 이야기를 단순화하여 정리한 것입니다:

문제: 소음은 너무 많고 시간은 부족합니다

소프트웨어 기업들은 사용자 리뷰에 압도당하고 있습니다. 사람들은 "이 앱은 악몽이야!", "세 번 클릭했는데도 여전히 작동하지 않아!", "새로운 기능이 좋지만 버튼이 너무 작아"라고 씁니다.

  • 옛날 방식: 유용한 불만을 찾기 위해 연구자들은 과거 머신 러닝을 이용해 컴퓨터를 훈련시켰습니다. 하지만 이는 수천 개의 막대기를 던져 개가 그것을 잡는 법을 배우게 하려는 시도와 같았습니다. 먼저 데이터를 라벨링하기 위해 엄청난 양의 인력이 필요했습니다.
  • 새로운 아이디어: 슈퍼 지능적인 컴퓨터 (LLM) 에게 리뷰를 읽고 어떤 것이 "사용성"에 관한 것인지 말해달라고 하면 어떨까요? 이 컴퓨터들은 이미 인터넷 전체로 훈련되었기 때문에 처음부터 가르치지 않아도 문맥을 이해할 수 있을지도 모릅니다.

실험: "맛보기 테스트"

독일의 연구진들은 컴퓨터가 인간 전문가만큼 일을 잘할 수 있는지 확인하기 위해 통제된 테스트를 실시했습니다.

  1. 재료: 그들은 세 가지 매우 다른 유형의 앱에서 300 개의 실제 사용자 리뷰를 수집했습니다.

    • 운전자용 교통/레이더 앱.
    • 쇼핑객용 식료품점 앱.
    • 음악가용 음악 제작 앱.
    • 왜 이 세 가지인가? 컴퓨터가 특정 유형의 언어에만 능숙한 것이 아니라는 것을 확인하기 위함입니다.
  2. 인간 심사위원: 두 명의 인간 전문가가 300 개의 모든 리뷰를 읽었습니다. 그들은 유명한 체크리스트 (닐슨의 10 가지 사용성 휴리스틱) 를 사용하여 리뷰가 "사용성"에 관한 것인지 (True) 아닌지 (False) 결정했습니다. 그들은 난해한 것들에 대해 논쟁하다가 합의할 때까지 논의했습니다. 이것이 "골드 스탠더드" 정답 키를 만들었습니다.

  3. 컴퓨터 학생: 그들은 LLM 에게 일련의 지시사항 (프롬프트라고 함) 을 주었습니다. 이 프롬프트를 레시피라고 생각하세요.

    • 첫 번째 시도: 레시피가 모호했습니다. 컴퓨터가 혼란스러워했습니다.
    • 두 번째 및 세 번째 시도: 연구진들은 레시피를 다듬어 더 구체적인 단계와 예시 (예: "누군가가 앱이 '성가시다'고 말하면, 그것은 사용성 문제로 간주한다"라고 컴퓨터에 지시하는 등) 를 추가했습니다.
    • 최종 테스트: 그들은 컴퓨터에게 최종적으로 다듬어진 레시피를 주고 300 개의 모든 리뷰를 평가하도록 요청했습니다.

결과: 유망하지만 불완전한 학생

연구진들은 컴퓨터의 평가와 인간 전문가의 정답 키를 비교했습니다.

  • 좋은 소식: 컴퓨터는 "True" 리뷰를 찾는 데 놀라울 정도로 능했습니다. 사용성 불만을 놓친 경우가 거의 없었습니다. 인간이 "이것은 사용성 문제다"라고 말하면 컴퓨터는 보통 동의했습니다.
  • 나쁜 소식: 컴퓨터는 조금 너무 열성적이었습니다. 인간들이 단순한 일반 불만이나 버그라고 생각한 리뷰를 때때로 "사용성 문제"로 표시했습니다.
  • 신뢰성 확인: 컴퓨터와 인간이 정확히 같은 답변에 동의한 빈도를 측정했을 때, 결과는 엇갈렸습니다.
    • 음악 앱의 경우, 그들은 꽤 잘 일치했습니다.
    • 교통 및 식료품 앱의 경우, 그들은 더 자주 불일치했습니다.
    • 특히 중요한 점은, 컴퓨터의 실수가 인간이 불확실했던 부분에서 발생하지 않았다는 것입니다. 컴퓨터는 고유한 실수를 저지르고 있었으며, 아직 인간 전문가처럼 완벽하게 "생각"하지는 못한다는 의미입니다.

결론: 인간 전문가의 대체제가 아닌 유용한 조력자

이 논문은 컴퓨터가 인간 전문가를 완전히 대체할 준비는 되었지만, 매우 유용한 도구라고 결론 내립니다.

LLM 을 초고속 인턴이라고 생각하세요.

  • 만약 인턴에게 1,000 개의 리뷰를 읽게 하면, 사용성에 관한 거의 모든 불만을 찾아낼 것입니다.
  • 그들은 실제로 사용성 문제가 아닌 것들 (오경보) 을 몇 가지 표시할 수도 있지만, 연구진들은 실제 문제를 놓치는 것보다 몇 가지 추가 리뷰를 확인하는 것이 낫다고 주장합니다.
  • 인턴이 잘 작동하게 만드는 열쇠는 프롬프트(지시사항)였습니다. 모호한 지시는 나쁜 결과를 초래했고, 세심하게 다듬어진 상세한 지시는 좋은 결과를 가져왔습니다.

요약하자면: 이제 리뷰를 읽기 위해 컴퓨터를 몇 달 동안 훈련시킬 필요가 없습니다. 똑똑한 컴퓨터에게 매우 명확한 지시사항 세트를 주기만 하면, 사용자가 실제로 무엇을 필요로 하는지 찾는 데 큰 도움을 줄 수 있습니다. 다만, 특히 난해한 경우를 위해 여전히 인간이 작업을 이중 확인해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →