← 최신 논문
💻 computer science

So Many Opinions, So Many LLMs: Comparing Large Language Models to Traditional Machine Learning for Open- Ended Survey Analysis

이 연구는 개방형 설문 응답을 분석하는 데 있어 거대 언어 모델(LLM)과 전통적인 머신러닝을 비교하며, LLM이 복잡한 주제와 감정을 이해하는 데 있어 우수한 분류 정확도를 달달성하는 반면, 그 추론 과정의 일관성과 설명 가능성에 있어서는 상당한 절충안(trade-offs)을 제시한다는 점을 발견하였다.

원저자: Abdullah Akinde, Mariam Akinde, Rasheedat Emiola, Ahmed Akinsola

게시일 2026-07-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Abdullah Akinde, Mariam Akinde, Rasheedat Emiola, Ahmed Akinsola

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 수천 통의 학생 편지가 담긴 거대한 상자가 있다고 상상해 보세요. 이 편지들은 모두 저마다의 서툴고 감정적인 필체로 쓰여 있습니다. 어떤 것은 기쁘고, 어떤 것은 화가 나 있으며, 어떤 것은 냉소적이고, 또 어떤 것은 그저 혼란스러워 보입니다. 당신의 임무는 무엇인가요? 모든 편지를 읽고 이를 여섯 가지 감정 바구니(기쁨, 놀람, 사랑, 분노, 슬픔, 두려움)로 분류하는 것입니다.

오랫동안 연구자들은 "올드 스쿨(Old School)" 컴퓨터 프로그램을 사용하여 이 작업을 수행하려 노력했습니다. 이 프로그램들은 특정 단어만을 세는 데 아주 엄격한 사서와 같습니다. 만약 사서가 "great(매우 좋은)"라는 단어를 발견하면, 그 편지에 "기쁨" 스티커를 붙입니다. "bad(나쁜)"라는 단어를 보면 "슬픔" 스티커를 붙이죠. 이 방식은 빠르고, 사서가 왜 그런 선택을 했는지 명확히 알 수 있습니다. 하지만 여기에는 문제가 있습니다. 이 사서들은 속이기 쉽습니다. 그들은 비꼬는 말투를 놓치고, 감사 인사 뒤에 숨겨진 피로감이나, 예의 바른 단어를 사용하고 있음에도 불구하고 실제로 학생이 매우 격분하고 있다는 미묘한 힌트를 알아채지 못합니다.

이 연구에서 연구자들은 새로운 조력자 팀인 **거대 언어 모델(LLM)**을 테스트하기로 했습니다. 이들을 인터넷의 거의 모든 것을 읽은, 매우 똑똑하고 박학다식한 로봇이라고 생각하면 됩니다. 단어 하나하나를 세는 엄격한 사서와 달리, 이 로봇들은 문장의 개별 단어가 아니라 *분위기(vibe)*와 *맥락(context)*을 이해하려고 노력합니다.

대결의 장

연구자들은 2019년과 2021년의 실제 학생 설문 데이터(2021년 3개 묶음 293통, 2019년 142통)를 사용하여 이 두 팀을 맞붙였습니다. 연구자들은 로봇에게 새로운 것을 가르치지 않았습니다. 대신 "제로샷(zero-shot)" 프롬프팅이라 불리는 간단한 지침을 사용하여 편지를 분류하도록 요청했을 뿐입니다.

올드 사서들이 한 일
전통적인 컴퓨터 모델(Support Vector Classifier 및 Random Forest 등)은 특정 사례들을 학습했을 때는 편지를 분류하는 데 괜찮은 성능을 보였습니다. 연습 테스트에서 약 **90%**의 정확도를 기록했죠. 하지만 실제의 복잡한 학생 편지들을 마주했을 때, 이들은 조금 이상하게 행동하기 시작했습니다.

  • 2019년 데이터 묶음에서, 한 모델은 편지의 **99.3%**를 "기쁨"으로 결정했습니다. 즉, 다른 모든 감정을 무시해 버린 것입니다!
  • 2021년 데이터 묶음에서, 모델들은 서로 극명하게 의견이 갈렸습니다. 어떤 모델은 한 편지를 "사랑"이라고 생각한 반면, 다른 모델은 "슬픔"이라고 생각했습니다.
  • 연구자들은 이 오래된 모델들이 특정 단어(예: "great" 또는 "good")에 너무 민감하며, 언어의 까다로운 인간적 측면을 다루지 못한다는 것을 발견했습니다. 이들은 취약했습니다. 즉, 데이터가 조금만 바뀌어도 분류 체계가 무너졌습니다.

새로운 로봇들이 한 일
GPT-4-Turbo, Claude 3.5, Meta의 LLaMA 3, 그리고 Perplexity Sonar Pro를 포함한 LLM 팀은 다른 방식을 보여주었습니다. 그들은 단순히 단어를 세는 것이 아니라, 느낌을 이해하려고 노력했습니다.

  • 그들은 서로 의견이 일치했습니다: 네 대의 서로 다른 로봇이 같은 편지 더미를 살펴보았을 때, 그들은 대부분 같은 방식으로 분류했습니다. 예를 들어, 2021년 데이터에서 네 대의 로봇은 "분노"에 해당하는 편지가 몇 통인지(46통)에 대해 정확히 일치하는 결과를 냈습니다.
  • 그들은 뉘앙스를 다루었습니다: 그들은 학생들이 비꼬거나, "감사합니다"라는 말 속에 사실은 피로감이 섞여 있는 경우와 같은 복잡한 감정을 포착하는 데 훨씬 뛰어났습니다.
  • 숫자들: 논문은 로봇의 정확한 "정확도 점수"를 단일 수치로 제공하지 않습니다(비교할 인간 정답지가 없기 때문입니다). 하지만 그들의 일관성은 이러한 복잡하고 실제적인 데이터를 다루는 데 있어 기존 모델보다 훨씬 더 신뢰할 수 있음을 시사합니다.

함정
로봇들도 완벽한 마법사는 아닙니다. 연구자들은 주의 깊게 살펴봐야 할 몇 가지 사항을 지적합니다:

  • "사랑" 글리치(Glitch): 네 대의 로봇 모두 "기쁨"보다 "사랑"으로 분류하는 편지가 더 많았습니다. 연구자들은 이것이 로봇들이 소셜 미디어로부터 학습했기 때문이라고 추측합니다. 소셜 미디어에서는 사람들이 깊은 로맨틱한 감정이 아니라, 단순히 "이 수업 정말 좋아(I love this class!)"라는 의미로 "love"를 사용하기 때문입니다.
  • 블랙박스: 올드 사서들과 달리, 로봇이 왜 그런 선택을 했는지 항상 알 수는 없습니다. 그들의 작업을 감사(audit)하기가 더 어렵습니다.
  • 비용 및 업데이트: 이 로봇들을 실행하는 데는 비용이 많이 들며, 이들을 만드는 회사들은 자주 업데이트를 진행합니다. 내년에 똑같은 프롬프트를 실행하더라도, 로봇이 "새로운 버전"이 되었기 때문에 약간 다른 답을 내놓을 수 있습니다.

결론
이 연구는 만약 당신이 개방형 학생 응답 수천 건을 분석하고 싶다면, 새로운 AI 로봇이 더 나은 도구임을 시사합니다. 그들은 언어의 복잡한 인간적 측면을 이해하는 데 훨씬 뛰어나며, 서로 다른 학생 집단 사이에서도 일관성을 유지합니다.

하지만 연구자들은 이것이 "해결된" 문제라고 말하지는 않습니다. 그들은 고도의 의사결정(예: 학교 정책 변경)이 필요한 경우에는 협업 방식이 최선이라고 제안합니다. 즉, 로봇이 편지를 분류하는 힘든 일을 처리하게 하되, 로봇이 비꼬는 말투나 편향에 속지 않는지 확인하기 위해 인간이 작업을 검토하게 하는 것입니다. 이는 학생들의 목소리에 귀를 기울이는 강력한 새로운 방법이지만, 여전히 인간의 손길이 필요합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →