← 최신 논문
💻 computer science

A Multi-Model, Multi-Domain Benchmark of Large Language Model Agreement with Humans and with Each Other in Sentiment Classification

이 논문은 다섯 개의 거대 언어 모델, 규칙 기반 어휘 사전, 그리고 지도 학습된 트랜스포머를 인간의 주석과 비교하여 평가하는 다중 도메인 벤치마크를 제시하며, Claude Opus 4.7 및 GPT-5.5와 같은 최상위 모델들이 인간과 강력한 일치도를 달성하는 반면, 모델 간의 불일치와 인간의 레이블과의 불일치가 특히 비정형 텍스트에서 지속적으로 나타남을 밝힘으로써 모델 선택이 감성 분류 결과에 실질적인 영향을 미친다는 점을 입증한다.

원저자: Aneesh K Sajan

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Aneesh K Sajan

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

언어를 읽고 이해하는 컴퓨터의 세계에는 인터넷의 시작만큼이나 오래된 과제가 하나 있습니다. 바로 어떤 텍스트가 기쁜지, 슬픈지, 아니면 그저 사실만을 진술하고 있는지를 파악하는 것입니다. 이를 감성 분석(sentiment analysis)이라고 부릅니다. 수년 동안 사람들은 뉴스 보고에 따라 주식 시장이 어떻게 반응할지 예측하거나, 고객이 제품에 대해 화가 났는지 확인하거나, 보건 위기 상황에서 대중의 기류를 추적하기 위해 이러한 도구들을 사용해 왔습니다. 최근에는 이야기를 쓰고, 질문에 답하며, 대화를 나눌 수 있는 시스템인 거대 언어 모델(LLM)로 알려진 새로운 세대의 프로그램들이 등장했습니다. 이들은 인간의 언어를 이해하는 능력이 매우 뛰어나기 때문에, 많은 이들이 인간 검토자의 느리고 비용이 많이 드는 작업을 단 한 번의 컴퓨터 명령으로 대체하고자 하는 희망을 품고, 텍-트의 감정을 분류하는 작업에 이들을 사용하기 시작했습니다.

하지만 이 새로운 접근 방식에는 문제가 있습니다. 서로 다른 사람들이 영화 리뷰가 비꼬는 것인지 진심인지에 대해 의견이 갈릴 수 있는 것처럼, 서로 다른 컴퓨터 프로그램들도 서로 동의하지 않을 수 있습니다. 어떤 프로그램은 문장을 "긍정적"이라고 부르는 반면, 다른 프로그램은 정확히 같은 문장을 "부정적"이라고 부를 수도 있습니다. 만약 은행이나 병원이 중요한 결정을 내리기 위해 이러한 도구들에 의존한다면, 어떤 것을 선택하느냐는 매우 중대한 문제가 됩니다. 지금까지는 이 다양한 프로그램들이 서로 얼마나 잘 일치하는지, 혹은 동일한 텍스트를 보고 있을 때 실제 인간 판정가들과 얼마나 자주 일치하는지를 체계적으로 점검한 사람이 없었습니다.

아니쉬 K 사잔(Aneesh K Sajan)이라는 연구자는 이 질문을 해결하기 위해 대규모의 통제된 실험을 수행하기로 했습니다. 그는 네 곳의 서로 다른 기술 기업에서 제공하는 가장 진보된 다섯 개의 언어 모델과, 기준점으로 삼을 수 있는 더 오래되고 단순한 두 개의 도구를 모았습니다. 그는 다섯 가지 데이터 세트에서 추출한 총 8,872개의 문장을 이들에게 입력했습니다. 이 문장들은 공식적인 금융 보고서, 일상적인 소셜 미디어 게시물, 영화 리뷰, 실적 발표 회의 등 다양한 출처에서 가져온 것이었습니다. 목표는 컴퓨터가 텍스트의 감정을 인간이 라벨링한 것과 비교하여 올-바르게 식별할 수 있는지, 그리고 더 중요한 것은 컴퓨터들이 서로 얼마나 자주 일치하는지를 확인하는 것이었습니다.

결과는 명확한 성능 차이를 보여주었습니다. Anthropic이라는 회사의 모델 하나와 OpenAI의 모델 하나가 가장 뛰어난 성능을 보였습니다. 이 두 모델이 공식적인 금융 텍스트를 보았을 때, 인간의 판단과 거의 완벽하게 일치했습니다. 또한 이들은 분석한 문장의 거의 90%에 대해 서로 일치하는 결과를 보였습니다. OpenAI의 세 번째 모델도 그 뒤를 바짝 쫓으며, 세상을 비슷한 방식으로 바라보는 고성능 도구 그룹을 형성했습니다. 그러나 답변하기 전에 문제를 "생각"하도록 설계된 구글의 모델은 충격적일 정도로 낮은 성능을 보였습니다. 이 모델은 감성을 틀리게 파악하는 경우가 너무 많아서 그 결과가 무작위 추측보다 간신히 나은 수준이었습니다. 연구자는 이 실패가 모델이 단순한 질문에 대해 너무 많은 시간을 들여 생각하는 현상, 즉 "과잉 사고(overthinking)" 때문인지 확인하기 위해 특정 가설을 테스트했습니다. 그는 모델이 훨씬 짧은 생각 시간을 갖도록 강제했지만, 낮은 성능은 그대로 유지되었습니다. 이는 모델이 단순히 과하게 분석해서 발생한 문제가 아니라, 해당 모델의 설정 자체에 내재된 문제임을 입증했습니다.

연구자의 개인 컴퓨터에서 실행할 수 있는 오픈 소스 모델 하나는 중간 정도의 성능을 보였습니다. 상용 모델들만큼 정확하지는 않았지만, 수년간 사용되어 온 오래된 규칙 기반 도구들보다는 훨씬 뛰어났습니다. 또한 연구는 텍스트의 유형이 매우 중요하다는 것을 발견했습니다. 모든 모델은 캐주얼하고 비공식적인 언어인 트윗이나 메시지보다 공식적이고 전문적인 글을 이해하는 데 훨씬 더 뛰어난 모습을 보였습니다. 비공식적인 텍스트의 경우, 최고의 모델들조차 일치도가 "보통" 수준으로 떨어졌는데, 이는 여전히 인간 및 서로 다른 모델들과 상당 부분 의견이 다름을 의미합니다.

아마도 가장 놀라운 발견은 모델들이 실제로 서로 얼마나 적게 일치하는가 하는 점일 것입니다. 연구자가 여섯 가지 도구 전체를 살펴보았을 때, 이들이 정확히 똑같은 답을 내놓은 경우는 전체 문장의 약 14~24%에 불과했습니다. 나머지 문장들에 대해서는 뚜렷한 다수 의견이 없었습니다. 이는 사람들이 매일 분석하는 방대한 양의 텍스트에 대해, 최종 결과가 전적으로 당신이 어떤 컴퓨터 프로그램을 사용하느냐에 달려 있다는 것을 의미합니다. 만약 한 금융 분석가는 한 모델을 사용하여 보고서를 읽고, 다른 분석가는 다른 모델을 사용한다면, 그들은 동일한 뉴스에 대해 정반대의 결론에 도달할 수 있습니다.

이 연구는 이러한 새로운 도구들이 강력하기는 하지만, 서로 대체 가능한 것은 아니라고 결론짓습니다. 모델의 선택은 사소한 기술적 세부 사항이 아니라, 데이터 자체를 변화시키는 결정입니다. 공식적인 금융 문서를 다루는 작업의 경우, 상위 모델들은 신뢰할 수 있고 일관적입니다. 하지만 비공식적인 텍스트나 긍정과 부정의 차이가 미묘한 작업을 수행할 때, 모델 간의 불일치는 진정한 불확실성의 징후입니다. 이러한 경우, 연구자는 단 하나의 컴퓨터에 의존하는 것은 위험하다고 제안합니다. 대신, 여러 모델을 함께 사용하거나, 컴퓨터들이 서로 의견이 엇갈리는 문장에 대해 인간이 검토하게 함으로써, 최종 결정이 단순히 어떤 소프트웨어를 선택했느냐의 산물이 되지 않도록 보장하는 것이 최선의 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →