← 최신 논문
💬 NLP

Creation of the Estonian Subjectivity Dataset: Assessing the Degree of Subjectivity on a Scale

이 논문은 인간 주석가들에 의해 연속 척도로 평가된 1,000개의 텍스트를 포함하는 문서 수준 주관성 연구를 위한 새로운 에스토니아어 데이터셋을 소개하며, 동시에 인간의 판단과 비교하여 자동 주관성 점수 산출을 위한 GPT-5 사용의 타당성과 한계를 평가한다.

원저자: Karl Gustav Gailit, Kadri Muischnek, Kairit Sirts

게시일 2026-06-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Karl Gustav Gailit, Kadri Muischnek, Kairit Sirts

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 국 한 그릇에 얼마나 많은 "풍미"가 들어있는지 측정하려고 한다고 상상해 보세요. 어떤 국은 그냥 맹물(완전한 객관적 사실)인 반면, 어떤 국은 향신료, 허브, 그리고 요리사의 개인적인 의견(완전한 주관성)이 가득합니다. 오랫동안 컴퓨터와 언어(자연어 처리) 분야의 연구자들은 그저 "이 국이 매운가, 아닌가?"(예/아니오)라고만 물을 수 있었습니다.

이 논문은 에스토니아어를 위한 훨씬 더 정밀한 계량컵을 만드는 것에 관한 이야기입니다. 단순한 "예/아니오" 대신, 연구진은 1,000개의 서로 다른 에스토니아어 텍스트를 0에서 100 사이의 슬라이딩 척도로 평가하는 데이터셋을 만들었습니다. 0점은 순수하고 가감 없는 사실(날씨 보고서 같은)이며, 100점은 순수한 개인적 의견(나쁜 영화에 대한 비난 같은)입니다.

이들이 어떻게 이것을 구축했고 무엇을 발견했는지, 쉽게 설명해 드립니다:

1. 레시피: 데이터셋 구축하기

연구팀은 인간이 이러한 "풍미 점수"에 대해 합의할 수 있는지 확인하고 싶었습니다.

  • 재료: 그들은 1,000개의 텍스트를 모았습니다. 300개는 인터넷의 뉴스 및 의견 기사였고, 700개는 무작위 웹 텍스트(블로그, 포럼, 레시피, 광고 등)였습니다.
  • 시식가: 그들은 인간 "시식가"(주석 작성자)를 고용하여 이 텍스트들을 읽고 0에서 100 사이의 점수를 매기게 했습니다.
  • 파일럿 테스트: 1,000개를 모두 다루기 전에, 단 60개의 텍스트만으로 방법을 테스트했습니다. 결과는 좋았습니다! 시식가들은 척도를 이해했고, 건조한 뉴스 보고서와 매콤한 의견 기사를 구분할 수 있었습니다.

2. 맛 테스트: 인간은 항상 일치하지 않는다

연구팀이 서로 다른 세 명의 사람에게 동일한 1,000개의 텍스트를 평가하게 했을 때, 결과는 다소 혼란스러웠습니다.

  • "주관성"의 문제: 사람마다 매운맛을 느끼는 정도가 다르듯, 무엇이 주관적이라고 간주하는지에 대한 생각도 다릅니다. 어떤 사람은 인용구가 포함된 뉴스 기사가 중립적이라고 생각하는 반면, 다른 사람은 그 인용구가 편향성을 만든다고 생각할 수 있습니다.
  • 상관관계: 인간 사이의 합의는 "보통" 수준이었습니다. 형편없는 수준은 아니었지만 완벽하지도 않았습니다. 때때로 한 사람은 텍스트에 10점(매우 사실적임)을 주고, 다른 사람은 90점(매우 주관적임)을 주기도 했습니다.
  • 재시식: 이를 해결하기 위해, 연구팀은 인간이 가장 많이 의견 차이를 보인 250개의 텍스트를 골라 두 명의 시식가에게 다시 평가하도록 요청했습니다. 이번에는 합의가 훨씬 좋아졌습니다. 알고 보니 텍스트를 읽는 순서가 중요했습니다. 만약 그들이 화가 난 글들을 연달아 읽었다면, 다음 텍스트에 대해서는 객관성에 대해 과하게 민감해졌습니다. 이는 마치 아주 신 레몬을 먹고 나면, 다음에 먹는 과일이 실제보다 더 달게 느껴지는 것과 같습니다.

3. 로봇 시식가: GPT-5의 등장

연구진은 다음과 같은 질문을 던졌습니다: "초지능 컴퓨터(GPT-5라는 AI)가 인간만큼 이 일을 잘 해낼 수 있을까?"

  • 실험: 연구진은 AI에게 1,000개의 텍스트를 모두 평가하게 했습니다.
  • 결과: AI는 놀라울 정도로 일관적이었습니다. 만약 AI에게 동일한 텍스트 묶음을 세 번 평가하게 한다면, 인간(기분이나 맥락에 따라 점수가 변하는)과 달리 거의 동일한 답변을 내놓았습니다.
  • 차이점: 하지만 AI와 인간은 항상 뜻이 맞지는 않았습니다.
    • 인용구: 뉴스 기사에 누군가의 말이 인용되었을 때, 인간은 그것이 저자가 단순히 사실을 보고하고 있는 것임을 이해했습니다. 그러나 AI는 그 인용구를 보고 "헤이, 이 사람이 의견을 표현하고 있네!"라고 생각하여 해당 텍례에 더 높은 주관성 점수를 주었습니다.
    • 속어: 인간은 속어나 커뮤니티 말투로 쓰인 글을 개인적이고 감정적이라고 느껴 높은 점수를 주는 것을 좋아했습니다. AI는 속어 내부의 사실에 더 집중하여 더 낮고 "객관적인" 점수를 주었습니다.

4. 최종 판결

논문의 결론은 다음과 같습니다:

  1. 데이터셋은 실재한다: 연구진은 단순히 "예/아니오"가 아니라 미세한 척도(0–100)로 주관성을 측정하는 최초의 에스토니아어 데이터셋을 성공적으로 구축했습니다.
  2. 인간은 결함이 있지만 인간적이다: 인간은 척도를 사용할 수 있지만, 그들의 점수는 바로 직전에 읽은 내용과 개인적인 관점에 영향을 받습니다.
  3. AI는 보조 도구이지 대체제가 아니다: AI(GPT-5)는 일관성과 속도 면에서는 뛰어나지만, 인간이 포착하는 어조와 맥락의 미묘한 차이를 다르게 "맛봅니다".

요약하자면: AI를 사용하여 텍스트가 얼마나 주관적인지 대략적인 아이디어를 빠르게 얻을 수는 있지만, 단어 뒤에 숨겨진 인간적인 느낌을 이해해야 한다면 여전히 인간의 시식이 필요합니다. AI와 인간은 동일한 재료를 사용하지만 약간씩 다른 레시피를 따르는 두 명의 요리사와 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →