← 최신 논문
💬 NLP

Validity of LLMs as data annotators: AMALIA on authority

이 논문은 포르투갈의 국가 언어 모델인 AMALIA가 권위의 도덕적 토대에 대해 인간 코더와 높은 일치도를 달성함에도 불구하고, 이론적 추론보다는 표면적인 지름길에 의존하기 때문에 구성 타당성이 결여되어 있음을 입증하며, 단순한 일치도를 넘어 모델 성능의 증거적 근거를 평가하기 위한 국가별 LLM 벤치마크의 필요성을 강조한다.

원저자: Manuel Pita

게시일 2026-07-10
📖 4 분 읽기☕ 가벼운 읽기

원저자: Manuel Pita

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 AMALIA라는 이름의 새롭고 매우 똑똑한 로봇이 있다고 상상해 보세요. AMALIA는 유럽 포르투갈어를 그 누구보다 더 잘 이해하고 구사할 수 있도록 공적 자금을 투입해 만들어진, 포르투갈 자체의 언어 로봇입니다. 이 프로젝트의 큰 희망은 AMALIA가 연구자들을 위한 초고속, 초저가 인간 비서처럼 역할을 해내는 것이었습니다. 구체적으로, 과학자들은 이 로봇을 이용해 수천 개의 소셜 미디어 게시물을 읽고, 사람들이 **"권위(Authority)"**에 대해 이야기하고 있는지 파악하고자 했습니다. 이는 단순히 "상사"나 "경찰"이라는 단어를 찾는 것이 아니라, 누군가가 위계질서의 규칙을 존중하는지 혹은 도전하는지를 다루는 매우 까다로운 개념입니다.

여기 반전이 있습니다. AMALIA는 정답을 맞히는 것은 뛰어나지만, 자신의 풀이 과정을 보여주는 것에는 젬병이라는 사실입니다.

"정답은 맞지만, 이유는 틀린" 문제

AMALIA를 수학 시험을 치르는 학생이라고 생각해 보세요.

  • 목표: 선생님이 "이 특정 공식을 사용하여 X를 구하세요"라고 요청합니다.
  • 결과: AMALIA는 X의 정확한 숫자를 적어냅니다.
  • 함정: 선생님이 "풀이 과정을 보여달라"고 하면, AMALIA는 보여주지 못합니다. 공식을 사용하는 대신, "아, 문장에 '상사'라는 단어가 있네, 그럼 답은 '권위'겠구나"와 같이 패턴을 보고 답을 때려 맞힌 것입니다.

현실 세계에서 이것은 위험합니다. 만약 어떤 로봇이 인간 전문가와 90%의 일치율을 보인다면, 우리는 보통 "훌륭하다! 믿어도 되겠다!"라고 말합니다. 하지만 이 논문은 AMALIA의 경우, 그 일치도가 가짜라고 주장합니다. 그것은 마치 사람이 웃을 때마다 "사랑해"라고 말하도록 학습된 앵무새와 같습니다. 앵무새는 사랑을 느끼는 것이 아니라, 그 미소를 문구와 연결하고 있을 뿐입니다. AMALIA는 연구자들이 측정하려 했던 권력과 존중에 대한 복잡한 이론을 실제로 이해한 것이 아니라, 표면적인 단서(예: 경찰을 보거나 누군가 화를 내는 것을 듣는 것)를 "권위"라는 라벨에 끼워 맞춘 것이었습니다.

"블랙박스" 테스트

이를 증명하기 위해, 연구자들은 단순히 AMALло에게 큰 질문을 던진 것이 아닙니다. 그들은 탐정이 사건을 단서로 나누듯, 질문을 아주 작고 단순한 조각들로 쪼갰습니다.

  1. 큰 질문: "이 텍스트는 권위에 관한 내용인가?"
  2. 작은 단서들: "리더를 언급하는가?" "그 리더의 행동을 판단하는가?" "전통에 대해 이야기하는가?"

만약 AMALIA가 그 개념을 진정으로 이해했다면, 큰 질문을 던졌을 때나 작은 단서들을 던졌을 때나 동일한 결과를 내놓아야 했습니다. 하지만 그렇지 않았습니다.

  • 큰 질문을 받았을 때, AMALIA는 인간 전문가와 **71%**의 일치율을 보였습니다.
  • 작은 단서들을 주고 조각들을 맞춰보라고 강제했을 때, 그 일치율은 단 **36%**로 떨어졌습니다.

이 거대한 하락을 **"회복 격차(recovery gap)"**라고 부릅니다. 이것은 마술사가 모자에서 토끼를 꺼내는 것과 같습니다. 만약 당신이 "토끼가 어디 있나요?"라고 물었을 때 마술사가 모자를 가리킨다면 그것은 좋습니다. 하지만 "모자 안에 있는 토끼를 보여주세요"라고 했을 때 모자가 비어 있다면, 당신은 마술사가 속임수를 썼다는 것을 깨닫게 됩니다. 논문은 AMALIA의 "속임수"가 도덕적 분노를 강력한 인물 근처에서 발견하면 그것이 권위에 관한 것이라고 가정해 버리는 식의 표면적인 지름길에 의존했다는 점을 밝혀냈습니다.

"더 큰 로봇"과의 비교

연구자들은 AMALIA만 테스트한 것이 아니라, 두 대의 다른 로봇도 함께 테스트했습니다: 중간 규모의 Llama와 (AMALIA의 90억 개 파라미터와 비교되는 1,200억 개의 파라미터를 가진 거대 모델) GPT-OSS입니다.

  • 거대 로봇 (GPT-OSS): 포르투갈어로 동일한 까다로운 질문을 받았을 때, 이 모델은 격차가 없었습니다. 정답을 맞혔을 뿐만 아니라, 자신의 풀이 과정도 보여줄 수 있었습니다. 즉, 이론을 이해하고 있었습니다.
  • 중간 규모 로봇 (Llama): 약간의 격차가 있었지만, 점점 나아지는 모습을 보였습니다.
  • AMALIA: 격차가 매우 컸습니다.

이는 문제가 포르투갈어 자체나 사용된 텍스트에 있는 것이 아님을 증명합니다. 문제는 모델의 크기와 학습 방식이었습니다. 논문은 AMALIA가 복잡한 이론의 "결(grain)"을 다루기에는 너무 작다고 시사합니다. 이는 마치 새집을 짓기 위한 망치로 마천루를 지으려는 것과 같습니다. 도구가 너무 작아서, 겉보기에는 작동하는 것처럼 보일지라도 실제 업무를 수행할 수는 없는 것입니다.

국가 로봇에 주는 의미

이 논문은 몇 가지 대중적인 생각들을 명시적으로 배제합니다:

  1. 언어의 문제가 아니다: AMALIA가 포르투갈의 "고향" 로봇임에도 불구하고, 국제적인 거대 로봇들보다 성능이 좋지 않았습니다. 오히려 거대 로봇들이 AMALIA보다 인간과 더 많이 일치했습니다.
  2. 일치도가 전부가 아니다: 로봇이 인간과 일치한다고 해서 반드시 올바른 것을 측정하고 있다는 뜻은 아닙니다. 그저 패턴 매칭을 하고 있는 것일 수도 있습니다.
  3. 모델 제작자의 실패가 아니다: 논문은 AMALIA의 투명성과 개방성을 높게 평가합니다. 문제는 현재 로봇을 테스트하는 "골드 스탠다드(표준)"인 '인간과의 일치 여부 확인' 방식 자체가 결함이 있다는 점입니다.

결론

그렇다면 AMALIA는 쓸모없는 것일까요? 전혀 아닙니다! 논문은 AMALIA가 **스크리닝(선별)**과 **예비 코딩(pre-coding)**에는 탁월하다고 말합니다. 방대한 양의 텍스트를 읽고 "이것 좀 보세요, 흥미로워 보이니 인간이 살펴봐야 합니다"라고 말해줄 수 있습니다. 즉, 훌륭한 첫 번째 필터 역할을 할 수 있습니다.

하지만 스스로 "권위"와 같은 복잡한 개념을 측정할 수 있을까요? 아니요. 아직은 아닙니다.
논문은 국가 로봇이 우리 시민들의 생각과 가치를 측정하도록 신뢰하기 전에, 우리는 다른 질문을 던져야 한다고 결론짓습니다. 단순히 "인간과 의견이 일치하는가?"라고 물을 것이 아니라, **"너의 풀이 과정을 보여줄 수 있는가?"**라고 물어야 합니다.

AMALIA(혹은 그 어떤 소규모 국가 모델)가 표면적인 단서에 기반해 추측하는 것이 아니라, 올바른 논리를 사용하고 있다는 것을 증명하기 위해 자신의 풀이 과정을 보여줄 수 있을 때까지, 이 로봇은 최종 판결을 내릴 준비가 되지 않았습니다. 논문은 현재로서는 AMALIA가 유능한 조수일 수는 있지만, 데이터의 주인(boss)은 될 수 없다고 제언합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →