← 최신 논문
💬 NLP

Prompt Stability Scoring for Text Annotation with Large Language Models

본 논문은 전통적인 신뢰도 지표를 안정성 문제 진단에 적용하고 실용적 구현을 위한 파이썬 패키지를 포함하는 프롬프트 안정성 점수 (PSS) 라는 일반적 프레임워크를 제안함으로써 대규모 언어 모델 텍스트 주석의 프롬프트 변이에 대한 취약성을 다룬다.

원저자: Christopher Barrie, Elli Palaiologou, Petter Törnberg

게시일 2026-05-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Christopher Barrie, Elli Palaiologou, Petter Törnberg

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 쉬운 언어와 일상적인 비유를 사용하여 설명합니다.

핵심 아이디어: 당신의 AI 는 "변덕스러운"가요?

매우 똑똑하지만 약간 신경질적인 조수를 고용하여 "예"와 "아니오" 봉투로 편지 더미를 분류하도록 시킨다고 상상해 보세요. 당신은 그들에게 구체적인 지시를 내립니다. "편지에 돈에 대한 언급이 있으면 '예' 더미에 넣으세요."

그들에게 이 작업을 30 번 반복하라고 요청합니다.

  • 시나리오 A: 그들은 매번 동일한 편지를 동일한 더미에 넣습니다.
  • 시나리오 B: 1 회 시도에서는 "저축"에 대한 편지를 "예" 더미에 넣습니다. 2 회 시도에서는 동일한 편지를 "아니오" 더미에 넣습니다. 3 회 시도에서는 다시 "예"에 넣습니다.

조수가 대개 정확하다 하더라도 시나리오 B는 문제입니다. 이는 그들의 의사결정이 불안정하다는 뜻입니다. 동일한 지시사항에 대해 일관되게 행동할 수 없다면, 문구를 약간만 변경했을 때 (예: "편지에 현금에 대한 언급이 있으면...") 신뢰할 수 없습니다.

이 논문은 실제 작업을 수행하기 전에 AI 조수가 안정적인지 (시나리오 A) 아니면 변덕스러운지 (시나리오 B) 확인하기 위한 테스트를 구축하는 것에 관한 것입니다.


문제: AI 는 "말의 샐러드"에 민감합니다

저자들은 대규모 언어 모델 (AI) 이 계산기처럼 작동하지 않는다고 설명합니다. 그들은 책에서 고정된 답을 찾아보지 않습니다. 대신, 사람이 문장에서 다음에 무엇이 올지 추측하듯 한 단어씩 다음 단어를 예측합니다.

이로 인해 두 가지 요인이 그들의 일관성을 해칠 수 있습니다.

  1. "동일한 프롬프트" 문제: 동일한 지시를 두 번 입력하더라도, AI 의 컴퓨터 뇌 내부에 있는 눈에 보이지 않는 작은 무작위 요인 (배경에서 일어나는 동전 던지기 같은 것) 으로 인해 AI 는 약간 다른 답을 줄 수 있습니다.
  2. "재구성" 문제: 지시를 조금만 변경해도 (예: "이것을 분류하세요" 대신 "이것을 정렬하세요"라고 말함) AI 는 혼란을 겪고 완전히 다른 답을 줄 수 있습니다.

이 논문은 정확성만으로는 부족하다고 주장합니다. AI 가 90% 의 확률로 정답을 맞출지라도, 프롬프트를 조금만 수정할 때마다 답을 번복한다면 연구 결과는 신뢰할 수 없습니다.

해결책: "프롬프트 안정성 점수" (PSS)

저자들은 AI 지시에 대한 스트레스 테스트 역할을 하는 도구 (Python 패키지인 promptstability 라고 함) 를 개발했습니다.

다리를 테스트하는 것과 같다고 생각하세요:

  • 프롬프트 내부 안정성 (The "Repetition" Test): 동일한 데이터에 정확히 동일한 지시를 30 번 실행합니다. 도구는 확인합니다: AI 가 매번 동일한 답을 주었는가? 답이 오락가락한다면 다리는 불안정합니다.
  • 프롬프트 간 안정성 (The "Rephrasing" Test): 지시를 가져와 다른 AI 에게 10 가지 다른 방식으로 다시 쓰게 합니다 (예: "이것들을 정렬하세요", "이것들을 범주화하세요", "이것들에 라벨을 붙이세요"). 그런 다음 모든 10 가지 버전을 동일한 데이터에 실행합니다. 도구는 확인합니다: 단어가 변했음에도 불구하고 AI 가 여전히 자기 자신과 일치하는가?

이 도구는 점수를 제공합니다 (이는 단순히 "일치 점수"를 의미하는 크립도르프의 알파라고 불리는 것입니다).

  • 높은 점수 (1.0 에 가까움): 훌륭합니다! 당신의 지시는 견고합니다. AI 는 일관적입니다.
  • 낮은 점수 (0.8 미만): 경고! 당신의 지시는 너무 취약합니다. 문장의 미세한 변화만으로도 시스템이 무너집니다.

그들이 발견한 것 (스트레스 테스트 결과)

연구자들은 미국 정치 트윗, 영국 정당 강령, 뉴스 기사 등 여섯 가지 다른 실제 데이터셋에서 이를 테스트했습니다. 그들이 발견한 바는 다음과 같습니다.

  1. 단순함은 안정적입니다: 작업이 쉽고 데이터가 명확할 때 (예: 트윗이 공화당인지 민주당인지 식별하기), AI 는 매우 안정적이었습니다. 프롬프트를 재구성하더라도 동일한 답을 주었습니다.
  2. 복잡함은 취약합니다: 작업이 어렵거나 데이터가 엉망일 때 (예: 트윗이 "포퓰리즘" 언어를 사용하는지 결정하거나, 12 개의 매우 유사한 범주로 설문 답변을 분류하기), AI 는 불안정해졌습니다. 프롬프트의 작은 변화가 AI 로 하여금 오락가락하게 만들었습니다.
  3. "형식" 함정: 때때로 AI 는 실제로 혼란을 겪은 것이 아니라 형식 규칙 (예: 숫자 대신 단락 작성) 을 따르는 것을 잊었을 뿐입니다. 연구자들이 이러한 "대충 처리된" 답변을 필터링했을 때 안정성 점수가 상승했습니다. 이는 때때로 문제가 AI 의 뇌가 아니라 엄격한 형식 규칙을 따르지 못하는 능력에 있다는 것을 가르쳐 주었습니다.
  4. 모델이 중요합니다: 그들은 강력한 AI(GPT-4) 와 작은 오픈소스 모델을 비교했습니다. 강력한 모델이 훨씬 더 안정적이었습니다. 이는 "변덕스러움"이 항상 당신의 잘못이 아니라는 것을 의미합니다. 때로는 더 똑똑한 AI 가 필요할 뿐입니다.

"플레이북": 당신은 무엇을 해야 합니까?

이 논문은 연구자들을 위한 간단한 가이드를 제공합니다.

  • 1 단계: 안정성 테스트 실행. 결과를 검증하기 위해 시간이나 돈을 들이기 전에 promptstability 도구를 실행하세요.
  • 2 단계: 점수 확인.
    • 점수가 높다면: 진행해도 좋습니다. 당신의 파이프라인은 견고합니다.
    • 점수가 낮다면: 멈추세요! 아직 결과를 신뢰하지 마세요.
  • 3 단계: 문제 해결.
    • AI 가 형식을 무시하고 있습니까? 지시를 더 엄격하게 수정하세요.
    • 작업이 너무 모호합니까? 지시를 더 명확하게 하세요.
    • 데이터가 너무 엉망입니까? 아마도 이 특정 작업은 AI 가 일관되게 처리하기에는 너무 어려울 것입니다.
    • AI 가 너무 약합니까? 더 강력한 모델을 시도해 보세요.

결론

AI 가 답을 주었다고 해서 그 답이 신뢰할 수 있다고 가정할 수 없습니다. 이 논문은 AI 가 무작위로 추측하거나 질문을 어떻게 표현하느냐에 대해 너무 민감하게 반응하지 않도록 보장하는 체크리스트를 제공합니다.

안정성은 신뢰의 기초입니다. 같은 질문을 약간 다른 방식으로 물었을 때 AI 가 자기 자신과 동의할 수 없다면, 연구에 제공하는 결과를 신뢰할 수 없습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →