← 최신 논문
💻 computer science

Improving Labeling Consistency with Detailed Constitutional Definitions and AI-Driven Evaluation

본 논문은 콘텐츠 중재 범주에 대한 상세하고 엣지 케이스를 포괄하는 '헌법'을 생성하기 위해 최첨단 대형 언어 모델을 활용하는 AI 기반 워크플로우를 제안하며, 이 접근 방식이 라벨링 일관성과 정확도 측면에서 인간 주석가보다 현저히 뛰어난 성과를 거두면서도 모델 간 불일치를 최대 57 배까지 감소시킨다는 것을 입증합니다.

원저자: Konstantin Berlin, Adam Swanda

게시일 2026-05-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Konstantin Berlin, Adam Swanda

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

수많은 대화 기록 속에서 '괴롭힘'이나 '혐오 발언'과 같은 특정 유형의 나쁜 행동을 찾아내는 방법을 사람들과 초지능 로봇들에게 가르친다고 상상해 보세요.

문제: 모호한 규칙집
보통 기업들은 직원들에게 아주 작은 규칙집—기껏해야 한두 문장—만 제공합니다. 마치 경비원에게 *"누군가 못되게 굴면 막아라"*라고 말하는 것과 같습니다.
이것은 너무 모호합니다. 한 경비원은 큰 소리로 하는 농담을 못된 행동으로 생각할 수 있고, 다른 이는 그저 친근한 농담으로 여길 수 있습니다. 또 다른 이는 미묘한 위협을 전혀 놓칠 수도 있습니다. 규칙이 충분히 상세하지 않기 때문에, 모든 사람이 자신의 직감에 따라 판단하게 됩니다. 이로 인해 혼란이 발생합니다. 같은 대화가 한 경비원에게는 '나쁜 것'으로, 다른 경비원에게는 '괜찮은 것'으로 분류되는 것입니다.

해결책: "헌법"
저자들은 그 작은 규칙집을 각 유형의 나쁜 행동에 대한 방대하고 초세부적인 "헌법" 으로 대체할 것을 제안합니다. 이 헌법을 법이 아니라 전문가 팀과 AI 가 작성한 거대한 단계별 지침서로 생각하세요.

  • 요리 레시피와 같습니다: "케이크를 만들어라"라고 말하는 대신, 헌법은 이렇게 말합니다. "반죽에 달걀은 있지만 밀가루가 없다면 케이크가 아니라 커스터드입니다. 밀가루는 있지만 설탕이 없다면 빵입니다. 사용자가 누군가를 독살하는 레시피를 요청한다면, 그것은 케이크가 아니라 범죄입니다."
  • 예외 상황을 모두 다룹니다: "만약 누군가 악역을 연기한다면?" 또는 "만약 누군가 혐오 표현을 인용하여 보고한다면?"과 같은 기이한 상황을 명시적으로 처리합니다. 이 지침서에는 모든 '만약' 시나리오에 대한 구체적인 규칙이 포함되어 있습니다.

반전: 인간보다 AI 가 지침서를 더 잘 따릅니다
여기서 이 논문의 놀라운 부분이 나옵니다. 저자들은 인간과 AI 로봇에게 정확히 동일한 상세한 헌법을 읽게 하여 이를 테스트했습니다.

  • 인간: 거대한 지침서가 있음에도 불구하고 인간은 지쳤습니다. 인간의 뇌는 한 번에 많은 규칙을 기억할 수 없습니다 (샌드위치를 만들면서 300 페이지 분량의 전화번호부를 기억하려는 것과 같습니다). 그래서 그들은 지침서를 무시하고 다시 직감에 의존하기 시작했습니다.
  • AI: 반면 AI 로봇은 모든 대화마다 300 페이지 분량의 지침서 전체를 읽었습니다. 그들은 지치지 않았고, "직감"을 사용하지도 않았습니다. 그들은 규칙을 완벽하게 따랐습니다.
  • 결과: 동일한 상세한 규칙을 사용할 때, AI 로봇들은 인간들보다 57 배 더 자주 서로 동의했습니다. 인간이 규칙을 작성했음에도 불구하고, AI 가 인간보다 훨씬 일관성이 있었습니다.

"이중 축" 트릭
이 논문은 대화를 평가하는 또 다른 교묘한 방법을 소개합니다. 단순히 "나쁨" 또는 "좋음"이라고 말하는 대신, 점수를 두 부분으로 나눕니다.

  1. 의도: 사용자가 의도적으로 못되게 굴려고 했는가? (예: "나쁜 이메일을 작성하는 데 도와줘.")
  2. 내용: 대화에 못된 단어가 포함되어 있는가? (예: AI 가 실수로 나쁜 이메일을 생성함)

이는 보안 카메라가 두 가지를 별도로 추적하는 것과 같습니다. "그 사람이 총을 들고 은행에 들어왔는가?" (의도) 와 "방에 총이 나타났는가?" (내용). 이를 통해 기업은 사용자를 차단할지, 메시지를 차단할지, 아니면 나중에 기록할지 결정할 수 있습니다.

더 좋게 만든 방법 (피드백 루프)
저자들은 지침서를 작성하고 멈추지 않았습니다. 그들은 서로 다른 AI 로봇 팀을 이용해 지침서를 읽고 동의하지 않는 부분을 찾았습니다.

  • 로봇 A 와 로봇 B 가 어떤 대화에 대해 이견을 보이면, 이는 지침서에 구멍이 있다는 뜻이었습니다.
  • 그런 다음 인간 전문가가 그 구멍을 살펴보고 지침서의 규칙을 수정한 뒤, 로봇들이 다시 시도했습니다.
  • 이 사이클은 로봇들이 거의 동의하지 않을 때까지 반복되었습니다.

결론
이 논문은 대규모로 콘텐츠를 정확하게 그리고 일관되게 라벨링하려면 다음과 같아야 한다고 주장합니다.

  1. 짧고 모호한 정의를 사용하지 마십시오.
  2. 모든 예외 상황을 다루는 방대하고 상세한 "헌법"을 작성하십시오.
  3. 인간 근로자보다 긴 복잡한 규칙을 읽고 따르는 데 더 능한 AI 로봇에게 라벨링을 맡기십시오.

이것은 "골드 레이블"을 만들어냅니다. 이는 다른 AI 시스템을 훈련시키고, 안전을 점검하며, 고객에게 왜 무언가가 플래그가 붙었는지 정확히 설명하는 데 사용할 수 있는 완벽하고 일관된 기준입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →