← 최신 논문
🤖 AI

Safety is Contextual, LLM-Judges Are Not: Navigating the Rigid Priors of Evaluators

이 논문은 안전성 평가에서 판사로서의 LLM(LLMs-as-judges)이 갖는 한계를 조사하며, 이들이 새로운 문맥으로부터 학습할 수는 있지만, 모순되는 정보나 정의에 적응하기보다는 내부의 안전성 우선순위(safety priors)를 엄격하게 고수하는 경향이 있음을 밝히고 있다.

원저자: Anissa Alloula, Federico Licini, Ava Batchkala, Seraphina Goldfarb-Tarrant

게시일 2026-06-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Anissa Alloula, Federico Licini, Ava Batchkala, Seraphina Goldfarb-Tarrant

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대한 스포츠 토너먼트를 관찰하며 어떤 플레이가 "공정"하고 어떤 플레이가 "반칙"인지 결정하기 위해 매우 똑똑한 심판들(이들은 AI 모델, 즉 "LLM 심판"입니다)을 고용했다고 상상해 보십시오.

문제는 게임의 규칙이 어디에서 경기를 하느냐에 따라 달라진다는 점입니다. 어떤 나라에서는 특정 동작이 반칙이지만, 다른 나라에서는 그것이 멋진 플레이가 되기도 합니다. 또한 새로운 속어나 새로운 유형의 기술들이 매일같이 발명됩니다.

이 논문은 단순하지만 무서운 질문을 던집니다: 이 AI 심판들은 당신이 준 규칙을 실제로 따르고 있는 걸까요, 아니면 그저 자신들의 오래된 내부 규칙 책을 따르고 있는 걸까요?

저자들은 심판들이 놀라울 정도로 고집스럽다는 것을 발견했습니다. 다음은 쉬운 비유를 통한 분석입니다:

1. "고집 센 심판" 문제 (제어 가능성)

보통 심판을 고용하면 규칙 책을 줍니다. 당신은 "손으로 공을 만지면 반칙이다"라고 말합니다.

  • 논문이 발견한 것: 당신이 AI 앞에 명시적으로 새로운 규칙 책을 써주더라도, AI는 종종 당신을 무시합니다. AI는 자신이 학교를 다닐 때(학습 단계) 배웠던 "안전 규칙"에 근거하여 계속 판단을 내립니다.
  • 비유: 당신이 축구를 하며 자란 심판을 고용했다고 상상해 보십시오. 당신은 그에게 "오늘은 농구를 할 것이니 손을 사용하는 것은 괜찮지만, 공을 차는 것은 반칙이다"라고 말합니다. 그러면 심판은 여전히 손을 사용하는 것에 대해 휘슬을 불 것입니다. 왜냐하면 마음 깊은 곳에서 *"아니, 그건 반칙이야! 난 축구에서 그렇게 배웠어!"*라고 생각하기 때문입니다.
  • 반전: 논문은 만약 당신이 심판을 속여서, "이것을 '안전'이나 '위험'이라고 부르는 대신 그냥 '카테고리 A' 또는 '카테고리 B'라고 부르자"라고 말한다면, 심판이 당신의 새로운 규칙을 훨씬 더 잘 따르게 된다는 것을 발견했습니다. 마치 심판이 "안전"이나 "규칙"이라는 단어를 사용할 때만 자신의 예전 학습 내용이 유발되어 혼란을 겪는 것 같습니다.

2. "주의력이 산만한 학생" 문제 (민감성)

때때로 당신은 경기가 시작되기 직전 심판에게 요점 정리 노트나 몇 가지 예시를 줍니다.

  • 논문이 발견한 것:
    • 오래된 기술: 만약 당신이 심판에게 "반칙"의 예시들을 준다면, 그들은 그것들을 대부분 무시합니다. 그들은 이미 알고 있는 것에 집착합니다.
    • 새로운 지식: 하지만 만약 당신이 그들이 아직 모르는 무언가(예: 새로운 속어나 내년의 뉴스 사건)에 대한 정보를 준다면, 그들은 그것을 따를 것입니다.
  • 비유: 학생이 시험을 치르고 있다고 상상해 보십시오.
    • 만약 당신이 "답은 항상 42라는 걸 기억해"라고 속삭인다면, 학생이 이미 답이 42라는 것을 알고 있다면 학생은 당신의 말을 무시할 것입니다.
    • 하지만 만약 당신이 "새로운 행성에 관한 이 질문의 답은 42야"라고 속삭인다면, 학생이 그 행성에 대해 들어본 적이 없다면 학생은 당신의 말을 믿을 것입니다.
    • 함정: 심판은 오직 자신이 주제에 대해 확신이 없을 때만 새로운 정보에 귀를 기울입니다. 만약 그들이 기존 지식에 대해 자신감이 있다면, 설령 당신이 옳더라도 당신의 새로운 지침을 무시할 것입니다.

3. "일률적 적용"의 신화

이 논문은 13개의 서로 다른 AI 심판을 테스트했습니다. 연구 결과는 다음과 같습니다:

  • "좋은" 심판(표준 테스트에서 높은 점수를 받는 것)이 된다고 해서 반드시 "유연한" 것은 아닙니다.
  • "유연함"(새로운 규칙을 따르는 것)이 곧 "정확함"을 의미하는 것도 아닙니다.
  • 어떤 심판은 본질적으로 고집스럽고, 어떤 심파는 본질적으로 암시에 취약합니다. 모든 작업에 적합한 단 하나의 "최고의" 심판은 존재하지 않습니다.

핵심 결론

저자들은 안전은 맥락적(contextual)이지만, AI 심판는 경직되어 있다고 결론짓습니다.

만약 당신이 특정 문화나 특정 새로운 상황에 대해 콘텐츠가 안전한지 확인하기 위해 AI를 사용하려는 기업이라면, AI가 당신의 지침을 따를 것이라고 단순히 가정해서는 안 됩니다. AI는 아마도 당신의 회사 정책과는 완전히 다를 수 있는, 자신만의 내재된 "직관"에 근거하여 판단하고 있을 가능성이 높습니다.

요약하자면: 당신은 단순히 AI에게 "이 규칙을 따라라"라고 말할 수 없습니다. 당신은 AI가 완전히 다른 게임을 하고 있다고 믿게끔 속이지 않는 한, 바꾸기 매우 어려운 깊이 박힌 습관을 가지고 있다는 점을 이해해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →