← 최신 논문
💬 NLP

Who judges the judges? Governance from metrics: a runtime framework for continuous LLM compliance monitoring

본 논문은 EU 인공지능법 하에서 LLM 의 지속적인 규정 준수 모니터링을 가능하게 하기 위해 규제 심판자 역할을 수행하는 전문 소형 언어 모델 패널을 활용하여 실시간 규정 준수 신호를 생성하고 불확실성을 표시하여 인간의 중재를 유도하는 "거버넌스 프롬 메트릭스"를 구현하는 오픈소스 프레임워크인 "govllm"을 소개합니다.

원저자: Jehanne Dussert

게시일 2026-05-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jehanne Dussert

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 "Governance from metrics: a runtime framework for continuous LLM compliance monitoring"(govllm) 논문에 대한 설명을 일상적인 언어와 비유로 번역한 것입니다.

큰 문제: "준수 허상"

자동차를 산다고 상상해 보세요. 주차장을 떠나기 전에 정비사가 한 번 점검하고 "이 차는 안전합니다"라고 말합니다. 당신은 서류에 서명하고 차를 몰고 나갑니다.

이 논문은 현재의 AI 시스템이 바로 그런 자동차처럼 취급받고 있다고 주장합니다. 개발자들은 한 번 테스트를 실행한 후 AI 가 법률 (예: EU AI 법) 을 준수한다고 선언한 뒤, 이를 실제 세계에 풀어놓습니다. 저자들은 이를 **"준수 허상"**이라고 부릅니다.

현실: AI 는 정적인 자동차가 아닙니다. 오히려 반려동물과 더 비슷합니다. AI 는 배우고, 변하며, 대우하는 방식에 반응합니다. 화요일에 "안전"했다고 해서 금요일에 사용자가 속이거나 이상한 질문을 했을 때 불법적이거나 위험한 말을 하지 않는다는 보장은 없습니다. 논문은 준수를 일회성 도장으로 취급하는 것을 멈추고, 지속적인 심박수 모니터로 취급해야 한다고 말합니다.

해결책: govllm ("거버넌스 대시보드")

저자들은 govllm이라는 오픈소스 도구를 개발했습니다. 이는 AI 시스템 내부에 설치되어 AI 가 실시간으로 말하는 모든 것을 감시하는 대시보드라고 생각하면 됩니다.

연례 감사를 기다리는 대신, govllm 은 AI 가 내는 모든 답변을 그 자리에서 즉시 확인하여 규칙을 위반하는지 점검합니다.

작동 방식: "판사 패널"

법정에서 복잡한 사건을 결정할 때 한 명의 판사만 믿지 않습니다. 배심원이 있죠. govllm 도 마찬가지입니다.

  1. 전문 판사: 모든 것을 한 AI 가 확인하는 대신, 시스템은 더 작고 전문화된 AI 모델들의 패널을 사용합니다.

    • 한 AI 는 개인정보 보호 전문가 (개인정보 유출 여부 확인) 입니다.
    • 한 AI 는 경비원 (시스템 해킹 시도 여부 확인) 입니다.
    • 한 AI 는 접근성 담당관 (언어가 명확하고 공정한지 확인) 입니다.
    • 한 AI 는 투명성 감사관 (AI 가 인간이라고 거짓말하는지 확인) 입니다.
  2. "프로파일 - 배심원" 개념: 각 특정 작업 (예: 의료 요약 작성 vs 은행 보고서 요약) 에 대해 시스템은 해당 작업에 필요한 특정 "배심원"을 선택합니다. 모든 것에通用的인 판사를 사용하지 않습니다.

  3. "불확실성 신호": 이것이 핵심 혁신입니다. 보통 두 명의 판사가 이견을 보이면, 우리는 한 명이 틀렸다고 가정하고 다수결을 따릅니다.

    • govllm 의 반전: 전문화된 판사들이 이견을 보이면, 시스템은 그 이견을 경고 신호로 간주합니다. "이봐, 여기 규칙이 모호하네. 우리 인간이 나서서 결정해야 해"라고 말합니다. 혼란을 숨기려 하지 않고, 혼란을 인간 감독을 요청하는 신호로 바꿉니다.

실험: 판사들 테스트하기

저자들은 이 시스템을 17 억 개에서 70 억 개 파라미터까지 다양한 네 개의 작은 오픈소스 AI 모델을 사용하여 테스트했습니다. 이 모델들은 일반 노트북에서 완전히 실행되었습니다. 거대한 클라우드 서버를 사용하지 않았습니다. 로컬과 프라이버시 환경에서도 작동할 수 있음을 증명하고 싶었습니다.

그들은 다섯 가지 주요 법률 분야를 다루는 49 개의 까다로운 질문과 답변 (AI 를 위한 운전 면허 시험과 같은) 으로 구성된 "테스트 은행"을 만들었습니다.

주요 발견 사항:

  • 크기는 중요하지 않음: 가장 큰 AI(70 억 파라미터) 가 실제로는 가장 나쁜 판사였습니다. 작고 전문화된 모델들이 종종 더 좋은 성과를 냈습니다. 일반적인 의미에서 "똑똑한" 것이 구체적인 법률 규칙을 따르는 데 능숙하다는 보장은 없었습니다.
  • "순서" 함정: 판사들은 질문이 어떻게 제시되는지에 놀라울 정도로 민감했습니다. 질문 순서를 섞으면 일부 판사의 점수가 25% 떨어졌습니다. 이는 작은 AI 모델들이 프롬프트 구조에 의해 쉽게 혼란을 겪을 수 있음을 보여줍니다.
  • 완벽한 판사는 없음: 단일 AI 모델이 모든 것을 완벽하게 수행한 경우는 없었습니다. 어떤 모델은 개인정보 유출을 찾아내는 데 뛰어나지만 조작을 찾아내는 데는 형편없었습니다. 이는 "판사 패널" 접근 방식이 필수적임을 증명했습니다. 어떤 한 AI 가 모든 일을 할 수 없기 때문입니다.
  • "유창하지만 틀린" 문제: 한 판사 (Mistral) 는 매우 일관성 있게 답변에 대한 명확한 이유를 제시했지만, 그 내용은 일관되게 틀렸습니다. 잘못된 결론에 대해 유창하게 논쟁했습니다. 이는 AI 가 자신감 있게 들린다고 해서 단순히 신뢰할 수 없음을 강조합니다.

"준수 게이트"

시스템에는 준수 게이트라는 안전 스위치가 포함되어 있습니다.

  • 클럽의 바운서를 상상해 보세요. AI 모델의 점수가 특정 선 아래로 떨어지면 (예: 개인정보 유출이 너무 자주 발생함), 게이트가 자동으로 닫힙니다.
  • 시스템은 해당 모델로 사용자의 요청을 보내는 것을 중단하고 인간이 수정할 때까지 "격리" 상태로 둡니다. 인간이 문제를 발견할 때까지 기다리는 것이 아니라 자동으로 발생합니다.

"온프레미스"가 중요한 이유

저자들은 이 전체 시스템이 클라우드가 아닌 로컬(회사의 자체 컴퓨터) 에서 실행되어야 한다고 주장합니다.

  • 비유: 은행이 자신의 보안을 점검할 때, "보안 점검"을 받기 위해 비밀 고객 데이터를 제 3 자 클라우드 서비스에 보내고 싶지 않습니다. 그 자체로 보안 위험이 되기 때문입니다.
  • govllm 은 데이터가 건물을 떠나는 일이 없도록 보장하여 GDPR 과 같은 엄격한 개인정보 보호법과 주권 요구 사항을 충족시킵니다.

결론

이 논문은 AI 를 한 번 "감사"하고 잊어버려서는 안 된다고 주장합니다. 우리는 다음과 같은 시스템이 필요합니다.

  1. AI 가 작동하는 동안 24 시간 내내 AI 를 감시합니다.
  2. 거대하고 일반적인 하나의 AI 가 아닌, 전문화된 작은 AI 판사 팀을 사용합니다.
  3. 판사 간의 이견을 무시할 결함으로 취급하지 않고 인간을 호출해야 하는 신호로 간주합니다.
  4. 규칙을 위반하기 시작하는 모델을 자동으로 중단시킵니다.

이는 "이 AI 가 합법적인가?"(한 번만 묻는 예/아니오 질문) 에서 "이 AI 가 지금 이 순간 합법적으로 행동하고 있는가?"(지속적인 신호) 로의 전환입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →