← 최신 논문
🤖 AI

To Redact, or not to Redact? A Local LLM Approach to Deliberative Process Privilege Classification

본 논문은 연쇄 사고와 오류 기반 퓨샷 프롬프팅을 강화한 로컬 소비자급 LLM(Qwen3.5 9B) 이 FOIA 면제 5 호인 심의 과정 특권을 상업적 모델과 견줄 만한 성능으로 효과적으로 분류할 수 있음을 입증하며, 이는 클라우드 기반 API 에 대한 법적·정치적으로 실행 가능한 대안을 제시한다.

원저자: Maik Larooij, David Graus

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Maik Larooij, David Graus

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

정부가 수백만 건의 문서로 가득 찬 거대하고 먼지 낀 도서관을 보유하고 있다고 상상해 보세요. 법에 따라 시민들은 정부가 무엇을 하고 있는지 보기 위해 이 도서관 안을 엿볼 권리가 있습니다. 그러나 일부 페이지에는 개인 주소, 국가 안보 계획, 또는 최종 결정이 내려지기 전에 이루어진 사적인 논쟁과 같은 비밀이 포함되어 있습니다.

정부의 역할은 모든 페이지를 하나씩 검토하여 비밀 부분을 찾아 검은 마커로 가리는 (이를 '검은 처리'라고 합니다) 서고 관리인처럼 행동한 후 그 책을 대중에게 전달하는 것입니다. 이를 수동으로 수행하는 것은 느리고 지루하며 실수가 발생하기 쉽습니다. 만약 서고 관리인이 비밀을 놓치면 큰 문제가 되며, 너무 많이 가리면 공개되어야 할 것들을 숨기게 됩니다.

이 논문은 특히 '의사결정 과정 특권'이라는 까다로운 유형의 비밀을 처리하기 위해 서고 관리인이 이 일을 더 빠르고 정확하게 수행하도록 돕는 스마트 로봇 보조원을 구축하는 것에 관한 것입니다. 이는 공무원들이 결정이 내려지기 전에 대중의 반발에 대한 두려움 없이 자유롭게 의견을 교환할 수 있도록, 정부의 내부 브레인스토밍(지저분한 초안, '만약에'라는 아이디어, 사적인 의견 등) 을 보호하는 규칙입니다.

다음은 저자들이 이 로봇을 구축하기 위해 시도한 방법들입니다:

1. '클라우드' 로봇의 문제점

대부분의 사람들은 데이터 센터에 있는 거대한 뇌와 같은 초지능 클라우드 기반 AI 를 사용하여 이 일을 수행할 것이라고 생각합니다. 하지만 저자들은 "잠깐만요!"라고 말합니다. 정부가 비밀 문서를 읽는다면, 그 페이지들을 제 3 의 클라우드 회사로 전송할 수 없습니다. 이는 조언을 구하기 위해 최상위 비밀 일기를 낯선 사람에게 우편으로 보내는 것과 같습니다. 이는 법적으로나 정치적으로나 위험합니다.

따라서 저자들은 로컬 로봇을 구축하기로 결정했습니다. 그들은 정부의 자체 보안 건물 내부의 일반 컴퓨터에서 실행될 수 있는 더 작고 오픈소스 AI 모델 (Qwen3.5 9B) 을 사용했습니다. 이는 전화로 낯선 사람을 부르는 것이 아니라 방 안에 개인 과외 선생님을 두는 것과 같습니다.

2. 로봇 가르치기: '사용 설명서'

저자들은 로봇에게 단순히 "이 문장이 비밀인가요?"라고 물지 않았습니다. 대신 어떤 방법이 가장 효과적인지 보기 위해 로봇과 대화하는 여덟 가지 다른 방식을 시도했습니다. 이것들을 서로 다른 교수법으로 생각하세요:

  • Zero-Shot (제로 샷): 질문을 직접 던지는 것입니다. "이것은 비밀인가요?" (로봇은 기존 지식을 바탕으로 추측해야 합니다).
  • Few-Shot (퓨 샷): 질문을 던지기 전에 비밀 예시 다섯 개와 비비밀 예시 다섯 개를 로봇에게 보여주는 것입니다. "여기 몇 가지 예시가 있으니 이제 당신이 해보세요."
  • Error-Based Few-Shot (오류 기반 퓨 샷): 로봇이 이전에 실수했던 어려운 사례들을 예시로 보여 주어, 실수에서 배울 수 있도록 하는 것입니다.
  • Chain-of-Thought (CoT, 사고의 사슬): 답변하기 전에 로봇에게 "소리 내어 생각해보라"고 요청하는 것입니다. 단순히 "예"라고 말하는 대신, 로봇은 먼저 "아직 최종 결정이 내려졌는가? 이것이 단지 의견인가?"라고 스스로에게 물은 다음 답변해야 합니다.
  • Multi-Agent (다중 에이전트): 세 대의 로봇 팀을 구성하는 것입니다. 한 로봇이 추측하고, 두 번째 로봇이 그 추측을 비판하며, 세 번째 로봇이 의견이 다를 경우 심판 역할을 합니다.

3. 결과: 누가 경주에서 이겼나?

저자들은 이러한 방법들을 기존 전통적인 컴퓨터 프로그램과 유명한 상용 AI(Gemini 2.5 Flash) 와 비교하여 테스트했습니다.

  • "소리 내어 생각하기" 전략이 승리했습니다: 로컬 로봇에게 가장 좋은 방법은 Chain-of-Thought(로봇이 자신의 추론을 설명하게 함) 와 Error-Based Few-Shot(이전에 저지른 어려운 실수들을 보여줌) 을 결합한 것이었습니다.
  • 목표: 이 특정 업무에서는 "과도하게 조심하는 것"이 더 낫습니다. 로봇이 비밀을 놓치면 (거짓 음성), 민감한 정보가 유출됩니다. 너무 많이 가리면 (거짓 양성), 성가실 뿐이지만 안전합니다. 저자들은 로봇이 모든 것을 잡아내기를 원했습니다 (높은 '재현율').
  • 놀라운 사실: 이 특별한 "소리 내어 생각하기" 방법을 사용한 로컬 로봇은 거대한 상용 클라우드 AI 와 거의同等한 성능을 발휘했습니다. 이는 정부가 비밀을 클라우드로 전송하지 않고도 강력한 AI 를 사용할 수 있음을 의미하므로 매우 중요한 소식입니다.

4. 무엇이 문장을 "비밀"로 만드는가?

저자들은 로봇이 왜 특정 문장들을 비밀로 판단했는지도 살펴보았습니다. 그들은 '의사결정' 문장들 (검은 처리가 필요한 것들) 이 특정 '지문'을 가지고 있음을 발견했습니다:

  • 의견처럼 들립니다: "제 생각에는", "우리는 제안합니다", "우리는 ~할 수 있습니다", 또는 "좋을 것입니다"와 같은 단어를 사용합니다.
  • 1 인칭 대명사를 사용합니다: "나", "우리", "우리"가 많이 등장합니다.
  • 미래를 바라봅니다: 이미 일어난 일이 아니라 어떻게 될지에 대해 이야기합니다.

만약 문장이 단순한 사실 ("회의는 오후 2 시에 열렸습니다") 이라면 로봇은 그것을 그대로 두기로 합니다. 만약 사적인 의견 ("그를 해고해야 한다고 생각합니다") 이라면 로봇은 그것을 가리기로 합니다.

결론

이 논문은 정부가 민감한 문서를 검은 처리하는 데 거대하고 비싼 클라우드 기반 슈퍼컴퓨터가 필요하지 않다고 결론 내립니다. 과거의 실수에서 배우고 "단계별로 생각하도록" 가르친다면, 더 작고 로컬에 있는 AI 도 대기업들만큼이나 거의 똑같은 일을 해낼 수 있습니다. 이를 통해 정부는 자신의 컴퓨터에서 데이터를 안전하게 유지하면서도 현대적인 AI 를 사용하여 대중과 정보를 공유하는 과정을 가속화할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →