← 최신 논문
💬 NLP

Choosing Where and How to Moderate: End-to-End Trade-offs in Filter Placement and Response Rewriting

이 논문은 필터 배치 전략(입력, 응답 또는 결합)과 응답 재작성 기술을 비교함으로써 콘텐츠 모더레이션의 엔드 투 엔드 트레이드오프를 평가하며, 응답 전용 차단이 유용성을 극대화하는 반면 결합 차단은 유해 노출을 최소화한다는 점과 재작성이 해를 끼치지 않으면서 차단된 트래픽을 복구할 수 있음을 입증한다.

원저자: Mengya Hu, Susie Park, Suzana Ilic, Qiong Wei, Sandeep Atluri, Myra Deng, Tucker Fross, Curt Tigges

게시일 2026-07-30
📖 5 분 읽기🧠 심층 분석

원저자: Mengya Hu, Susie Park, Suzana Ilic, Qiong Wei, Sandeep Atluri, Myra Deng, Tucker Fross, Curt Tigges

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매초 수백만 개의 이야기를 인쇄하는 거대하고 혼란스러운 신문의 편집자라고 상상해 보십시오. 어떤 이야기는 훌륭하고, 재미있고, 도움이 됩니다. 다른 이야기들은 위험하거나, 못됐거나, 혹은 그냥 말도 안 되는 소리일 수도 있습니다. 당신의 임무는 독자에게 전달되는 최종 인쇄물이 안전하고 유용하도록 만드는 것입니다. 하지만 여기 까다로운 문제가 있습니다. 바로 "안전 가드(Safety Guards)"(컴퓨터 프로그램) 팀이 나쁜 것들을 찾아낼 수 있다는 점입니다. 진짜 중요한 질문은 단순히 가드들이 나쁜 것을 찾아낼 수 있느냐가 아닙니다. 바로 언제, 그리고 어떻게 그 일을 해야 하느냐는 것입니다.

가드가 이야기를 쓰기도 전에 독자의 요청을 확인해야 할까요? 아니가 이야기가 완성될 때까지 기다렸다가 확인해야 할까요? 아니면 둘 다 해야 할까요? 만약 문제가 발견된다면, 이야기 전체를 쓰레기통에 던져버려야 할까요, 아니 아니면 안전한 버전으로 수정해서 독자에게 주어야 할까요? 이 논문은 AI 챗봇에 대한 바로 그 퍼즐을 파고듭니다. 이 논문은 AI를 '작가'로, 안전 필터를 '편집자'로 취급하며, 어떤 설정을 통해 가장 좋은 결과(가장 도움이 되는 답변과 가장 적은 위험한 실수 사이의 균형)를 얻을 수 있는지 테스트합니다.


위대한 AI 안전의 댄스: 어디에 서서 무엇을 할 것인가

Microsoft Responsible AI와 Goodfire의 팀인 저자들은 안전 필터를 독립적으로 살펴보는 것을 그만두기로 했습니다. 보통 과학자들은 철자 검사기가 오타를 세는 것처럼, 필터가 나쁜 단어를 얼마나 잘 잡아내는지 측정합니다. 하지만 현실 세계는 훨씬 더 복잡합니다. 만약 필터가 너무 엄격하면, 위험해 보이는 단어를 사용했다는 이유만으로 완벽하게 좋은 이야기까지 차단할 수 있습니다. 반대로 너무 느슨하면, 위험한 이야기가 몰래 빠져나갈 수 있습니다.

그래서 팀은 그들의 안전 시스템을 위한 네 가지 서로 다른 "댄스 동작", 즉 구성(configurations)을 설정하여 실험을 진행했습니다. 그들은 AI가 가장 도움이 되면서도(훌륭한 답변을 보여주면서도) 여전히 안전한(해로운 것을 보여주지 않는) 최적의 지점을 찾고자 했습니다.

네 가지 댄스 동작

그들은 다음의 네 가지 특정 설정(구성)을 테스트했습니다:

  1. 입력 전용 (Input Only): 가드가 AI가 무언가를 쓰기 에 독자의 질문을 확인합니다. 질문이 위험해 보이면, 가드는 즉시 전체 과정을 중단합니다. 이야기는 쓰이지 않습니다.
  2. 응답 전용 (Response Only): 가드가 AI가 먼저 이야기를 쓰도록 둡니다. 그 후, 가드는 완성된 이야기를 확인합니다. 만약 내용이 나쁘다면, 그 이야기는 버려집니다.
  3. 입력 + 응답 (Input + Response): 가드가 질문과 답변을 둘 다 확인합니다. 둘 중 하나라도 위험해 보이면 이야지는 차단됩니다.
  4. 응답 + 재작성 (Response + Rewrite): 이것은 화려하고 새로운 동작입니다. 가드가 완성된 이야기를 확인합니다. 만약 위험하다면, 단순히 버리는 대신, "수정자(fixer)"(두 번째 AI)가 이야기를 안전하게 다시 쓰도록 시도합니다. 그 후 가드는 새 버전을 마지막으로 한 번 더 확인합니다. 만약 통과한다면, 당신은 수정된 이야기를 받게 됩니다!

큰 발견: 끝날 때까지 기다려라!

팀은 두 가지 단계에서 이 테스트를 실행했습니다: 1,250개의 대화로 구성된 개인적인 인간 라벨링 데이터셋("내부 벤치마크")과 5,000개 이상의 독성 채팅이 담긴 공개 데이터셋("Public ToxicChat")입니다.

여기 놀라운 결과가 있습니다: 끝까지 기다리는 것(응답 전용)이 유용성을 유지하는 데 가장 좋은 전략이었습니다.

단순히 글이 다 써진 후에 나쁜 답변을 차단했을 때, 시스템은 대화의 **85.68%**를 유용하고 주제에 맞게 유지했습니다. 하지만 AI가 무언가를 쓰기 전에 나쁜 질문을 차단하려고 했을 때(입력 전용), 실수로 좋은 대화의 절반을 버리게 되었습니다! 현대의 AI 모델들은 이미 나쁜 질문을 무시하고 안전한 답변을 쓰는 데 꽤 능숙하기 때문입니다. 따라서 프로세스를 조기에 중단하는 것은, 마치 클럽에 들어오려는 사람들에게 신분증을 보여주기도 전에 입구 컷을 하는 것과 같았습니다. 사실 그들 중 많은 이들이 괜찮은 사람들이었음에도 말이죠.

하지만 함정이 있었습니다. "응답 전용" 방식이 가장 유용하긴 했지만, 입력과 출력을 모두 확인하는 방식에 비해 약간 더 해로운 콘텐츠를 통과시켰습니다. 만약 당신이 매우 엄격한 안전 예산(즉, 나쁜 것이 절대 통과하게 해서는 안 되는 상황)을 가지고 있다면, 입력과 출력을 모두 확인하는 것(입력 + 응답)이 가장 안전하겠지만, 이는 시스템을 훨씬 덜 유용하게 만들었습니다.

"수정자"의 마법

팀은 다음과 같이 물었습니다. "최선의 두 가지를 모두 가질 수는 없을까? '응답 전용' 전략의 유용성을 유지하면서, 새어 나오는 몇몇 나쁜 답변들을 고칠 수는 없을까?"

그들은 응답 + 재작성 (Response + Rewrite) 전략을 시도했습니다. 가드가 나쁜 답변을 포착하면, 단순히 차단하는 대신 "수정자" AI에게 보내 답변을 다시 쓰게 합니다. 이 수정자는 나쁜 부분을 제거하면서도 좋은 부분은 유지하며 답변을 재작성합니다.

결과는 인상적이었습니다. 이 재작성 기술을 사용함으로써, 그들은 차단될 뻔했던 거의 모든 트래픽을 회복했습니다.

  • 내부 테스트에서, 유용성은 **85.68%**에서 **95.04%**로 급증했습니다.
  • 차단된 대화의 수는 **9.60%**에서 단 **0.24%**로 떨어졌습니다.

결정적으로, 사용자에게 도달하는 해로운 답변의 수는 "응답 전용" 전략과 정확히 동일하게 유지되었습니다. 재작성은 더 많은 나쁜 것을 통과시킨 것이 아니라, 버려질 뻔했던 좋은 것들을 구해낸 것입니다.

속도와 "재작성" 비용

물론, 세상에 공짜는 없습니다. 재작성에는 시간이 걸립니다. 팀은 이야기를 고치는 데 얼마나 걸리는지 측정했습니다.

  • 만약 거대하고 느린 AI를 사용하여 무엇을 재작성하고 어떻게 할지 결정한다면, 약 13.8초가 걸립니다. 채팅 시간 중에서는 영겁의 시간입니다!
  • 하지만, 그들은 무엇을 할지 결정하기 위해 작고 특화된 "프로브(probes)"(작고 빠른 탐지기)를 사용하는 영리한 지름길을 찾아냈습니다. 이를 통해 시간을 단 0.47초로 단축했습니다.

이는 당신이 사용자를 영원히 기다리게 하지 않으면서도, 매우 유용하고 안전한 시스템을 가질 수 있음을 의미합니다.

세부 사항: 재작성이 놓친 것들

저자들은 단순히 숫자만 본 것이 아니라, 재작성된 이야기들을 직접 읽어보며 실제로 어떤 일이 일어나는지 확인했습니다. 그들은 "수정자"가 일반화에 능숙하다는 것을 발견했습니다. 예를 들어, 어떤 이야기가 특정 위험한 앱을 언급했다면, 수정자는 그 이름을 "안전한 플랫폼"으로 바꾸고 여전히 안전하게 머무는 방법에 대한 좋은 조언을 제공했습니다.

그러나 그들은 하나의 경계선도 발견했습니다. 자해와 같은 민-감한 사례의 경우, 재작성 과정에서 지나치게 안전을 기하려다 보니 구체적이고 도움이 될 만한 자원(예: 위기 상담 전화번호)을 삭제하기도 했습니다. 논문은 시스템이 안전과 유용성 사이의 균형을 잘 잡고 있지만, 완벽하지는 않다는 점을 언급합니다. 때때로, 안전을 서두르는 과정에서 인간이 간절히 원할 수도 있는 지원 정보가 실수로 누락될 수 있습니다.

결론

이 논문은 우리에게 모든 AI 안전에 적용되는 단 하나의 "완벽한" 규칙이 있다고 말하지 않습니다. 대신, 우리에게 지도를 제공합니다. 그것은 다음과 같습니다:

  1. 너무 일찍 차단하지 마십시오: AI가 먼저 쓰도록 두는 것이 보통 더 유용한 답변을 만들어냅니다.
  2. 차단하는 대신 재작성하십시오: 나쁜 답변을 잡았다면, 고쳐보십시오. 그것은 위험을 높이지 않으면서도 많은 좋은 대화를 살려냅니다.
  3. 속도가 중요합니다: 적절한 도구를 사용한다면 빠르게 고칠 수 있습니다.

저자들은 모든 상황에 적용되는 단 하나의 "만능 규칙"은 없다고 결론짓습니다. 대신, 기업들은 자신들의 구체적인 필요를 살펴봐야 합니다. 만약 더 유용한 답변을 얻기 위해 약간의 위험을 감수할 수 있다면, "재작성" 기능이 있는 "응답 전용" 전략을 사용해야 합니다. 만약 절대적인 제로 리스크가 필요하다면, 비록 더 많은 좋은 대화가 차단될지라도 입력을 함께 확인해야 할 것입니다. 결국, 당신만의 클럽에 맞는 최적의 균형을 찾는 것이 핵심입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →