← 최신 논문
💻 computer science

Open-Domain Safety Policy Construction

이 논문은 인간이 작성한 시드 정보만으로 웹 검색과 경량 스캐폴딩을 활용해 도메인별 콘텐츠 중재 정책을 자동으로 작성하는 에이전트 시스템 'Deep Policy Research (DPR)'을 제안하고, 기존 벤치마크에서 정의 기반 및 인-컨텍스트 학습 베이스라인과 전문가 작성 정책보다 우수한 성능을 보임을 입증합니다.

원저자: Di Wu, Siyue Liu, Zixiang Ji, Ya-Liang Chang, Zhe-Yu Liu, Andrew Pleffer, Kai-Wei Chang

게시일 2026-04-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Di Wu, Siyue Liu, Zixiang Ji, Ya-Liang Chang, Zhe-Yu Liu, Andrew Pleffer, Kai-Wei Chang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🏢 문제 상황: "규칙 만들기"는 왜 힘들까?

인터넷 회사 (유튜브, 페이스북, 광고 플랫폼 등) 에는 **'나쁜 콘텐츠'를 막아주는 안전 요원 (모더레이터)**들이 있습니다. 하지만 이 요원들이 무엇을 막고 무엇을 허용할지 정하는 **'규칙책 (정책)'**을 만드는 일은 매우 어렵습니다.

  • 전문가 필요: 법학자나 윤리학자 같은 전문가가 직접 써야 합니다.
  • 시간과 비용: 새로운 문제가 생길 때마다 (예: 새로운 AI 사기 수법) 규칙을 다시 써야 하므로 비용이 많이 듭니다.
  • 유지보수: 세상이 변하면 규칙도 계속 업데이트해야 합니다.

기존에는 "전문가가 규칙을 쓰고, AI 가 그 규칙을 따르도록 훈련"시키는 방식이었습니다. 하지만 이 논문은 **"AI 가 직접 규칙을 찾아서 써보자!"**라고 제안합니다.


🕵️‍♂️ 해결책: "Deep Policy Research (DPR)"

DPR 은 아주 단순하지만 똑똑한 AI 탐정입니다. 사람의 손길은 거의 필요하지 않습니다.

1. 시작: "한 줄의 지시"

사용자는 AI 에게 아주 간단한 명령만 내립니다.

"이건 '폭력'에 대한 규제야. 폭력적인 건 막아줘."

이게 전부입니다. 전문가가 수백 페이지의 규칙을 작성할 필요도 없습니다.

2. 과정: "인터넷을 뒤지는 3 단계"

DPR 은 이 한 줄의 지시를 바탕으로 다음과 같은 일을 스스로 합니다.

  • 1 단계: 질문 만들기 (검색)

    • AI 는 "폭력"이라는 단어만으로는 부족할 수 있다고 생각합니다. 그래서 "폭력적인 표현의 경계는 어디일까?", "은유적인 폭력 표현은?" 같은 구체적인 질문을 만들어 검색 엔진에 던집니다.
    • 비유: 요리사가 레시피를 만들 때, "고기를 구워라"만 듣고 끝내지 않고, "어떤 고기가 가장 맛있는가?", "소금과 후추의 비율은?"을 검색하는 것과 같습니다.
  • 2 단계: 정보 추출 (규칙 만들기)

    • 검색 결과 (뉴스, 위키백과, 정부 보고서 등) 를 읽고 핵심 내용을 뽑아냅니다.
    • "이런 표현은 폭력이다", "이런 상황은 예외다"처럼 구체적인 규칙으로 바꿉니다.
    • 비유: 검색해서 나온 수백 편의 요리 블로그 글을 읽고, "소금 1 큰술, 후추 0.5 큰술"처럼 정확한 레시피로 정리하는 것입니다.
  • 3 단계: 정리 및 색인 (책 만들기)

    • 만들어진 규칙들이 너무 많고 산만하면 읽기 어렵습니다. AI 는 비슷한 규칙끼리 묶고 (예: '신체적 폭력', '언어적 폭력'), 목차를 만들어 깔끔한 규칙책을 완성합니다.

3. 결과: "완성된 규칙책"

이 과정을 몇 번 반복하면, 전문가가 쓴 것과 거의 비슷하거나 오히려 더 구체적인 **'규칙책'**이 완성됩니다.


🏆 실험 결과: "AI 가 쓴 규칙이 실제로 통할까?"

연구진은 이 AI 가 만든 규칙책을 실제 콘텐츠 심사에 적용해 보았습니다.

  • 비교 대상:

    1. 전문가가 직접 쓴 규칙책 (Human Policy)
    2. AI 가 검색 없이 정의만 보고 쓴 규칙 (Definition Only)
    3. 예시만 보고 추측하는 AI (In-Context Learning)
    4. 일반적인 검색 AI (OpenAI Deep Research)
  • 결과:

    • 전문가 못지않음: AI 가 만든 규칙책을 사용하면, 전문가가 쓴 규칙책을 쓸 때와 거의 비슷한 성능을 냈습니다. 특히 '폭력', '괴롭힘', '자해'처럼 주관적인 판단이 필요한 부분에서 큰 효과를 보였습니다.
    • 일반 검색 AI 보다 낫음: 단순히 "검색해서 정리해줘"라고 한 일반적인 AI 보다, **규칙을 만드는 데 특화된 구조 (DPR)**를 가진 AI 가 훨씬 더 좋은 규칙책을 만들었습니다.
    • 광고 심사에서 성공: 실제 광고 심사에서 전문가가 쓴 규칙의 일부를 AI 가 만든 것으로 바꿔도, 심사의 정확도가 떨어지지 않았습니다.

💡 핵심 요약: 왜 이 기술이 중요한가?

  1. 비용 절감: 매번 전문가를 고용해서 규칙을 새로 쓸 필요가 없습니다.
  2. 신속한 대응: 새로운 사기 수법이나 유해 콘텐츠가 나타나면, AI 가 즉시 인터넷을 뒤져 새로운 규칙을 만들어낼 수 있습니다.
  3. 객관성: AI 는 인간의 편견 없이 다양한 출처 (정부 문서, 학술지, 뉴스 등) 를 종합하여 규칙을 만듭니다.

🎯 결론 (한 줄 요약)

"이제부터는 AI 가 인터넷을 뒤져서 '무엇이 나쁜지'에 대한 규칙책을 스스로 작성해줍니다. 이 규칙책은 전문가가 쓴 것과 거의 똑똑해서, 인터넷을 더 안전하게 만들 수 있는 새로운 도구가 될 것입니다."

이 기술은 앞으로 우리가 매일 사용하는 앱과 웹사이트들이 더 똑똑하고 안전하게 작동하는 데 큰 역할을 할 것으로 기대됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →