← 최신 논문
🤖 AI

From Regulation to Implementation: A Critical Evaluation of LLM-Assisted Regulatory Compliance in Industry

이 논문은 유럽연합(EU)의 디지털 제품 여권 및 데이터 보호 영향 평가를 위한 규제 준수 결과물을 생성하는 데 있어 거대 언어 모델의 효과성을 비판적으로 평가하며, 엄격한 형식 지침은 일관성을 보장하지만 환각 현상을 증가시킬 수 있는 반면, 덜 구조화된 요구사항은 출력 품질을 유지하기 위해 더 상세한 프롬프트를 요구한다는 점을 밝히고 있다.

원저자: Adriana Watson, Marco Bücheler, Grant Richards

게시일 2026-08-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Adriana Watson, Marco Bücheler, Grant Richards

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 산업 세계에서 기업들은 지구와 사람의 프라이버시를 보호하기 위해 설계된 규칙이라는 거대한 산에 직면해 있습니다. 이러한 규칙을 준나하고 있음을 증명하기 위해 기업들은 흔히 '컴플라이언스 아티팩트(compliance artifacts)'라고 불리는 특정 문서들을 만들어야 합니다. 이것들을 제품의 여권이나 컴퓨터 시스템에 대한 안전 감사 보고서와 같은 상세한 보고서라고 생각하면 됩니다. 하나의 주요 유럽 규정은 판매되는 모든 배터리에 대해 어떤 재료가 들어 있고 어떻게 재활용할 수 있는지를 정확히 나열하는 디지털 여권을 요구합니다. 또 다른 규정은 개인 데이터를 처리하는 모든 시스템에 대해 위험 평가를 요구하며, 이를 통해 사람들의 개인 정보가 안전하게 보호되도록 보장합니다. 이러한 문서를 수작업으로 만드는 것은 매우 어려운데, 왜냐하면 필요한 데이터가 여러 서로 다른 컴퓨터 시스템에 흩어져 있고 제각각인 형식으로 들어오기 때문입니다. 기업들이 이 서류 작업으로 고군분투함에 따라, 이들은 인공지능, 구체적으로는 대규모 언어 모델을 사용하여 이 보고서들을 대신 작성하도록 하고 있습니다. 이 컴퓨터 프로그램들은 텍-스트를 읽고 새로운 콘텐츠를 생성하는 데 탁월하지만, 이들이 내용을 지어내거나 중요한 세부 사항을 놓치지 않고 엄격한 법적 지침을 따를 수 있을지는 여전히 불분명합니다.

연구팀은 이 인공지능 도구들이 필수 보고서를 작성하라는 요청을 받았을 때 정확히 얼마나 잘 수행하는지를 테스트하기 위해 연구를 시작했습니다. 그들은 지시 사항의 성격이 결과에 영향을 미치는지 확인하기 위해 매우 다른 두 가지 유형의 문서에 집중했습니다. 첫 번째는 규제 기관에 의해 정의된 매우 명확하고 경직된 구조를 가진 문서인 '디지털 배터리 여권'이었습니다. 두로 번째는 개인정보 보호법을 위한 문서로, 지시 사항이 훨씬 더 개방적이고 모호한 '데이터 보호 영향 평가'였습니다. 연구진은 다섯 가지의 서로 다른 인공지능 모델에 일련의 과업을 부여했습니다. 어떤 경우에는 모델에게 보고서를 작성하라는 간단하고 짧은 지시를 내렸습니다. 다른 경우에는 어떤 정보가 필요하고 어떻게 형식을 갖춰야 하는지를 정확히 설명하는 길고 상세한 가이드를 제공했습니다. 연구진은 모델이 매번 동일한 결과를 생성하는지 확인하기 위해 이 테스트를 여러 번 반복 실행했으며, 생성된 보고서에 법적으로 요구되는 모든 정보가 포함되어 있는지 점검했습니다.

결과는 모델이 두 유형의 문서를 다루는 방식 사이에 뚜렷한 차이가 있음을 보여주었습니다. 디지털 배터리 여권을 만들도록 요청했을 때, 인공지능 시스템은 놀라울 정도로 일관성을 보였습니다. 이 문서에 대한 규칙이 매우 구체적이었기 때문에, 모델은 지시 사항이 짧든 길든 상관없이 거의 동일한 출력을 생성했습니다. 모델은 배터리 재료에 대한 필요한 데이터를 성공적으로 추출하고 거의 매번 올바르게 형식을 맞추었습니다. 그러나 모델이 데이터 보호 영향 평가를 다룰 때는 상황이 완전히 바뀌었습니다. 경직된 구조가 부족했기 때문에 모델은 일관성을 유지하는 데 어려움을 겪었습니다. 추가적인 안내 없이 기본적인 규정 텍스트만 주어졌을 때, 모델은 핵심 섹션을 누락하거나 시도할 때마다 결과가 크게 달라지는 경우가 많았습니다. 연구진은 이러한 모호한 과업의 경우, 신뢰할 수 있는 결과를 얻기 위해서는 모델에 더 많은 맥락과 구체적인 예시를 제공하는 것이 필수적이라는 것을 발견했습니다. 추가적인 도움 없이는 모델이 데이터 저장 제한을 어떻게 처리할지 또는 개인에 대한 위험을 어떻게 평가할지와 같은 중요한 세부 사항을 빠뜨리는 경항이 있었습니다.

가장 눈에 띄는 발견 중 하나는 지시 사항의 상세 수준에 대해 모델이 어떻게 반응했는가 하는 점이었습니다. 엄격한 배터리 여권의 경우, 프롬프트에 더 많은 세부 사항을 추가하는 것이 출력의 질을 크게 변화시키지는 않았지만, 출력물에서 환각 현상(hallucinations)을 유발할 수는 있었습니다. 그러나 개인정보 평가의 경우, 그 반대가 사실이었습니다. 모델은 잘 수행하기 위해 그 추가적인 맥락을 필요로 했습니다. 지시 사항이 너무 모호하면 모델은 종종 필수 섹션을 포함하지 못했으며, 이는 현재의 법률 언어가 이러한 도구들이 스스로 해석하기에는 너무 광범위하다는 것을 시사합니다. 또한 연구는 서로 다른 인공지능 모델들이 다르게 행동한다는 점을 강조했습니다. 어떤 모델은 모든 과업에서 일관되게 신뢰할 수 있었던 반면, 어떤 모델은 지시 사항이 명확하지 않을 때 중요한 정보를 누락하는 경향이 있었습니다.

궁극적으로, 이 연구는 인공지능을 법적 준수(compliance)를 위해 사용하는 것의 성공 여부가 생성되는 문서의 유형에 크게 달려 있음을 시사합니다. 배터리 여권과 같이 고도로 구조화된 과업의 경우, 이 기술은 최소한의 설정만으로도 사용될 준비가 되어 있습니다. 하지만 개인정보 평가와 같이 복잡하고 개방적인 과업의 경우, 단순히 컴퓨터에게 법을 따르라고 요청하는 것만으로는 충분하지 않습니다. 연구진은 이러한 도구가 규제의 모호한 부분에 대해 효과적으로 작동하게 하려면, 인공지능이 필요한 단계들을 안내할 수 있도록 상세하고 구체적인 프롬프트를 만드는 데 시간을 투자해야 한다고 결론지었습니다. 규제 자체가 이러한 문서에 포함되어야 할 내용을 더 구체적으로 정하거나 우리가 기계에 명령하는 방식이 개선되지 않는 한, 컴플라이언스를 위한 인공지능의 사용은 일부 과업에 대한 높은 신뢰성과 다른 과업에 대한 상당한 위험이 공존하는 상태로 남을 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →