The Say-Do Gap Architecture Applied to Agentic AI: A Reproducible NLP Pipeline for Detecting Governance Rhetoric–Reality Divergence in Corporate ESG Communication
본 연구는 IBEX 35 지수 내 에이전틱 AI(agentic AI)와 관련하여 기업의 수사와 관찰 가능한 거버넌스 관행 사이의 괴리를 탐지하기 위해 Say-Do Gap Index 아키텍처를 적용한 재현 가능한 이중 언어 NLP 파이프라인을 소개하며, 이를 통해 전통적인 ESG 영역을 넘어선 본 프레임워크의 일반화 가능성을 입증한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 기업 세계에서 기업들은 새로운 기술을 책임감 있게 관리하려는 계획을 상세히 기술한 보고서를 빈번하게 발표합니다. 그들은 윤리, 안전, 그리고 감독에 대해 이야기하며, 첨단 도구의 사용이 통제 하에 있음을 약속합니다. 그러나 비즈니스와 거버넌스에는 조직이 말하는 바와 실제로 행하는 바 사이의 간극이라는 지속적인 과제가 존재합니다. 이러한 간극은 기술에만 국한된 것이 아닙니다. 이는 어떤 기관이 자신의 내부 관행에 대해 공개적인 주장을 할 때마다 나타납나다. 연구자들은 이 현상을 오랫동안 연구해 왔으며, 구조적 변화를 뒷받침하는 것보다 말을 만들어내는 것이 훨씬 쉽다는 점에 주목해 왔습니다. 기업이 복잡한 시스템을 관리한다고 주장하면서도 이를 증명할 수 있는 가시적인 위원회, 정책 또는 인증이 부족할 때, 그 결과는 수사와 현실 사이의 괴리로 이어집니다. 이 괴리는 투자자, 규제 기관, 그리고 대중이 기업의 책임에 대한 실제 상태를 오해하게 만들 수 있다는 점에서 중요합니다.
IACC 전문 직업 연구소(Instituto Profesional IACC)의 연구원 알프레도 메를레(Alfredo Merlet)가 수행한 새로운 연구는 이 문제를 특히 "에이전틱 인공지능(agentic artificial intelligence)"과 관련하여 다룹니다. 이 용어는 인간의 지속적인 지시 없이도 스스로 결정을 내리고 단계를 밟아 나갈 수 있는 자율적인 행동을 할 수 있는 유형의 AI를 의미합니다. 이러한 시스템이 점점 더 보편화됨에 따라, 기업들은 이를 어떻게 거버넌스(관리)할 것인지 논의하기 시작했습니다. 메를레의 연구는 단순히 기업들이 이 기술에 대해 이야기하고 있는지 여부를 묻는 것이 아니라, 그들의 말이 행동과 일치하는지를 묻습니다. 이를 위해 연구원은 기업의 약속과 거버넌스의 실질적 증거 사이의 간극을 측정하기 위해 설계된 새롭고 반복 가능한 시스템을 구축했습니다. 이 연구는 스페인의 35대 대기업 목록인 IBEX 35를 대상으로 하며, 이 방법론이 작동하는지 확인하기 위한 테스트 케이스로 활용합니다.
이 연구의 핵심은 기업이 말하는 것과 실제로 행한 것을 분리하는 파이프라인, 즉 단계별 프로세스입니다. 방정식의 "말하기(Say)" 부분은 이들 기업이 2023년에서 2025년 사이에 발표한 수천 건의 뉴스 기사와 기업 커뮤니케이션에서 추출됩니다. 연구원은 특수 컴퓨터 프로그램을 사용하여 이러한 텍스트를 스캔하여 에이전틱 AI 거버넌스에 대한 언급을 찾아냈습니다. 프로그램은 감독 및 통제와 관련된 특정 언어를 인식하도록 훈련되었으며, 단순히 AI 사용에 대해 이야기하는 것과 해당 AI의 리스크를 어떻게 관리하는지에 대해 논의하는 것을 구분하도록 설정되었습니다. "행하기(Do)" 부분은 다릅니다. 이 섹션은 기업이 말하는 것에 의존하는 대신 물리적인 증거를 찾습니다. 연구원은 세 가지 구체적인 유형의 증거를 검색했습니다: 기술 리스크를 전담하는 이사회 수준의 위원회 존재 여부, 공식적으로 발표된 AI 거버넌스 정책 문서, 그리고 회사가 외부 인증 표준을 준수한다는 증거입니다. 이것들은 연설이나 보도 자료와 달리 검증 가능한 실질적인 항목들입니다.
연구원이 이 시스템을 샘플 내 34개 기업에 적용했을 때, 결과는 놀라웠지만 아마도 예상과는 다른 방향이었을 것입니다. 연구는 시스템이 기업 커뮤니케이션에서 에이전틱 AI 거버넌스 담론에 대한 증거를 거의 발견하지 못했으며, 그에 상응하여 이를 관리하는 데 필요한 구체적인 거버넌스 구조의 증거도 발견하지 못했음을 밝혀냈습니다. 2023년부터 2025년 사이의 기간 동안, 뉴스 및 보고서에 대한 컴퓨터 분석 결과 에이전틱 AI 언급의 구조적 빈도가 매우 낮거나 전무한 것으로 나타났으며, 세 가지 유형의 실질적 증거를 찾는 과정에서도 대다수의 기업에서 아무런 결과가 나오지 않았습니다. 이것이 컴퓨터의 판독 오류가 아님을 확실히 하기 위해, 연구원은 컴퓨터가 관련 내용이 없다고 표시한 기사 샘플을 수동으로 검토했습니다. 이러한 인간의 검토는 컴퓨터가 정확했음을 확인해주었습니다. 즉, 기업들은 아직 에이전틱 AI 거버넌스에 대한 유의미한 담론을 생산하지 않고 있었으며, 이를 관리하고 있음을 증명할 구체적인 거버넌스 단계도 보여주지 않고 있었습니다.
이러한 결과는 이 방법론이 작동한다는 것을 입증한다는 점에서 유의미합니다. 이 연구는 본래 일반적인 환경 및 사회적 이슈를 위해 구축된 프레임워크가 자율형 AI라는 구체적이고 기술적인 세계에 적응될 수 있는지를 테스트하기 위해 설계되었습니다. 시스템이 담론과 행동 모두의 부재를 나타내는 '영(null)'의 결과를 성공적으로 식별해냈다는 사실은, 이 아키텍처가 견고하며 실제 발견 사항과 분류기 오류를 구분할 수 있음을 증명합니다. 연구원은 이 특정 스페인 기업들을 비난하려 한 것이 아니라, 설령 그 차이가 둘 다의 부재일지라도, 말과 실체 사이의 차이를 측정할 수 있는 도구가 존재함을 보여주는 것을 목표로 했습니다. 이 연구는 이것이 산업 전체에 대한 최종 감사나 모든 기업의 청렴성에 대한 확정적인 판단이 아님을 명시적으로 밝힙니다. 대신, 다른 시장이나 다른 기술을 점검하기 위해 다른 이들이 사용할 수 있는 재현 가능한 도구를 제시합니다.
이 작업의 가치는 투명성과 개방성에 있습니다. 연구자는 컴퓨터가 찾는 단어 목록과 증거를 찾는 데 사용된 코드를 포함하여 전체 시스템을 대중에게 공개했습니다. 이를 통해 다른 과학자, 규제 기관 또는 투자자들이 동일한 방법을 사용하여 다른 국가의 기업을 점검하거나 다른 신흥 기술을 살펴볼 수 있습니다. 연구는 특정 문서와 규정이 해당 지역의 상황을 반영한다면, 이 접근 방식이 라틴 아메리카 및 그 너머의 시장에도 적용될 수 있음을 시사합니다. 이는 기업이 주장하는 것을 단순히 읽는 것을 넘어, 그들이 실제로 무엇을 구축했는지 검증하는 방향으로 나아가는 길을 제시합니다.
궁극적으로, 이 논문은 기업의 거버넌스가 그들의 말과 일치하는지 확인할 수 있는 명확하고 반복 가능한 방법을 제공합니다. 이 연구는 특정 샘플과 시간 범위 내의 에이전틱 AI에 대해, 현재의 지형이 수사와 구조적 통제의 증거 모두에서 구조적으로 낮은 빈도를 특징으로 하고 있음을 보여줍니다. 이것이 기업들이 거짓말을 하고 있다는 뜻은 아니지만, 그들의 관리 방식에 대한 가시적인 증거와 관련 담론이 현재 결여되어 있다는 것을 의미합니다. 이 연구는 이러한 간극을 측정하는 방법이 기업의 행동을 이해하는 강력한 도구이며, 조직이 복잡한 시스템을 어떻게 관리하는지에 대해 주장할 때 적용될 수 있는 방법이라고 결론짓습니다. 약속과 증거를 분리함으로써, 이 연구는 빠르게 진화하는 인공지능과 기업 책임의 지형을 바라보는 새로운 렌즈를 제공합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.