Extracting and Coding Digital Sustainability Data using Text Mining and AI: A Design Science Approach
본 연구는 텍스트 마이닝, 특화된 사전, 그리고 생성형 AI 프롬프트를 결합한 반자동 아티팩트를 개발하고 검증하기 위해 디자인 사이언스 접근법을 채택하며, 이는 전문가의 수동 코딩과 높은 일치도를 유지하면서도 텍스트 소스로부터 디지털 지속가능성 데이터를 추출하고 코딩하는 효율성과 확장성을 유의미하게 향상시킨다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 거대한 미스터리를 풀려는 탐정이라고 상상해 보십시오. 기업들이 어떻게 기술을 사용하여 지구와 사람을 돕는지 밝혀내는 일 말입니다. 단서들은 먼지 쌓인 다락방에 숨겨져 있는 것이 아닙니다. 그것들은 기업들이 매년 작성하는 수천 페이지의 두껍고 지루한 보고서 안에 파묻혀 있습니다. 이 보고서들은 '그린 데이터 센터', '스마트 센서', '디지털 형평성'과 같은 단어들로 가득 찬 거대한 텍스트 도서관과 같습니다. 문제는, 모든 보고서의 모든 페이지를 일일이 손으로 읽는 것은 빨대로 바다를 마시려는 것과 같아서, 시간이 너무 오래 걸릴 뿐만 아니라 가장 중요한 물방울 하나라도 놓칠 수 있다는 점입니다. 이것이 바로 연구자들이 컴퓨터와 소프트웨어가 세상을 더 나은 곳으로 만드는 방법을 연구하는 분야인 '디지털 지속가능성(Digital Sustainability)'의 세계입니다. 하지만 큰 그림을 이해하기 위해서, 그들은 이러한 단서들을 빠르게 찾아내고 분류해야 합니다. 바로 그 지점에서 '텍스트 마이닝(컴퓨터에게 읽고 패턴을 찾는 법을 가르치는 것)'과 '생성형 AI(글을 쓰고 생각할 수 있는 초스마트 챗봇)'의 마법이 등장합니다. 서류 더미에 빠져 허우적거리는 대신, 연구자들은 자신들이 미스터리를 해결하는 데 집중할 수 있도록 무거운 짐을 대신 들어줄 로봇 조수를 원합니다.
이 논문은 바로 그 로봇 조수를 만드는 것에 관한 것입니다. 연구자들인 토마스 에이브러햄(Thomas Abraham), 비엣 다오(Viet Dao), 네스린 엘-레이스(Nesreen El-Rayes)는 '디자인 사이언스(Design Science)'라는 방법을 사용하기로 했습니다. 이는 기본적으로 "문제를 해결할 도구를 만들고, 테스트하고, 더 좋게 만든다"라는 뜻의 멋진 표현입니다. 그들의 목표는 지속가능성 보고서를 스캔하여 관련 디지털 지속가능성 이야기들을 추출한 다음, 그 이야기들을 깔끔하고 논리적인 카테고리로 분류할 수 있는 반자동 시스템을 구축하는 것이었습니다. 그들은 단순히 추측한 것이 아니라, 이 일을 수행하기 위한 세 가지 구체적인 '아티팩트(Artifacts, 도구)'를 만들었습니다: 찾고자 하는 단어들의 특수한 사전, AI에게 생각하는 법을 가르치기 위한 일련의 지침(프롬프트), 그리고 이들을 함께 사용하는 전체 과정입니다.
먼저, 그들은 '찾기' 문제를 다루었습니다. 당신이 동굴 속에서 특정 종류의 보물을 찾고 있다고 상상해 보십시오. 만약 당신이 그냥 "보물!"이라고 외친다면, 많은 돌과 흙을 얻게 될 것입니다. 당신에게는 구체적인 지도가 필요합니다. 연구자들은 '디지털 지속가능성 사전'을 만들었는데, 이는 고도로 조율된 금속 탐지기와 같습니다. 그들은 과거의 연구에서 나온 수천 개의 단어를 이 사전에 입력하여 '디지털 지속가능성'이 실제로 어떤 소리를 내는지 학습시켰습니다. 그들은 바이오젠(Biogen)이나 코카콜라(Coca-Cola)와 같은 기업의 보고서를 통해 이 사전을 테스트했습니다. 결과는 인상적이었습니다: 컴퓨터는 인간 전문가가 수동으로 찾아낸 디지털 지속가능성 이야기의 94%를 찾아냈지만, 그 과정은 인간보다 훨씬 짧은 시간 안에 이루어졌습니다. 심지어 컴퓨터는 인간이 놓쳤던 54개의 이야기를 추가로 찾아냈습니다! 하지만 완벽하지는 않았습니다. 컴퓨터는 때때로 지속가능성 이니셔티브와는 관련이 없지만 중요해 보이는 '웹사이트'와 같은 단어들에 의해 주의가 분산되기도 했습니다. 이는 컴퓨터가 훌륭한 스캐너이긴 하지만, 여로 여전히 결과를 재확인할 인간이 필요하다는 것을 연구자들에게 가르쳐 주었습니다.
다음으로, 그들은 '분류' 문제를 다루었습니다. 컴퓨터가 이야기를 찾아낸 후에는, 그 이야기들을 올바른 상자에 넣어야 했습니다. 연구자들은 기성 이론에 기반한 두 가지 서로 다른 '파일링 시스템'을 사용했습니다. 한 시스템은 기술이 무엇을 하는지(예: 프로세스를 '자동화'하거나 비즈니스 모델을 '변화'시키는 것)에 따라 이야기를 분류했고, 다른 시스템은 누가 혜택을 받는지(예: '내부' 대 '외부' 또는 '오늘' 대 '내일')에 따라 분류했습니다. AI에게 이 파일링 시스템을 사용하는 법을 가르치기 위해, 그들은 단순히 간단한 명령을 내린 것이 아니었습니다. 그들은 '퓨샷 프롬프팅(few-shot prompting)'이라는 기술을 사용했는데, 이는 AI에게 완성된 퍼즐 조각 몇 개를 보여주며 "이 조각이 여기에 어떻게 들어맞는지 보이시죠? 이제 나머지를 직접 해보세요"라고 말하는 것과 같습니다. 그들은 세 개 기업의 데이터를 통해 AI를 훈련시켰으며, AI가 실수를 하면 수정하고 지침을 정교하게 다듬는 과정을 거쳐 AI가 요령을 터득하게 했습니다.
이 훈련된 AI를 존슨앤드존슨(Johnson & Johnson)과 볼보(Volvo)와 같은 새로운 기업들에 테스트했을 때, 결과는 강력했습니다. '무엇을 하는가' 카테고리에 대해서는 AI가 인간 전문가의 분류와 78% 일치했습니다. '누가 혜로를 받는가' 카테고리에 대해서는 85.3% 일치했습니다. 연구자들은 두 사람(또는 사람과 로봇)이 얼마나 일치하는지를 측정하는 '코헨의 카파(Cohen's Kappa)'라는 점수를 계산했습니다. 이 점수는 0.7 이상이었는데, 이는 높은 수준의 일치를 의미합니다. 이는 AI가 단순히 추측하는 것이 아니라, 실제로 연구자들의 논리를 배우고 있음을 시사합니다.
하지만 이 논문은 이 과정이 모든 것을 해결하는 '마법 지팡이'라고 말하는 것을 경계합니다. 연구자들은 이 과정이 완전히 자동화될 수 있다는 생각을 명시적으로 배제했습니다. 그들은 AI가 비즈니스의 맥락을 이해하는 데 도움이 필요할 때가 있다는 것을 발견했습니다. 예를 들어, 어떤 회사가 안전 시스템에 대해 몇 년에 걸쳐 이야기한다면, AI는 이를 여러 개의 서로 다른 프로젝트로 간데, 인간은 그것이 하나의 긴 프로젝트라는 것을 알 것입니다. 사전 또한 완벽하지 않습니다. 그것은 새로운 단어들이 세상에 등장함에 따라 업데이트되어야 하는 살아있는 생명체입니다. 저자들은 최선의 접근 방식은 '파트너십'이라고 결론지었습니다. 즉, 컴퓨터는 데이터를 찾고 분류하는 무거운 짐을 대신 수행하는 초고속 연구 조수 역할을 하고, 인간 전문가는 항상 그 과정에 참여하여 AI를 훈련시키고, 실수를 바로잡으며, 최종 결정을 내려야 한다는 것입니다.
결국, 이 논문은 우리가 인간의 지혜와 기계의 속도 중 하나를 선택할 필요가 없다는 것을 시사합니다. 텍文本 마이닝과 생성형 AI를 체계적이고 단계적인 훈련 과정과 결합함으로써, 연구자들은 이전보다 훨씬 더 빠르게 방대한 양의 디지털 지속가능성 데이터를 구축할 수 있습니다. 이것은 해결된 문제는 아니지만, 세상을 구하는 일을 조금 덜 외롭고 훨씬 더 효율적으로 만드는 강력한 새로운 도구입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.