Artificial intelligence for oral history and disaster experience: a systematic mapping study
이 체계적 문헌 고찰 연구는 35개의 주요 연구를 검토하여 인공지능이 어떻게 구술사를 정적인 아카이브에서 역동적이고 상호작용적인 분야로 변화시키고 있는지 분석하며, 전사 및 분석에서의 상당한 진보를 강조하는 동시에 비판적인 윤리적 과제와 트라우마에 민감한 인간 중심적 접근 방식의 필요성을 강조한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
수십 년 동안 전쟁 생존자, 재난의 목격자, 잊혀진 전통을 보존하는 노인들의 이야기와 같은 인간 경험의 서사들은 테이프와 디스크에 담겨 정적인 기록물로서 아카이브에 저장되어 왔습니다. 이러한 구술사는 공식 문서가 놓치기 쉬운 정서적 진실과 개인적 관점을 담고 있다는 점에서 매우 중요합니다. 그러나 이 목소리들과 그것을 들어야 할 사람들 사이에는 오랫동안 거대한 장벽이 존재해 왔습니다. 바로 수 시간의 음성을 검색 가능한 텍스트로 변환하는 작업의 극심한 어려움입니다. 연구자나 박물관 큐레이터에게 특정 기억을 찾기 위해 모든 녹음본의 매 분 매 초를 듣는 것은 평생이 걸릴 수도 있는 작업입니다. 이러한 병목 현상은 방대한 인류 증언의 컬렉션을 오직 들을 시간이 있는 사람들에게만 접근 가능하도록 가두어 두는 결과를 초래했습니다. 이제, 인공지능이 이러한 아카이브를 여는 데 사용되는 새로운 분야가 등장하고 있습니다. 이는 단순히 단어를 전사하는 것을 넘어, 그 안에 담긴 감정, 패턴, 그리고 침묵까지 이해하는 것을 목표로 합니다.
캐나다 대학 연구진은 최근 이 기술이 정확히 어떻게 적용되고 있는지 확인하기 위해 종합적인 검토를 수행했습니다. 그들은 2004년부터 2025년 사이에 발표된 35개의 연구를 조사하며, 하나의 음성 이야기가 디지털 기록이 되는 모든 단계를 살펴보았습니다. 그들의 연구는 컴퓨터가 음성을 텍스트로 바꾸는 기계적 과업에는 놀라울 정도로 능숙해졌지만, 더 깊은 과제는 그 단어 뒤에 숨겨진 인간의 의미를 보존하는 데 있다는 점을 밝혀냈습니다. 연구진은 이 분야가 단순한 전사를 넘어 복잡한 분석 단계로 빠르게 이동하고 있음을 발견했으나, 민감한 기억을 어떻게 다룰 것인지, 그리고 누구의 목소리가 진정으로 들릴 것인지에 대한 중대한 윤리적 난제들이 남아 있다고 지적했습니다.
이 검토는 구술사의 여정을 네 가지 뚜렷한 단계, 즉 생성, 아카이빙, 분석, 전시로 나누어 매핑하는 것으로 시작되었습니다. 이야기가 처음 만들어지는 생성 단계에서 인공지능의 사용은 여전히 드뭅니다. 이 영역의 대부분의 연구는 컴퓨터 프로그램을 통해 사람을 인터뷰하거나, 역사적 기록의 공백을 메우기 위해 시뮬레이션된 대화를 생성하는 것과 같은 실험적인 아이디어를 탐구합니다. 그러나 대다수의 연구는 두 번째 단계인 아카이빙에 집중되어 있습니다. 이곳에서 기술은 가장 극적인 영향을 미쳤습니다. 고급 음성 인식 시스템을 사용함으로써, 연구자들은 이제 수천 시간의 오디오를 자동으로 텍xt로 변환할 수 있게 되었습니다. 이는 과거에 대규모 컬렉션을 사용 불가능하게 만들었던 결정적인 문제를 해결했습니다. 검토 보고서는 2024년과 2025년 사이에만 이 분야 연구의 거의 절반이 발표되었음을 언급하며, 이는 실험적인 프로토타입에서 방대한 양의 녹음 백로그를 실제로 처리하는 실질적인 도구로의 전환을 시사합니다.
이 연구의 지리적 분포는 두 가지 서로 다른 접근 방식의 이야기를 보여줍니다. 홀로코스트와 기타 갈등으로부터 얻은 수백만 건의 증언을 보유한 USC 쇼아 재단(USC Shoah Foundation)과 같은 거대 아카이브가 있는 미국에서는, 텍스트가 인간 심리에 대해 무엇을 말해줄 수 있는지에 초점이 맞춰져 있습니다. 그곳의 연구자들은 컴퓨터 프로그램을 사용하여 이러한 이야기들로부터 트라우마의 징후를 분석하며, 예를 들어 9/11 테러 생존자들의 외상 후 스트레스 증상을 예측하기도 합니다. 반면, 독일과 체코를 중심으로 한 중앙유럽의 연구 클러스터는 엔지니어링 자체에 전념하고 있습니다. 이 팀들은 컴퓨터가 다양한 언어, 방언, 소음이 있는 녹음 조건에서도 정확하게 듣고 전사할 수 있도록 기초 기술을 완벽하게 만드는 데 주력하고 있습니다. 미국의 연구가 "이 이야기는 무엇을 의미하는가?"라고 묻는다면, 유럽의 연구는 "어떻게 하면 컴퓨터가 이를 정확하게 듣게 할 것인가?"라고 묻습니다.
단순히 단어를 받아 적는 것을 넘어, 파이프라인의 세 번째 단계는 인공지능을 사용하여 이야기 속의 패턴과 감정을 찾아내는 과정을 포함합니다. 검토 결과, 연구자들이 유사한 내러티브를 함께 그룹화하거나 화자의 목소리에 담긴 정서적 무게를 감지하기 위해 이러한 도구들을 점점 더 많이 사용하고 있음이 드러났습니다. 일부 연구는 더 나아가 호흡, 휴지(pause), 침묵과 같은 비언어적 소리를 분석합니다. 이러한 소리들은 단순한 전사본이 놓칠 수 있는 고통이나 망설임을 나타내며, 단어 자체만큼이나 많은 의미를 담고 있는 경우가 많습니다. 네 번째 단계인 시각화는 이러한 디지털 이야기들이 대중에게 다시 전달되는 단계입니다. 여기서 인공지능은 방문객이 디지털 공간을 걸으며 증언과 상호작용할 수 있는 가상 현실 전시와 같은 몰입형 경험을 만드는 데 도움을 줍니다.
이러한 기술적 도약에도 불구하고, 연구진은 간과할 수 없는 심각한 우려 사항들을 식별했습니다. 가장 시급한 문제는 이야기의 '인간적' 요소를 잃을 위험입니다. 컴퓨터가 녹음을 전사할 때, 종종 휴지, 호흡, 목소리의 정서적 떨림을 제거하여 복잡한 인간의 경험을 평면적인 텍스트로 축소해 버립니다. 이는 말하는 방식 자체가 무엇을 말하는가만큼 중요한 트라우마적 역사를 다룰 때 특히 위험합니다. 또한 편향성의 문제도 존재합니다. 이러한 과업에 사용되는 인공지능 모델은 흔론 표준적이고 자원이 풍부한 언어와 데이터로 학습되는 경우가 많습니다. 이 모델들이 원주민 공동체, 희귀 방언 사용자, 또는 특정 문화적 갈등의 생존자들의 이야기를 접할 때, 뉘앙스를 이해하지 못하고 때로는 정서를 오해하거나 문화적 맥락을 무시하는 경우가 발생합니다.
검토 보고서는 또한 이 이야기를 돌보는 역사학자들과 도구를 만드는 엔지니어들 사이의 커지는 격차를 강조합니다. 아카이브가 상업 기업이 제공하는 복잡한 '블랙박스' 시스템에 점점 더 의존함에 따라, 역사학자들이 기술이 정보를 어떻게 분류하고 검색하는지 이해하기가 점점 더 어려워지고 있습니다. 이러한 투명성 부족은 누가 서사를 통제하는가에 대한 의문을 제기합니다. 나아가, 연구진은 이러한 거대 컴퓨터 모델을 훈련시키는 데 드는 환경적 비용이 상당하며, 이것이 이 분야에 새로운 윤리적 고려 사항을 더한다고 지적했습니다. 저자들은 인공지능이 진정으로 유용해지기 위해서는 인간 전문가가 프로세스를 주도하며 기술이 이야기를 왜곡하는 것이 아니라 서사를 보조하도록 하는 '휴먼 인 더 루프(human-in-the-loop)' 접근 방식이 필요하다고 강조합니다.
궁극적으로, 이 체계적 검토는 우리가 전환점에 서 있음을 시사합니다. 모든 이가 구술사에 접근할 수 있게 하는 기술은 마침내 도래했지만, 앞으로 나아가는 길은 더 나은 소프트웨어 그 이상을 요구합니다. 그것은 기계의 효율성과 인간의 기억을 보존해야 하는 윤리적 책임 사이의 신중한 균형을 요구합니다. 연구진은 이 분야의 미래가 단순한 정확도를 넘어 성공을 측정하는 새로운 방법을 개발하는 데 달려 있다고 결론지었습니다. 컴퓨터가 얼마나 많은 단어를 맞혔는지 세는 대신, 우리는 기술이 이야기가 전달하는 정서적 진실과 문화적 온전함을 보존했는지 평가하는 법을 배워야 합니다. 이러한 과제들을 해결함으로써만 우리는 과거의 목소리가 단순히 들리는 것을 넘어, 진정으로 이해될 수 있도록 보장할 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.