Vidya: An AI-Driven Modular Pipeline for Archival Automation and Semantic Metadata Enrichment
비디아는 UEPG 에서 개발된 모듈형 오픈소스 파이프라인으로, YAML 온톨로지 및 파이딕 검증에 의해 제약된 대규모 언어 모델을 활용하여 역사적"다크 데이터"의 의미적 풍부화와 아카이브 수집을 자동화함으로써 처리 시간을 수십 년에서 수일로 획기적으로 단축하면서도 NOBRADE 와 ISAD(G) 와 같은 국제 표준 준수를 보장합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
오래되고 먼지 쌓인 상자들로 가득 찬 거대한 도서관을 상상해 보세요. 그 안에는 역사 문서, 사진, 편지들이 들어 있습니다. 당신은 이들을 썩어 없어지는 것에서 구하기 위해 수년 동안 신중하게 모두 스캔했습니다. 하지만 여기 문제가 있습니다. 이제 당신은 본질적으로 '어두운 데이터'인 산더미 같은 디지털 파일들을 갖게 되었습니다. 그것들은 존재하지만, 라벨이나 태그, 설명이 없어 아무도 찾을 수 없습니다. 마치 손으로 하나하나 열어보지 않으면 안에 무엇이 들어 있는지 알 수 없는 거대한 창고에 미스터리한 상자들이 가득 찬 것과 같습니다.
전통적으로 모든 문서를 읽고 요약본을 작성할 사람을 고용하는 것은 극도로 느리고 비싸며 실수하기 쉽습니다. 바로 여기서 Vidya가 등장합니다.
Vidya 란 무엇인가요?
Vidya 는 이 라벨링 문제를 해결하기 위해 특별히 제작된 초지능적이고 피로하지 않는 로봇 사서라고 생각하세요. 이는 조립선을 뜻하는 fancy 한 단어인 '파이프라인'입니다. 사람이 책상에 앉아 대신 Vidya 가 디지털 파일들을 가져와 인공지능 (AI) 을 이용해 읽고, 나중에 사람들이 검색하고 찾을 수 있도록 필요한 설명 (메타데이터) 을 자동으로 작성합니다.
어떻게 작동하나요? ('디지털 구속복')
"잠깐, AI 는 신뢰할 수 없을 수 있죠. 때로는 사실을 만들어내거나 '환각'을 일으키기도 합니다."라고 생각하실 수 있습니다. 이 논문 저자들은 정확성이 모든 것인 기록보관소에게 이것이 엄청난 위험임을 알고 있었습니다.
이를 해결하기 위해 Vidya 는 **'디지털 구속복'**이라는 교묘한 트릭을 사용합니다.
- 문제: 창의적인 작가에게 사진을 묘사해 달라고 요청한다고 상상해 보세요. 그들은 존재하지 않는 세부 사항을 만들어낼 수 있습니다.
- 해결: Vidya 는 AI 가 그냥 '대화'하도록 내버려 두지 않습니다. 대신 AI 가 엄격하게 미리 작성된 양식 (YAML 파일로 정의됨) 을 작성하도록 강요합니다. 이는 특정 규칙이 있는 빈칸 채우기 워크시트를 AI 에게 주는 것과 같습니다.
- 확인: AI 의 답변이 받아들여지기 전에 디지털 문지기 (Pydantic 이라고 함) 가 작업을 점검합니다. AI 가 양식에 맞지 않거나 규칙을 위반하는 내용을 작성하려 하면 시스템이 이를 거부합니다. 이로써 출력물은 항상 구조화되고 정확하며 국제 도서관 규칙 (ISAD(G) 및 NOBRADE 등) 을 따르도록 보장됩니다.
'메이커' 정신
Vidya 는 무제한 자금이 있는 첨단 기업 연구실에서 제작된 것이 아닙니다. 브라질의 한 대학 팀이 메이커 원칙을 사용하여 제작했습니다.
- 저비용: 고가의 슈퍼컴퓨터가 아닌 표준 데스크톱이나 심지어 라즈베리 파이 같은 modest 하고 저렴한 컴퓨터에서 실행되도록 설계되었습니다.
- 오픈 소스: 누구나 살펴보고 수정하거나 개선할 수 있는 무료 소프트웨어입니다.
- 협력: 역사 (역사를 아는) 와 코드 (코드를 아는) 를 아는 컴퓨터 과학자들이 함께 일하도록 역사학자와 컴퓨터 과학자를 연결합니다.
그들은 무엇을 발견했나요?
팀은 50 개의 문서 (신문과 사진) 더미로 Vidya 를 테스트하고 수작업으로 작업을 수행한 경우와 비교했습니다. 결과는 극적이었습니다.
- 속도: 인간 팀이 수작업으로 처리하는 데 18.5 년이 걸릴 작업을 Vidya 는 약 45~60 일 만에 수행할 수 있었습니다.
- 비용: AI 지원 방식의 비용은 인건비 비용의 약 **1.5%**에 불과했습니다.
- 정확도: Vidya 는 제목, 제작자, 날짜와 같은 주요 세부 사항에서 약 85% 의 정확도를 보였습니다. 완벽하지는 않지만, 인간이 처음부터 시작하는 대신 중압을 담당하고 인간이 작업을 이중 확인하기만 하면 될 정도로 충분합니다.
- 접근성: 이러한 '어두운' 이미지를 텍스트 설명으로 변환함으로써 Vidya 는 웹을 탐색하기 위해 스크린 리더를 사용하는 시각 장애인이나 저시력자에게 이러한 기록보관소를 접근 가능하게 만듭니다.
큰 그림
Vidya 는 단순한 도구가 아닙니다. 그것은 역사를Unlock 하는 방법입니다. 그것은 과거의 '어두운 데이터', 즉 어둠 속에 방치되어 보이지 않고 검색할 수 없었던 파일들을 가져와 밝고 조직화되며 검색 가능한 디지털 박물관으로 바꿉니다. 그것은 거대한 예산이 없어도 첨단 AI 를 사용할 수 있음을 증명합니다. 기술이 정직하고 도움이 되도록 유지하기 위한 스마트하고 구조화된 접근 방식만 있으면 됩니다.
간단히 말해: Vidya 는 혼란스러운 디지털 파일 더미를 사용 가능하고 검색 가능한 도서관으로 바꾸는 다리이며, 수십 년의 작업을 절약하고 역사를 모든 사람이 접근할 수 있게 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.