Integrating knowledge graphs and multilingual scholarly corpora for domain-adaptive LLMs in SSH
이 논문은 지식 그래프와 다국어 코퍼스를 통합함으로써 사회과학 및 인문학 연구를 위해 파운데이션 모델을 적응시키고, 학술적 과업에 대한 신뢰할 수 있고 윤리적으로 준수되며 도메인 민감한 AI 지원을 보장하기 위해 엄격한 정량적 및 정성적 평가 프레임워크를 채택하는 LLMs4EU 프로젝트 및 ALT-EDIC 인프라 내의 진행 중인 이니셔티브를 개설합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
개요: 인문학자처럼 읽도록 AI를 가르치기
당신에게 인터넷에 있는 거의 모든 것을 읽은 아주 똑똑한 로봇 사서(거대 언어 모델, 즉 LLM)가 있다고 상상해 보세요. 이 로봇은 과학, 수학, 영어 뉴스에 관한 질문에는 대답을 아주 잘합니다. 하지만 만약 당신이 프랑스어나 이탈리아어로 된 역사, 철학, 문학에 대해 묻는다면, 이 로봇은 종종 틀린 답을 내놓곤 합니다. 로봇은 책을 무시하고 영어 저널 논문에만 집중하며, 인간 학자들이 실제로 사고하는 깊고 복잡하며 해석적인 방식을 놓치는 경경향이 있습니다.
이 논문은 이러한 문제를 해결하고자 하는 ReSearch_SSH(더 큰 유럽 이니셔티브인 LLMs4EU의 일부)라는 프로젝트를 설명합니다. 목표는 그 "일반적인" 로봇 사서에게 **사회과학 및 인문학(SSH)**을 구체적으로 이해하도록 훈련시키는 것입니다. 그들은 다양한 언어를 존중하고, 책이 저널 논문만큼 중요하다는 것을 이해하며, 동일한 텍스트라도 읽는 사람에 따라 다양하게 해석될 수 있음을 아는 AI를 만들고자 합니다.
문제점: "하나의 사이즈로 모두를 맞추려는" 함정
현재 대부분의 연구용 AI 도구는 세계의 일반적인 지도와 같습니다. 이 지도는 주로 영어로 그려져 있으며, 가장 큰 도시들(주요 저널)만을 강조합니다. 만약 당신이 이 지도를 가지고 이탈리아의 작은 마을이나 프랑스의 특정 역사적 논쟁을 탐색하려 한다면, 길을 잃게 될 것입니다.
저자들은 이것이 중립적이지 않다고 주장합니다. 이 방식은 다른 언어로 작업하거나 오래된 필사본, 디지털 블로그, 또는 지역사를 연구하는 학자들을 소외시킵니다. 또한 모든 사람이 인문학자(맥락, 뉘앙스, 다양한 관점을 찾는 사람)가 아닌 "경성 과학자"(단순한 사실과 인용만을 찾는 사람)처럼 생각하도록 강요합니다.
해결책: 특화된 도구 모음
팀은 처음부터 새로운 검색 엔진을 만드는 대신, ISIDORE라는 기존의 프랑스 연구 플랫폼을 업그레이드하고 있습니다. ISIDORE를 거대하고 잘 정리된 도서관 지하 창고라고 생각해 보세요. 연구팀은 그 안에 새로운 "스마트 비서"를 설치하고 있습니다.
그들은 다음 세 가지 주요 도구를 사용하여 이를 구축하고 있습니다.
1. "특화된 독서 목록" (데이터)
미국 레시피만 주면서 요리사에게 프랑스 요리를 가르칠 수는 없습니다. AI를 훈련시키기 위해, 그들은 사회과학 및 인문학 텍스트로 구성된 거대하고 엄선된 식단을 제공합니다.
- 메뉴: 그들은 ISTEX라는 데이터베이스에서 약 300만 개의 문서를 사용합니다. 여기에는 60개 이상의 언어로 된 책, 논문, 데이터가 포함되어 있지만, 프랑스어와 영어가 주 메뉴입니다.
- 사이드 디쉬: AI가 디지털 인문학의 특정 전문 용어를 이해할 수 있도록, 이탈리아 컨퍼rence 논문과 전문 저널을 추가하고 있습니다.
- 목표: 이를 통해 AI가 단순히 인터넷의 "방언"이 아니라, 학자들의 특정한 "방언"을 배우도록 보장합니다.
2. "사실 확인 지도" (지식 그래프)
이것이 가장 중요한 부분입니다. 일반적인 AI는 패턴에 기반해 추측하기 때문에 흔히 "환각(hallucination)" 현상(가짜 정보를 만들어내는 것)을 일으킵니다. 이 프로젝트는 거대한, 서로 연결된 사실의 웹인 **지식 그래프(Knowledge Graph)**를 사용합니다.
- 비유: AI가 투어 가이드라고 상상해 보세요. 일반적인 AI는 랜드마크가 어디에 있는지 추측할 수 있습니다. 하지만 이 AI는 저자와 그들의 저서, 책과 그 주제, 그리고 주제와 역사적 사건을 연결하는 상세한 지도(Wikidata 및 기타 그래프)를 들고 있습니다.
- 작동 방식: AI가 질문에 답할 때, 단순히 추측하는 것이 아니라 지도를 보고 특정 문서의 정확한 페이지를 찾아내어 "나는 이 답변을 이 특정 문서에서 찾았습니다"라고 말합니다. 이 방식은 답변을 추적 가능하고 신뢰할 수 있게 만듭니다.
3. "인간 피드백 루프" (평가)
팀은 단순히 컴퓨터 점수로 AI를 테스트하는 것이 아니라, 실제 인간 전문가를 통해 테스트합니다.
- 패널: 그들은 프랑스와 이탈리아의 디지털 인문학 학자 그룹을 구성했습니다.
- 테스트: 이 전문가들은 AI에게 복잡한 질문을 던지고, 그 답변이 실제 연구 맥락에서 타당한지 확인합니다. 그들은 다음과 같은 점을 체크합니다: "이 답변이 실제로 역사학자에게 유용한가? 결정적인 뉘앙스를 놓치지는 않았는가?"
- 결과: 만약 AI가 실패하면, 전문가들은 그 이유를 알려주고 AI는 인간 학자처럼 생각하는 법을 배웁니다.
게임의 규칙 (법률 및 윤리)
이 논문은 이것이 "무법지대"에서의 실험이 아님을 강조합니다. 그들은 엄격한 법적 프레임워크(EU AI 법 및 GDPR 등) 안에서 이를 구축하고 있습니다.
- 무분별한 추측 금지: AI는 의사 결정자가 아닌 "연구 보조원"으로 설계되었습니다. AI는 제안할 뿐, 결정은 인간이 합니다.
- 개인정보 보호: 개인을 프로파일링하기 위해 개인 데이터를 사용하는 것을 주의합니다.
- 저작권: 그들은 사용하는 책들의 규칙을 준-수합니다. 단순히 콘텐츠를 훔치는 것이 아니라, 라이선스가 있는 데이터를 사용하며 AI가 원본 출처를 명시하여 저자들이 공로를 인정받을 수 있도록 합니다.
현재 진행 상황
이 프로젝트는 현재 준비 단계에 있습니다.
- 그들은 데이터(재료)를 수집하고 정제하고 있습니다.
- 법적, 윤리적 규칙(주방 안전 수칙)을 설정하고 있습니다.
- 이제 막 이 특정 데이터에 대한 첫 번째 모델 훈련을 시작하려 하고 있습니다.
핵심 요약
이 논문은 단순히 인간처럼 "말하는" 것이 아니라, 학자처럼 "생각하는" AI를 만들기 위한 청사진입니다. 특화된 도서관, 사실 확인 지도, 그리고 인간 전문가 팀을 결려함으로써, 그들은 연구자들이 인문학을 특별하게 만드는 뉘앙스, 언어, 윤리를 잃지 않으면서 새로운 아이디어를 발견할 수 있도록 돕는 도구를 만들고자 합니다. 이는 AI가 학자에게 맞춰 변화하도록 강요하는 것이 아니라, AI가 학자를 보조하게 만드는 것에 관한 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.