Invisible to humans, visible to machines: a preregistered audit of Unicode fidelity across four biomedical bibliographic APIs
이 사전 등록된 감사는 네 개의 주요 생물 의학 서지 API가 PubMed Central의 JATS XML 정답지와 비교했을 때 특히 타이포그래피 구두점과 특수 공백에서 유의미하고 문서화되지 않은 문자 수준의 충실도 손실을 보인다는 사실을 밝혀냈으며, 이는 텍스트 마이닝, 코퍼스 구축 및 LLM 학습에 위험을 초래합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 거대한, 완벽한 디지털 의학 연구 도서관을 구축하려는 사서라고 상상해 보세요. 당신에게는 논문의 요약본(초록)을 가져다주는 네 대의 서로 다른 배달 트럭(API)이 있습니다. 당신은 트럭이 상자를 배달할 때, 그 안의 내용물이 저자가 쓴 것과 정확히 일치한다고 가정합니다.
이 논문은 그 트럭들이 실제로 똑같은 내용물을 배달하고 있는지, 아니면 당신에게 건네주기 전에 몰래 상자 안의 특정 아이템들을 바꿔치기하고 있는지 확인하는 감사 보고서입니다.
다음은 이 연구가 발견한 내용을 쉬운 비유를 들어 설명한 것입니다.
설정: "완벽한 복사본" 테스트
연구진은 마스터 소스(PubMed Central)에서 4,000개의 의학 논문을 가져와 네 개의 주요 배달 서비스인 PubMed, Crossref, OpenAlex, Semantic Scholar에 초록을 보내달라고 요청했습니다. 그런 다음 전달받은 텍스트를 "골드 스탠다드(표준)" 파일과 글자 하나하나 대조하며 비교했습니다.
그들은 단순히 단어가 빠졌는지 혹은 문장이 통째로 사라졌는지를 보려는 것이 아니었습니다. 그들은 특수 문장 부호(예: 화려한 대시나 굴곡진 따옴표), 과학적 기호(예: 그리스 문자나 플러스/마이너스 기호), 그리고 특수한 종류의 공백과 같은 아주 미세하고 눈에 보이지 않는 디테일을 찾고 있었습니다.
핵심 결과: "인간에게는 보이지 않지만, 기계에게는 보이는 것"
가장 중요한 발견은 인간은 차이를 느낄 수 없지만, 컴퓨터는 차이를 알아챈다는 점입니다.
- 인간의 관점: 만약 당신이 PubMed에서 읽은 논문과 Crossref에서 읽은 논문을 비교한다면, 두 논문은 동일해 보입니다. 대시는 대시처럼 보이고, 공백은 공백처럼 보입니다.
- 기계의 관점: 컴퓨터 프로그램(AI나 검색 엔진 등)에게 "화려한 대시"와 "일반 대시"는 완전히 다른 것입니다. 하나는 특수 코드이고, 다른 하나는 기본 코드입니다. 만약 배달 트럭이 이들을 바꾼다면, 컴퓨터는 그것을 아예 다른 단어로 인식하게 됩니다.
두 가지 주요 "누출(Leakage)" 현상
연구 결과, 네 대의 트럭 중 두 대가 특정 유형의 항목들을 체계적으로 유실하거나 변경하고 있다는 사실이 밝혀졌습니다.
1. PubMed 트럭: "플레인 텍스트(Plain-Text)" 정책
- 현상: PubMed는 원본 텍젝트를 공격적으로 "평탄화(flattening)"합니다. 만약 저자가 화려한 굴곡진 따옴표(
')나 특수한 엠 대시(—)를 사용했다면, PubMed는 이를 기본적이고 평범한 버전('또는-)으로 교체합니다. - 비유: 당신이 봉인된 밀랍 인장이 찍힌 편지를 보낸다고 상해 봅시다. 배달 서비스(PubMed)는 그 밀랍 인장을 녹여버리고 대신 평범한 스티커를 붙입니다. 인간 독자에게는 편지의 내용은 여전히 같아 보입니다. 하지만 "밀랍 인장"을 특정 신호로 인식하는 기계에게는, 그 인장이 사라진 것입니다.
- 결과: 이러한 특수 문자가 포함된 거의 모든 초록에서 PubMed는 이를 교체했습니다. 특수 문자가 살아남은 경우는 단 **0.6%**뿐이었습니다.
2. OpenAlex 트럭: "보이지 않는 공백" 문제
- 현상: OpenAlex는 초록을 저장할 때 단어와 그 순서만 유지하고, 단어 사이의 구체적인 "공백"은 버리는 방식으로 저장합니다. 만약 저자가 두 단어를 붙여놓기 위해 "줄 바꿈 없는 공백(non-breaking space)"을 사용했다면, OpenAlex는 이를 일반 공백으로 바꿉니다.
- 비유: 단어들이 퍼즐 조각이라고 상상해 보세요. OpenAlex는 퍼즐을 분해하여 단어들을 가방에 담은 뒤, 표준적인 간격을 두고 다시 쏟아붓습니다. 그 과정에서 두 특정 조각이 특수한 풀로 붙어 있어야 했다는 사실을 기억하지 못합니다.
- 결과: 특수 공백은 0% 생존했습니다. 모든 특수 공백이 일반 공백으로 변했습니다.
좋은 소식: "안전한" 항목들
모든 것이 유실된 것은 아닙니다. 연구진은 다른 두 트럭(Crossref와 Semantic Scholar)은 "중요한" 것들을 매우 조심스럽게 다룬다는 것을 발견했습니다.
- 과학적 기호 및 그리스 문자: 네 대의 트럭 모두 이들을 완벽하게 전달했습니다. 만약 논문에 "베타"(β)나 "플러스 마이너스"(±)가 언급되어 있다면, 모든 트ks가 정확히 그 기호를 전달했습니다.
- 이것이 중요한 이유: 이는 과학적 "의미"는 안전하지만, "스타일"과 "포맷"은 안전하지 않다는 것을 의미합니다.
"빈 상자" 문제 (Crossref)
텍스트를 변경하는 것 외에, 또 다른 주요 문제가 발견되었습니다. 바로 상자 자체가 통째로 누락되는 문제였습니다.
- 문제점: Crossref 트럭은 약 **25%**의 논문에 대해 초록을 가져오지 못했습니다.
- 원인: 이는 Crossref가 텍스트를 잃어버린 것이 아니라, 일부 대형 출판사(Elsevier나 American Chemical Society 등)가 애초에 Crossref에 초록을 제공하지 않았기 때문입니다.
- 비유: 이것은 마치 특정 동네의 택배만 받는 배달 서비스와 같습니다. 만약 당신이 그들이 서비스하지 않는 동네에 살고 있다면, 당신은 택배를 전혀 받지 못하게 됩니다.
왜 이것이 당신에게 중요한가요?
이 논문은 우리가 점점 더 인간이 아닌 기계와 함께 책을 읽고 있다는 점을 강조합니다.
- AI와 연구: 만약 AI가 저자가 AI 글쓰기 도구를 사용했는지 감지하기 위해 특정 "화려한 대시"를 얼마나 자주 사용하는지 세고 있는데, 배달 트럭(PubMed)이 이미 그 대시를 평범한 것으로 바꿔치기했다면, AI는 잘못된 계산을 하게 됩니다. 저자가 그 도구를 사용하지 않았다고 결론 내릴 수도 있는데, 실제로는 사용했을 수도 있기 때문입니다.
- 검색 및 중복 확인: 만약 컴퓨터가 텍스트를 정밀하게 비교하여 중복 논문을 찾으려 할 때, 한 버전에는 화려한 대시가 있고 다른 버전에는 일반 대시가 있다면, 컴퓨터는 두 문서가 서로 다르다고 판단하여 중복을 놓칠 수 있습니다. 우리 눈에는 똑같아 보여도, 컴퓨터에게는 다른 것입니다.
결론
당신이 읽는 의학 초록의 텍스트는 어떤 웹사이트나 도구를 통해 그 정보를 얻느냐에 따라 달라집니다.
- PubMed를 사용한다면, 특수 문장 부호가 평탄화된 "정리된" 버전을 보게 됩니다.
- OpenAlex를 사용한다면, 특수한 공백이 사라진 버전을 보게 됩니다.
- Crossref를 사용한다면, 출판사가 초록을 보내지 않은 경우 초록을 아예 받지 못할 수도 있습니다.
- Semantic Scholar를 사용한다면, 일반적으로 텍och 그대로의 버전을 얻게 됩니다.
이 논문은 이러한 변화가 인간의 눈에는 보이지 않을지라도, 과학 문헌을 읽고, 분석하고, 정리하는 중대한 역할을 수행하는 기계들에게는 거대하고 체계적인 오류가 된다고 결론짓습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.