← नवीनतम पेपर
💬 NLP

Invisible to humans, visible to machines: a preregistered audit of Unicode fidelity across four biomedical bibliographic APIs

यह पूर्व-पंजीकृत ऑडिट प्रकट करता है कि चार प्रमुख बायोमेडिकल बिब्लियोग्राफिक एपीआई (APIs), पबमेड सेंट्रल (PubMed Central) के JATS XML ग्राउंड ट्रुथ की तुलना में, विशेष रूप से टाइपोग्राफिक विराम चिह्नों और विशेष व्हाइटस्पेस (whitespace) के मामले में, महत्वपूर्ण और अघोषित वर्ण-स्तर (character-level) की निष्ठा हानि प्रदर्शित करते हैं, जो टेक्स्ट माइनिंग, कॉर्पस निर्माण और एलएलएम (LLM) प्रशिक्षण के लिए जोखिम उत्पन्न करते हैं।

मूल लेखक: Przemysław Czuma

प्रकाशित 2026-06-25
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Przemysław Czuma

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लाइब्रेरियन हैं जो चिकित्सा अनुसंधान (medical research) का एक विशाल, पूर्ण डिजिटल पुस्तकालय बनाने की कोशिश कर रहे हैं। आपके पास चार अलग-अलग डिलीवरी ट्रक (APIs) हैं जो आपको शोध पत्रों के सारांश (abstracts) ला कर देते हैं। आप यह मान लेते हैं कि जब एक ट्रक एक बॉक्स लेकर आता है, तो उसके अंदर की सामग्री बिल्कुल वही होती है जो लेखक ने लिखी थी।

यह पेपर एक ऑडिट है जो यह जांचता है कि क्या वे ट्रक वास्तव में बॉक्स के अंदर की सामग्री को बिल्कुल वैसा ही पहुंचा रहे हैं, या वे उन्हें सौंपने से पहले चुपचाप कुछ विशिष्ट वस्तुओं को बदल रहे हैं।

यहाँ अध्ययन के निष्कर्षों का विवरण दिया गया, जिसे सरल उपमाओं (analogies) का उपयोग करके समझाया गया है:

सेटअप: "परफेक्ट कॉपी" टेस्ट

शोधकर्ताओं ने एक मास्टर स्रोत (PubMed Central) से 4,000 मेडिकल पेपर लिए और चार प्रमुख डिलीवरी सेवाओं—PubMed, Crossref, OpenAlex, और Semantic Scholar—से उनके एब्स्ट्रैक्ट्स भेजने के लिए कहा। उन्होंने फिर मूल "गोल्ड स्टैंडर्ड" फ़ाइल के साथ अक्षर-दर-अक्षर (character-by-character) डिलीवर किए गए टेक्स्ट की तुलना की।

वे गायब शब्दों या पूरे वाक्यों की तलाश नहीं कर रहे थे। वे सूक्ष्म, अदृश्य विवरणों की तलाश कर रहे थे: विशेष विराम चिह्न (जैसे फैंसी डैश या घुमावदार कोट्स), वैज्ञानिक प्रतीक (जैसे ग्रीक अक्षर या प्लस/माइनस के निशान), और विशेष प्रकार के स्पेस।

बड़ा खुलासा: "इंसानों के लिए अदृश्य, मशीनों के लिए दृश्यमान"

सबसे महत्वपूर्ण निष्कर्ष यह है कि इंसान अंतर नहीं देख सकते, लेकिन कंप्यूटर देख सकते हैं।

  • मानवीय दृष्टिकोण: यदि आप PubMed से एक पेपर पढ़ते हैं और Crossref से एक पेपर पढ़ते हैं, तो वे बिल्कुल एक जैसे दिखते हैं। एक डैश, डैश जैसा दिखता है। एक स्पेस, स्पेस जैसा दिखता है।
  • मशीनी दृष्टिकोण: एक कंप्यूटर प्रोग्राम (जैसे AI या सर्च इंजन) के लिए, एक "फैंसी डैश" और एक "साधारण डैश" पूरी तरह से अलग चीजें हैं। एक एक विशेष कोड है, और दूसरा एक बुनियादी कोड है। यदि डिलीवरी ट्रक उन्हें बदल देता है, तो कंप्यूटर सोचता है कि यह पूरी तरह से एक अलग शब्द है।

दो प्रमुख "लीकेज" (Leakages)

अध्ययन में पाया गया कि चार में से दो ट्रक व्यवस्थित रूप से विशिष्ट प्रकार की वस्तुओं को खो रहे थे या बदल रहे थे:

1. PubMed ट्रक: "प्लेन-टेक्स्ट" नीति

  • क्या हुआ: PubMed मूल टेक्स्ट को लेता है और उसे आक्रामक रूप से "फ्लैटन" (flatten) करता है। यदि लेखक ने एक फैंसी घुमावदार कोट (') या एक विशेष एम-डैश () का उपयोग किया था, तो PubMed उसे एक बुनियादी, साधारण संस्करण (' या -) से बदल देता है।
  • उपमा: कल्पना कीजिए कि आप एक मोम की सील (wax seal) वाला पत्र भेजते हैं। डिलीवरी सेवा (PubMed) उस मोम की सील को हटा देती है और उसकी जगह एक साधारण स्टिकर लगा देती है। मानव पाठक के लिए, पत्र अभी भी वही कहता है। लेकिन एक मशीन के लिए, जो "मोम की सील" को एक विशिष्ट संकेत के रूप में गिनती है, वह सील गायब हो गई है।
  • परिणाम: लगभग हर उस एब्स्ट्रैक्ट में जिसमें ये विशेष वर्ण थे, PubMed ने उन्हें बदल दिया। केवल 0.6% बार ही विशेष वर्ण जीवित बच पाए।

2. OpenAlex ट्रक: "अदृश्य स्पेस" की समस्या

  • क्या हुआ: OpenAlex एब्स्ट्रैक्ट्स को इस तरह से स्टोर करता है कि वह केवल शब्दों और उनके क्रम को रखता है, और उनके बीच के विशिष्ट स्पेस को हटा देता है। यदि किसी लेखक ने एक "नॉन-ब्रेकिंग स्पेस" (एक विशेष स्पेस जो दो शब्दों को आपस में चिपकाए रखता है) का उपयोग किया था, तो OpenAlex उसे एक सामान्य स्पेस में बदल देता है।
  • उपमा: कल्पना कीजिए कि एक पहेली (puzzle) है जहाँ टुकड़े शब्दों के हैं। OpenAlex उस पहेली को अलग करता है, शब्दों को एक बैग में डालता है, और फिर उन्हें मानक स्पेसिंग के साथ वापस निकाल देता है। उसे यह याद नहीं रहता कि दो विशिष्ट टुकड़ों को एक विशेष गोंद से जोड़ा जाना था।
  • परिणाम: 0% विशेष स्पेस जीवित रहे। वे सभी सामान्य स्पेस में बदल दिए गए।

अच्छी खबर: "सुरक्षित" आइटम

सब कुछ खो नहीं गया था। अध्ययन में पाया गया कि अन्य दो ट्रकों (Crossref और Semantic Scholar) ने "महत्वपूर्ण" चीजों के साथ बहुत सावधानी बरती।

  • वैज्ञानिक प्रतीक और ग्रीक अक्षर: चारों ट्रकों ने इन सबको पूरी तरह से सही पहुँचाया। यदि किसी पेपर में "बीटा" (β) या "प्लस या माइनस" (±) का उल्लेख था, तो प्रत्येक ट्रक ने सटीक प्रतीक ही डिलीवर किया।
  • यह क्यों मायने रखता है: इसका मतलब है कि विज्ञान का अर्थ सुरक्षित है, लेकिन उसका स्टाइल और फॉर्मेटिंग सुरक्षित नहीं है।

"गायब बॉक्स" की समस्या (Crossref)

एक अन्य प्रमुख मुद्दा भी पाया गया था, लेकिन यह टेक्स्ट बदलने के बारे में नहीं था; यह पूरी तरह से बॉक्स गायब होने के बारे में था।

  • समस्या: Crossref ट्रक लगभग 25% पेपर्स के लिए एब्स्ट्रैक्ट नहीं लाया।
  • कारण: ऐसा नहीं था कि Crossref ने टेक्स्ट खो दिया; बल्कि कुछ बड़े प्रकाशकों (जैसे Elsevier और American Chemical Society) ने शुरू से ही Cross-ref को एब्स्ट्रैक्ट्स नहीं दिए थे।
  • उपमा: यह एक ऐसी डिलीवरी सेवा की तरह है जो केवल कुछ खास मोहल्लों से ही पैकेज स्वीकार करती है। यदि आप ऐसे मोहल्ले में रहते हैं जहाँ वे सेवा नहीं देते, तो आपको कोई पैकेज नहीं मिलता।

आपको इसकी परवाह क्यों करनी चाहिए?

यह पेपर तर्क देता है कि यह इसलिए मायने रखता है क्योंकि हम अब केवल इंसानों के साथ ही नहीं, बल्कि मशीनों के साथ भी किताबें पढ़ रहे हैं।

  • AI और अनुसंधान: यदि एक AI यह गिनने की कोशिश कर रहा है कि लेखक कितनी बार एक विशिष्ट "फैंसी डैश" का उपयोग करते हैं ताकि यह पता लगाया जा सके कि उन्होंने AI राइटिंग टूल का उपयोग किया है या नहीं, और डिलीवरी ट्रक (PubMed) ने पहले ही उस डैश को एक साधारण डैश में बदल दिया है, तो AI की गिनती गलत हो जाएगी। AI को लग सकता है कि लेखक ने उस टूल का उपयोग नहीं किया, जबकि वास्तव में उन्होंने किया था।
  • खोज और डुप्लिकेट (Search and Duplicates): यदि कोई कंप्यूटर सटीक टेक्स्ट की तुलना करके डुप्लिकेट पेपर खोजने की कोशिश करता है, तो वह इसे मिस कर सकता है यदि एक संस्करण में फैंसी डैश है और दूसरे में साधारण डैश है। वे हमें एक जैसे दिखते हैं, लेकिन कंप्यूटर उन्हें अलग चीज़ मानता है।

निचोड़ (Bottom Line)

आप मेडिकल एब्स्ट्रैक्ट में जो टेक्स्ट पढ़ते हैं, वह पूरी तरह से इस बात पर निर्भर करता है कि आप कौन सी वेबसाइट या टूल का उपयोग कर रहे हैं।

  • यदि आप PubMed का उपयोग करते हैं, तो आपको एक "क्लीन अप" किया हुआ संस्करण मिलता है जहाँ विशेष विराम चिह्नों को साधारण बना दिया गया है।
  • यदि आप OpenAlex का उपयोग करते हैं, तो आपको एक ऐसा संस्करण मिलता है जहाँ विशेष स्पेसिंग खो गई है।
  • यदि आप Crossref का उपयोग करते हैं, तो यदि प्रकाशक ने एब्स्ट्रैक्ट नहीं भेजा है, तो आपको कोई एब्स्ट्रैक्ट नहीं मिलेगा।
  • यदि आप Semantic Scholar का उपयोग करते हैं, तो आपको आमतौर पर टेक्स्ट वैसा ही मिलता है जैसा वह है।

पेपर यह निष्कर्ष निकालता है कि हालांकि ये बदलाव मानवीय आंखों के लिए अदृभ्य हैं, लेकिन वे उन मशीनों के लिए बड़े, व्यवस्थित दोष हैं जो अब वैज्ञानिक साहित्य को पढ़ने, विश्लेषण करने और व्यवस्थित करने का भारी काम कर रही हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →