Detecting Evidence of LLM Contributions to Open Access Biomedical Literature: A Bibliometric Analysis
लगभग 30 लाख ओपन-एक्सेस बायोमेडिकल लेखों का यह बिब्लियोमेट्रिक विश्लेषण 2022 के बाद एलएलएम (LLM) से संबंधित शब्दावली में एक महत्वपूर्ण वृद्धि को प्रकट करता है, जो जेनरेटिव एआई उपकरणों के तेजी से होते अपनाव को दर्शाता है और वैज्ञानिक अखंडता को बनाए रखने के लिए पारदर्शिता और पहचान विधियों की तत्काल आवश्यकता पर प्रकाश डालता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
दशकों से, विद्वान अपने लेखन को स्पष्ट बनाने और अपने शोध को अधिक कुशल बनाने के लिए उपकरणों पर निर्भर रहे हैं। स्पेल-चेकर और ग्रामर सॉफ्टवेयर लंबे समय से मानक सहायक रहे हैं, जो लेखक की मूल आवाज़ को बदले बिना त्रुटियों को सुधारते हैं और बेहतर शब्दों के चयन का सुझाव देते हैं। हाल के वर्षों में, इन उपकरणों की एक नई पीढ़ी उभरी है, जो मानव जैसी लगने वाली पूरी पंक्तियाँ (पैराग्राफ) उत्पन्न करने में सक्षम है। ये प्रणालियाँ, जिन्हें लार्ज लैंग्वेज मॉडल्स (large language models) के रूप में जाना जाता है, लिखित सामग्री की विशाल मात्रा पर प्रशिक्षित हैं और लगभग किसी भी विषय पर सुसंगत और परिष्कृत गद्य तैयार कर सकती हैं। जहाँ ये लेखन प्रक्रिया को गति देने का वादा करती हैं, वहीं ये वैज्ञानिक समुदाय के लिए एक कठिन प्रश्न भी खड़ा करती हैं: हम एक मानव शोधकर्ता द्वारा लिखे गए वाक्य और मशीन द्वारा निर्मित वाक्य के बीच अंतर कैसे कर सकते हैं? यह अंतर बहुत गहरा है क्योंकि वैज्ञानिक साहित्य की अखंडता इसके भीतर प्रस्तुत विचारों की प्रमाणिकता और तथ्यों की सटीकता पर निर्भर करती है। यदि नए शोध का एक महत्वपूर्ण हिस्सा इन उपकरणों द्वारा तैयार या अत्यधिक संपादित किया जा रहा है, तो उस ज्ञान को पढ़ने, उस पर विश्वास करने और उस पर आगे निर्माण करने के हमारे तरीके को बदलने की आवश्यकता हो सकती है।
शोधकर्ताओं की एक टीम ने सीधे शब्दों को देखकर इस प्रश्न का उत्तर देने का प्रयास किया। उन्होंने पबमेड सेंट्रल (PubMed Central) नामक एक सार्वजनिक डेटाबेस में उपलब्ध खुले-पहुँच वाले चिकित्सा और जैविक अनुसंधान पत्रों के विशाल संग्रह पर ध्यान केंद्रित किया। इस संग्रह में लाखों लेख शामिल हैं, जो दुनिया भर के वैज्ञानिकों द्वारा अपने कार्य को लिखने के तरीके की एक विशाल खिड़की प्रदान करते हैं। टीम ने यह अनुमान लगाने की कोशिश नहीं की कि कौन से विशिष्ट पेपर मशीनों द्वारा लिखे गए थे, जो कि मनुष्यों और कंप्यूटर प्रोग्रामों दोनों के लिए एक कठिन कार्य सिद्ध हुआ है। इसके बजाय, उन्होंने एक अलग प्रकार के संकेत की तलाश की। उन्होंने परीक्षण किया कि क्या कुछ विशेष शब्द और वाक्यांश, जिन्हें पिछले अध्ययनों में कृत्रिम बुद्धिमत्ता (AI) द्वारा मनुष्यों की तुलना में बहुत अधिक बार उपयोग किए जाने वाले रूप में पाया गया था, क्या 2022 के अंत के बाद वैज्ञानिक साहित्य में अचानक बहुत अधिक सामान्य हो गए थे, जब ये उपकरण जनता के लिए व्यापक रूप से उपलब्ध हुए थे।
शोधकर्ताओं ने 2019 से 2024 के बीच प्रकाशित लगभग तीन मिलियन लेख एकत्र किए। उन्होंने 190 विशिष्ट शब्दों और वाक्यांशों की एक सूची बनाई जिन्हें पहले के शोध में मशीन-जनित पाठ की विशेषता के रूप में चिह्नित किया गया था। इनमें "meticulous" (सूक्ष्म) और "intricate" (जटिल) जैसे विशेषण, "delve" (गहराई से छानना) और "underscore" (रेखांकित करना) जैसे क्रियाएं, और "navigating the complexities of" (जटिलताओं को समझना) या "it is important to note" (यह ध्यान रखना महत्वपूर्ण है) जैसे लंबे वाक्यांश शामिल थे। फिर उन्होंने अपने पूरे डेटासेट में प्रत्येक लेख को यह देखने के लिए स्कैन किया कि ये शब्द कितनी बार दिखाई देते हैं। लक्ष्य यह देखना था कि क्या इन शब्दों की आवृत्ति समय के साथ बदलती है, विशेष रूप से नए AI उपकरणों के जारी होने के बाद उनके उपयोग में आए उछाल को देखना।
परिणामों ने बायोमेडिकल अनुसंधान की भाषा में एक स्पष्ट और नाटकीय बदलाव दिखाया। 2022 से पहले, इन विशिष्ट शब्दों का उपयोग धीरे-धीरे और निरंतर बढ़ रहा था, जो लोगों के लिखने के सामान्य परिवर्तनों के अनुरूप था। हालाँकि, 2023 में शुरू होकर 2024 तक जारी रहते हुए, इनमें से कई शब्दों के उपयोग में विस्फोट हुआ। उदाहरण के लिए, "meticulously" (सूक्ष्मता से) शब्द, जो 2019 में पूरे डेटाबेस में एक हजार से भी कम बार दिखाई दिया था, 2024 में 16,000 से अधिक बार दिखाई दिया। "it's important to note" (यह ध्यान रखना महत्वपूर्ण है) वाक्यांश में भी इसी तरह का उछाल देखा गया, जो 2019 में केवल 29 उदाहरणों से बढ़कर 2024 में लगभग 800 हो गया। शायद सबसे अधिक उल्लेखनीय लंबे, अधिक जटिल वाक्यांश थे। "delving into the intricacies of" (की जटिलताओं में गहराई से उतरना) का संयोजन 2023 से पहले साहित्य में लगभग अस्तित्वहीन था, फिर भी 2024 तक यह दर्जनों लेखों में दिखाई दिया। शोधकर्ताओं ने नोट किया कि ये केवल अलग-थलग शब्द नहीं थे जो लोकप्रिय हो रहे थे; शब्दों के वे विशिष्ट संयोजन जो AI लेखन के लक्षण माने जाते हैं, बढ़ते आवृत्ति के साथ एक साथ दिखाई दे रहे थे।
अध्ययन ने यह भी देखा कि इन शब्दों का एक-दूसरे के साथ संयोजन में कैसे उपयोग किया जा रहा था। उन्होंने पाया कि इन AI-संबंधित शब्दों के जोड़े और समूह एक ही लेख में ऐसी दर से एक साथ दिखाई दे रहे थे जो संयोग से होने की सांख्यिकीय संभावना से कहीं अधिक थी। उदाहरण के लिए, "artificial intelligence" (कृत्रिम बुद्धिमत्ता) और "underscore" (रेखांकित करना) शब्द पहले की तुलना में बहुत अधिक बार एक ही पेपर में एक साथ दिखाई देने लगे। शोधकर्ताओं ने देखा कि ये पैटर्न भाषा की शैली का धीमा विकास नहीं थे, जो कई वर्षों में धीरे-धीरे होता है, बल्कि एक अचानक आया मोड़ (inflection point) था जो ठीक जनरेटिव AI उपकरणों के सार्वजनिक रिलीज के साथ मेल खाता था। हालाँकि यह अध्ययन यह साबित नहीं कर सकता कि कोई भी एकल लेख मशीन द्वारा लिखा गया था, लेकिन इस भाषाई बदलाव का विशाल पैमाना यह सुझाव देता है कि इन उपकरणों का उपयोग क्षेत्र के लेखकों द्वारा व्यापक रूप से किया जा रहा है।
अध्ययन के लेखक इस बात पर जोर देते हैं कि इसका मतलब यह नहीं है कि शोध स्वयं आवश्यक रूप से त्रुटिपूर्ण है, और न ही यह सुझाव देता है कि इन शब्दों का उपयोग करने वाला प्रत्येक पेपर अवास्तविक है। इसके बजाय, निष्कर्ष बताते हैं कि नए लेखन सहायकों का तेजी से और व्यापक रूप से अपनाया जाना, जो वैज्ञानिक संचार की बनावट को बदल रहे हैं। शोधकर्ता तर्क देते हैं कि चूंकि ये उपकरण कभी-कभी गलतियाँ कर सकते हैं या ऐसी सामग्री उत्पन्न कर सकते हैं जिसमें वास्तविक समझ की कमी होती है, इसलिए वैज्ञानिक समुदाय को यह पहचानने का बेहतर तरीका विकसित करने की आवश्यकता है कि इनका उपयोग कब किया जा रहा है। वे सुझाव देते हैं कि इन उपकरणों को प्रतिबंधित करने के बजाय, जो कि संभवतः यहीं रहने के लिए हैं, विद्वानों, संपादकों और समीक्षकों को पारदर्शिता पर ध्यान केंद्रित करना चाहिए। यह स्वीकार करके कि इन उपकरणों का उपयोग कब और कैसे किया गया है, वैज्ञानिक रिकॉर्ड विश्वसनीय बना रह सकता है, भले ही इसे बनाने के तरीके विकसित होते रहें। अध्ययन निष्कर्ष निकालता है कि विज्ञान की भाषा बदल रही है, और इन नए पैटर्न को पहचानना इस बात को समझने की दिशा में पहला कदम है कि कृत्रिम बुद्धिमत्ता ज्ञान साझा करने के हमारे तरीके को कैसे नया आकार दे रही है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।