← नवीनतम पेपर
💻 computer science

Computer-generated content and the AI/ML retraction record, 2018– 2026: a characterization study

2018 से 2026 तक के 13,502 AI/ML-संबंधित शोध-पत्र वापसी (रिट्रैक्शन) रिकॉर्ड्स का यह अभिलक्षण अध्ययन (characterization study) प्रकट करता है कि कंप्यूटर-जनित सामग्री शोध-पत्र वापसी का सबसे बड़ा एकल अनुमानित कारण है, जो 34.8% मामलों के लिए उत्तरदायी है और मुख्य रूप से 2021 और 2023 के बीच प्रकाशित शोध-पत्रों को प्रभावित करता है।

मूल लेखक: Anton Sokolov

प्रकाशित 2026-06-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anton Sokolov

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

वैज्ञानिक प्रकाशन की दुनिया की कल्पना एक विशाल, हलचल भरे पुस्तकालय के रूप में करें। वर्षों से, पुस्तकालयाध्यक्ष (संपादक और सहकर्मी समीक्षक) किताबों को शेल्फ पर रखने से पहले उनकी जाँच करते रहे हैं ताकि यह सुनिश्चित हो सके कि कहानियाँ सच हैं और लेखकों ने स्वयं ही काम किया है।

यह शोध पत्र उस पुस्तकालय के "वापस भेजने वाले" (रिटर्न टू सेंडर) ढेर की एक रिपोर्ट कार्ड की तरह है, जो 2018 और 2026 के बीच का है। विशेष रूप से, यह आर्टिफिशियल इंटेलिजेंस (AI) और मशीन लर्निंग के लिए समर्पित खंड की जांच करता है।

यहाँ कहानी है कि लेखक, एंटोन सोकोलोव (Anton Sokolov) ने क्या पाया, जिसे सरल भाषा में समझाया गया है:

1. नई समस्या: "घोस्ट राइटर्स" (अदृश्य लेखक)

2022 से पहले, यदि इस खंड की कोई किताब वापस आती थी, तो वह आमतौर पर इसलिए होती थी क्योंकि लेखक ने किसी और की कहानी चुराई थी (साहित्यिक चोरी/प्लेजियिज्म), डेटा के बारे में झूठ बोला था, या काम करने के लिए किसी "पेपर मिल" (नकली शोध पत्र बनाने वाली फैक्ट्री) को पैसे दिए थे।

लेकिन 2022 से शुरू होकर, कुछ नया हुआ। लार्ज लैंग्वेज मॉडल्स (जैसे कि वह AI जिससे आप चैट कर सकते हैं) बहुत ही धाराप्रवाह, वैज्ञानिक दिखने वाला टेक्स्ट लिखने में बहुत कुशल हो गए। अचानक, पुस्तकालय में इन "घोस्ट राइटर्स" द्वारा लिखे गए ग्रंथों की बाढ़ आ गई।

इस अध्ययन में AI अनुभाग के 13,502 शोध पत्रों को देखा गया जिन्हें शेल्फ से हटाया गया (रिट्रैक्ट किया गया)। उन्होंने पूछा: ये किताबें वापस क्यों आईं?

2. बड़ी खोज

सबसे आश्चर्यजनक खोज यह है कि इन AI शोध पत्रों को हटाने का नंबर 1 कारण कंप्यूटर-जनित सामग्री (Computer-Generated Content) था।

  • संख्या: हर 100 रिट्रैक्ट किए गए AI शोध पत्रों में से, लगभग 35 विशेष रूप से इसलिए हटाए गए क्योंकि उनका टेक्स्ट AI (जैसे कि चैटबॉट) द्वारा लिखा गया था।
  • तुलना: यह "समझौतापूर्ण सहकर्मी समीक्षा" (22%), "साहित्यिक चोरी" (18%), या "संपादकीय गलतियों" (13%) से अधिक है।

इसे एक बेकरी की तरह समझें। वर्षों तक, ब्रेड फेंकने का मुख्य कारण यह था कि वह जल गई थी या बासी थी। लेकिन अचानक, बेकरी को पता चला कि आटा खुद एक रोबोट द्वारा बनाया गया था जिसे बेकिंग का ज्ञान नहीं था। फेंकने के लिए सबसे आम कारण अब यही बन गया।

3. "प्रिसिजन" फ़िल्टर (सुरक्षा जाल)

लेखक केवल ढीले तौर पर गणना करने के प्रति सावधान थे। उन्होंने निश्चितता के विभिन्न स्तरों के साथ एक "सुरक्षा जाल" बनाया:

  • उच्च प्रिसिजन (High Precision): वे शोध पत्र जहाँ शीर्षक स्पष्ट रूप से "AI" या "मशीन लर्निंग" कहता था। (3,243 शोध पत्र)।
  • व्यापक जाल (Broad Net): वे शोध पत्र जो सामान्य रूप से "कंप्यूटर साइंस" के बारे में थे। (13,502 शोध पत्र)।

यहाँ तक कि केवल "उच्च प्रिसिजन" समूह (जो निश्चित रूप से AI के बारे में थे) को देखने पर भी, 41.8% शोध पत्र AI-जनित टेक्स्ट के कारण हटाए गए थे। इसलिए, यह समस्या केवल ढीले लेबलिंग का परिणाम नहीं है; यह इस विशिष्ट क्षेत्र में एक वास्तविक, प्रमुख मुद्दा है।

4. टाइमलाइन: एक अचानक आई लहर

यह शोध पत्र वर्षों को मौसम की रिपोर्ट की तरह ट्रैक करता है:

  • 2018–2021: AI-जनित शोध पत्रों के पकड़े जाने की संख्या बहुत कम थी।
  • 2022: लहर शुरू हुई।
  • 2023: लहर अपने चरम पर पहुँची। यह एक "सुनामी" वाला वर्ष था, जिसका मुख्य कारण एक प्रमुख प्रकाशक (Hindawi/Wiley) द्वारा बड़े पैमाने पर सफाई करना था, जिसने एक साथ हजारों शोध पत्रों को हटाया।
  • 2024–2025: संख्या शिखर से नीचे गिरी लेकिन 2022 से पहले की तुलना में 10 गुना अधिक बनी रही।

इनमें से अधिकांश खराब शोध पत्र 2021 और 2023 के बीच लिखे और प्रकाशित किए गए थे। उन्हें प्रकाशित होने के एक वर्ष के भीतर ही पकड़ लिया गया था।

5. इसमें कौन शामिल था?

अध्ययन उन प्रकाशकों और पत्रिकाओं को सूचीबद्ध करता है जहाँ सबसे अधिक शोध पत्र हटाए गए।

  • Hindawi (एक प्रकाशक) के पास सबसे अधिक थे, जो इस सूची के सभी रिट्रैक्ट किए गए शोध पत्रों के एक तिहाई से अधिक हिस्से के लिए जिम्मेदार था।
  • हालाँकि, लेखक चेतावनी देते हैं: यह अनिवार्य रूप से "शर्म की सूची" नहीं है। कभी-कभी, एक प्रकाशक के पास बहुत अधिक रिट्रैक्शन इसलिए होते हैं क्योंकि वे सक्रिय रूप से अपनी शेल्फ की सफाई कर रहे हैं और खराब शोध पत्रों को पकड़ रहे हैं, न कि इसलिए कि वे "सबसे बुरे" प्रकाशक हैं। यह एक स्टोर के "रिटर्न्स" काउंटर की तरह है: रिटर्न की उच्च संख्या का मतलब यह हो सकता है कि स्टोर गुणवत्ता के मामले में बहुत सख्त है, न कि केवल यह कि वे खराब उत्पाद बेचते हैं।

6. यह अध्ययन क्या नहीं है

लेखक बहुत स्पष्ट हैं कि यह रिपोर्ट हमें क्या नहीं बताती है:

  • यह हमें यह नहीं बताता कि कितने AI-लिखित शोध पत्र अभी भी शेल्फ पर हैं और अभी तक पकड़े नहीं गए हैं।
  • यह यह साबित नहीं करता कि AI शोधकर्ता "बुरे" लोग हैं।
  • यह यह नहीं कहता कि AI अनुसंधान अन्य क्षेत्रों (जैसे जीव विज्ञान या भौतिकी) की तुलना में अधिक बार विफल होता है। हमारे पास तुलना करने के लिए अभी डेटा नहीं है।

निष्कर्ष (The Bottom Line)

यह शोध पत्र एक "चरित्र चित्रण अध्ययन" (characterization study) है। यह AI शोध पत्रों के "वापस भेजने वाले" बिन का एक स्नैपशॉट लेने जैसा है।

मुख्य बात सरल है: विज्ञान में AI-जनित टेक्स्ट का युग आ गया है, और इसका पहला बड़ा संकेत रिट्रैक्शन (शोध पत्र हटाने) में एक बड़ी उछाल है जहाँ टेक्स्ट स्वयं एक मशीन द्वारा लिखा गया था।

अध्ययन का निष्कर्ष है कि विज्ञान के लिए इसे ठीक करने के लिए, हमें इन रिट्रैक्शन पर स्पष्ट, मशीन-पठनीय लेबल की आवश्यकता है जो कहते हों, "यह AI द्वारा लिखा गया था।" उन स्पष्ट लेबल के बिना, हम समस्या को माप नहीं सकते और न ही इसे ठीक से सुधार सकते हैं। भविष्य के समाधानों के लिए "सब्सट्रेट" (आधार) केवल यह है कि क्या गलत हुआ, उसके ईमानदार और स्पष्ट रिकॉर्ड हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →