← नवीनतम पेपर
🔭 astrophysics

More than half of recent astronomy papers are written with language-model assistance

2,00,000 से अधिक खगोल विज्ञान के शोध पत्रों के एक पदानुक्रमित बेयसियन विश्लेषण (hierarchical Bayesian analysis) से पता चलता है कि आधे से अधिक हालिया astro-ph पांडुलिपियों में भाषा मॉडल सहायता के भाषाई निशान दिखाई देते हैं, जो उन 1% से भी कम शोध पत्रों की संख्या से कहीं अधिक है जिन्होंने स्पष्ट रूप से ऐसे उपयोग का खुलासा किया है।

मूल लेखक: Serat M. Saad, Yuan-Sen Ting

प्रकाशित 2026-09-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Serat M. Saad, Yuan-Sen Ting

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

खगोल विज्ञान की शांत, डेटा-प्रधान दुनिया में, वैज्ञानिक अपना दिन दूर के सितारों और आकाशगंगाओं से आने वाले प्रकाश को ब्रह्मांड की कहानियों में अनुवाद करने में बिताते हैं। दशकों से, इन खोजों की लिखित भाषा एक सख्त, तकनीकी बोली रही है, जो अलंकरणों से मुक्त और पूरी तरह से सटीकता पर केंद्रित रही है। लेकिन 2022 के अंत में, एक नया उपकरण दृश्य में आया: उन्नत कंप्यूटर प्रोग्राम जो प्रवाहपूर्ण, मानव-समान पाठ लिखने में सक्षम हैं। ये उपकरण, जिन्हें भाषा मॉडल (लैंग्वेज मॉडल्स) के रूप में जाना जाता है, शोध पत्रों का मसौदा तैयार करने, व्याकरण की जाँच करने और जटिल विचारों को व्यवस्थित करने में मदद करने के लिए तेजी से लोकप्रिय हो गए। जल्द ही यह प्रश्न उठ खड़ा हुआ कि क्या ये उपकरण उपयोग किए जा रहे हैं, बल्कि यह कि उनका प्रभाव कितना व्यापक हो गया है। यदि किसी कंप्यूटर ने वैज्ञानिक पेपर लिखने में मदद की, तो क्या वह पाठ अलग दिखेगा? क्या उसमें एक सूक्ष्म उंगलियों के निशान (फिंगरप्रिंट), शब्दों का एक विशिष्ट सेट होगा जिसे एक मानव लेखक शायद ही कभी चुनता लेकिन एक मशीन पसंद करती है?

द ओहियो स्टेट यूनिवर्सिटी और मैक्स प्लैंक इंस्टीट्यूट फॉर एस्ट्रोनॉमी की एक टीम ने साहित्य में वास्तविक शब्दों को देखकर इस उत्तर को खोजने का प्रयास किया। उन्होंने 2015 और मध्य-2026 के बीच प्रस्तुत 2,00,000 से अधिक खगोल विज्ञान संबंधी शोध पत्रों के पूर्ण पाठ का विश्लेषण किया। उनका लक्ष्य यह गिनना था कि इनमें से कितने दस्तावेजों में कंप्यूटर की सहायता के संकेत दिखाई देते हैं। उन्होंने शब्दों की एक विशिष्ट सूची पर ध्यान केंद्रित किया जो मशीन-जनित पाठ में आम हो गए थे, जैसे कि "delve" (गहराई से उतरना), "underscore" (रेखांकित करना), "intricate" (जटिल), और "pivotal" (महत्वपूर्ण)। ये "redshift" या "supernova" जैसे तकनीकी शब्द नहीं हैं; ये शैलीगत विकल्प हैं, ऐसे शब्द जो वाक्य में एक निश्चित लय जोड़ते हैं। इन कंप्यूटर उपकरणों के उदय से पहले, खगोलशास्त्री इन शब्दों का बहुत कम उपयोग करते थे। शोधकर्ता जानना चाहते थे कि हाल के शोध पत्रों में इन शब्दों का अचानक आगमन क्या यह दर्शाता है कि पेपर कंप्यूटर की मदद से लिखे जा रहे हैं।

एक स्पष्ट तस्वीर पाने के लिए, टीम ने केवल शब्दों को नहीं गिना; बल्कि उन्होंने शोर से संकेत (सिग्नल) को अलग करने के लिए एक परिष्कृत सांख्यिकीय मॉडल बनाया। वे जानते थे कि भाषा समय के साथ बदलती है, और कुछ शब्द कंप्यूटर के उपयोग के अलावा अन्य कारणों से भी लोकप्रिय हो सकते हैं। इसे ध्यान में रखते हुए, उन्होंने उन शोध पत्रों में इन शब्दों के उपयोग को देखा जो 2020 से पहले लिखे गए थे, जो कि इन उपकरणों के व्यापक रूप से उपलब्ध होने से पहले का समय था। इसने उन्हें एक आधार रेखा (बेसलाइन) दी कि एक मानव खगोलशास्त्री स्वाभाविक रूप से इन शब्दों का कितनी बार उपयोग करेगा। फिर उन्होंने इस आधार रेखा की तुलना 2022 के बाद लिखे गए शोध पत्रों से की। महत्वपूर्ण रूप से, उन्होंने उन बहुत कम शोध पत्रों को भी देखा जहाँ लेखकों ने स्पष्ट रूप से भाषा मॉडल के उपयोग को स्वीकार किया था। ये स्वीकृत पत्र एक अंशांकन बिंदु (कैलिब्रेशन पॉइंट) के रूप में कार्य करते थे, एक ज्ञात संदर्भ जो टीम को यह समझने में मदद करता था कि डेटा में एक "कंप्यूटर-सहायता प्राप्त" पेपर वास्तव में कैसा दिखता है।

परिणाम चौंकाने वाले थे। 2025 तक, शोधकर्ताओं ने अनुमान लगाया कि सभी नए खगोल विज्ञान शोध पत्रों में से आधे से अधिक में भाषा-मॉडल सहायता के निशान मौजूद हैं। विशेष रूप से, उन्होंने गणना की कि 54 प्रतिशत शोध पत्रों में कंप्यूटर की मदद के अनुरूप शब्दावली का पैटर्न था, जिसमें त्रुटि की गुंजाइश इतनी थी कि सबसे रूढ़िवादी धारणाओं के तहत भी यह आंकड़ा 36 प्रतिशत से ऊपर बना रहा। यह संख्या तेजी से बढ़ रही है; 2024 में, यह आंकड़ा लगभग 20 प्रतिशत था, और 2026 के पहले भाग तक, यह बढ़कर लगभग 87 प्रतिशत हो गया। यह सुझाव देता है कि इन उपकरणों का उपयोग एक दुर्लभ प्रयोग से बदलकर अधिकांश खगोलशास्त्रियों के लेखन की प्रक्रिया का एक मानक हिस्सा बन गया है।

हालाँकि, यह कहानी केवल शोध पत्रों की गिनती से कहीं अधिक जटिल है। शोधकर्ताओं ने पाया कि कंप्यूटर का "फिंगरप्रिंट" अब देखना कठिन होता जा रहा है। 2023 के शुरुआती दिनों में, इन उपकरणों का उपयोग करने वाले शोध पत्रों में विशिष्ट मार्कर शब्दों की बहुत अधिक अधिकता थी—एक मानव-लिखित पेपर की तुलना में लगभग 3.5 गुना अधिक। 2026 तक, वह अधिकता घटकर आधार रेखा का केवल 1.5 गुना रह गई। ऐसा इसलिए हुआ क्योंकि लेखकों ने अनुकूलन करना शुरू कर दिया। जैसे-जैसे "delve" जैसे विशिष्ट शब्द कंप्यूटर के उपयोग के संकेत के रूप में प्रसिद्ध हुए, लेखकों ने उनका इतना अधिक उपयोग करना बंद कर दिया, या उन्हें संपादित कर दिया, जिससे कंप्यूटर का हाथ कम स्पष्ट हो गया। उपकरण अभी भी उपयोग किए जा रहे हैं, लेकिन वे अधिक सूक्ष्म होते जा रहे हैं, मानव लेखन शैलियों के साथ अधिक स्वाभाविक रूप से घुल-मिल रहे हैं।

शायद सबसे उल्लेखनीय निष्कर्ष वह अंतर है जो जो हो रहा है और जो कहा जा रहा है, उसके बीच है। जबकि शोधकर्ताओं का अनुमान है कि 2025 में 54 प्रतिशत शोध पत्र सहायता प्राप्त थे, केवल 0.81 प्रतिशत शोध पत्रों में औपचारिक घोषणा शामिल थी कि एक कंप्यूटर का उपयोग किया गया था। दूसरे शब्दों में, प्रत्येक एक शोध पत्र के लिए जहाँ एक लेखक ने उपकरण के उपयोग को स्वीकार किया, वहाँ लगभग 66 ऐसे शोध पत्र थे जिन्होंने समान भाषाई निशान दिखाए लेकिन कुछ भी नहीं कहा। शोधकर्ताओं ने अपने पता लगाने के तरीकों की सावधानीपूर्वक जाँच की और पाया कि वे घोषणाओं को बहुत अधिक मिस नहीं कर रहे हैं; चुप्पी वास्तविक प्रतीत होती है। जिन लेखकों ने भी अपनी बात रखी, उनमें से अधिकांश ने कहा कि उन्होंने व्याकरण, स्पष्टता या भाषा संपादन के लिए इन उपकरणों का उपयोग किया, ऐसे कार्य जिन्हें कई जर्नल पहले से ही अनुमति देते हैं। घोषणा की कमी का कारण कदाचित कदाचार को छिपाने का प्रयास नहीं, बल्कि एक कलंक (स्टिग्मा) से बचने की इच्छा है, क्योंकि वैज्ञानिक समुदाय अभी तक इस पर सहमत नहीं हुआ है कि इन उपकरणों का उपयोग स्वीकार्य है या नहीं।

अध्ययन निष्कर्ष निकालता है कि वैज्ञानिक लेखन का परिदृश्य मौलिक रूप से बदल गया है। उपकरण अब कोई नवीनता नहीं हैं; वे खगोल विज्ञान के शोध पत्रों के उत्पादन में एक प्रमुख शक्ति हैं। शोधकर्ता नोट करते हैं कि यह बदलाव आवश्यक रूप से अखंडता की विफलता नहीं है, बल्कि अभ्यास में एक परिवर्तन है जिसके साथ समुदाय अभी तक तालमेल नहीं बिठा पाया है। जैसे-जैसे इन उपकरणों के भाषाई निशान धुंधले होते जा रहे हैं और पहचानना कठिन होता जा रहा है, उनके प्रभाव को मापने का अवसर समाप्त हो रहा है। लेखक सुझाव देते हैं कि सबसे तात्कालिक कदम उपकरणों को प्रतिबंधित करना या मिटते हुए संकेत का पीछा करना नहीं है, बल्कि प्रकटीकरण (डिस्क्लोजर) का एक स्पष्ट मानदंड स्थापित करना है। यदि लेखक केवल यह बता दें कि उन्होंने इन सहायकों का उपयोग किया है, तो क्षेत्र बिना छिपी हुई सहायता के भ्रम के आगे बढ़ सकता है, और इस अभ्यास को, जो वर्तमान में अनदेखा किया जा रहा है, खुले रूप से समझ में आने वाली प्रक्रिया में बदल सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →