← नवीनतम पेपर
💬 NLP

SciDataSailor: Deep Scientific Data Exploring

यह शोध पत्र SciDataSailor प्रस्तुत करता है, जो एक ऐसा ढांचा है जो गहरे वैज्ञानिक डेटा अन्वेषण के लिए टूल-इंटरैक्टिव प्रक्षेप पथों (trajectories) को संश्लेषित करने के लिए मोंटे कार्लो ट्री सर्च (Monte Carlo Tree Search) का लाभ उठाता है, जिसके साथ एक फाइन-ट्यूनिंग डेटासेट और एक बेंचमार्क भी दिया गया है ताकि एजेंटों की जटिल, पदानुक्रमित वैज्ञानिक रिपॉजिटरीज़ में नेविगेट करने और डोमेन-विशिष्ट प्रश्नों के उत्तर देने की क्षमता का मूल्यांकन किया जा सके।

मूल लेखक: Jiyong Rao, Yicheng Qiu, Chi Zhang, Chunfeng Song, Runkai Zhao

प्रकाशित 2026-07-31
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiyong Rao, Yicheng Qiu, Chi Zhang, Chunfeng Song, Runkai Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे एक जासूस हैं, लेकिन सबूत किसी एक अपराध स्थल पर नहीं, बल्कि लाखों बक्सों से भरे एक विशाल, धूल भरे गोदाम में बिखरे हुए हैं। कुछ बक्से बंद हैं, कुछ कोड में लिखे गए हैं, और कुछ में ऐसी पहेलियाँ हैं जिनका अर्थ तभी समझ आता है जब आप एक साथ तीन अलग-अलग बक्सों को खोलते हैं। यह "वैज्ञानिक डेटा" के साथ काम करने वाले वैज्ञानिकों की दैनिक वास्तविकता है। एक साधारण कहानी की तरह, जिसे आप किताब में पढ़ सकते हैं, वैज्ञानिक डेटा विशाल, अव्यवढ़ डिजिटल फोल्डरों में रहता जिसमें कच्चे नंबरों से लेकर अजीब फ़ाइल स्वरूपों, छिपे हुए नोट्स और जटिल चार्ट तक सब कुछ शामिल होता है। सच्चाई खोजने के लिए, एक शोधकर्ता को यह जानना होगा कि कौन सा बॉक्स खोलना है, उसके अंदर के कोड को कैसे पढ़ना है, और उन फाइलों के बीच संबंध कैसे बनाना है जो दिखने में बिल्कुल अलग हैं। यह एक ऐसा काम है जिसके लिए आमतौर पर वर्षों के प्रशिक्षण वाले मानव विशेषज्ञ की आवश्यकता होती है, क्योंकि यदि आप गलत बॉक्स खोलते हैं या किसी संख्या को गलत पढ़ लेते हैं, तो आपका पूरा सिद्धांत ही ढह सकता है।

हाल ही में, हमने कंप्यूटरों को एक नई महाशक्ति दी है: "AI एजेंट"। इन्हें डिजिटल जासूसों के रूप में सोचें जो इंसान की तरह पढ़, तर्क और उपकरणों का उपयोग कर सकते हैं। वे इंटरनेट खोजने या किसी पाठ्यपुस्तक से प्रश्न पूछने में माहिर हैं। लेकिन एक पेच है: अधिकांश AI जासूसों को कभी भी एक वास्तविक, अस्त-व्यस्त वैज्ञानिक गोदाम में जाने के लिए प्रशिक्षित नहीं किया गया है। वे साफ-सुथरी, व्यवस्थित पुस्तकालयों के लिए बने हैं, न कि उन जटिल, परस्पर निर्भर फ़ाइल प्रणालियों के लिए जहाँ वास्तविक विज्ञान होता है। बड़ा सवाल जो वैज्ञानिक पूछ रहे हैं वह यह है: क्या हम इन AI एजेंटों को वास्तव में वास्तविक डेटा की खोज करना, यह समझना कि इसके अंदर क्या है, आवश्यक गणित चलाना और केवल उसी के आधार पर निष्कर्ष निकालना सिखा सकते हैं जो उन्हें मिलता है, बिना अपनी ओर से कुछ मनगढ़ंत बनाए?

यही वह विषय है जिसे "SciDataSailor" संबोधित करता है। लेखक AI एजेंटों को विशेषज्ञ डेटा खोजकर्ता बनने के लिए प्रशिक्षित करने का एक नया तरीका पेश करते हैं। उन्होंने महसूस किया कि AI को एक जटिल वैज्ञानिक गोदाम में नेविगेट करना सिखाने के लिए, आप उसे केवल प्रश्नों और उत्तरों की सूची नहीं दे सकते। आपको उसे वह यात्रा दिखानी होगी—फ़ाइल खोलने, उसका प्रारूप जांचने, गणना चलाने और यह महसूस करने के चरण, जैसे, "ओह, यह फ़ाइल उस दूसरी फ़ाइल से मेल नहीं खाती, मुझे दूसरा रास्ता आज़माना होगा।" इसे करने के लिए, उन्होंने SciDataSailor नामक एक फ्रेमवर्क बनाया। कल्पना कीजिए कि एक मास्टर कोच है जो न केवल छात्र को उत्तर बताता है, बल्कि हजारों अलग-अलग अन्वेषण पथों का अनुकरण करता है। वह कोच एक स्मार्ट खोज पद्धति (जिसे मोंटे कार्लो ट्री सर्च कहा जाता है) का उपयोग करके विभिन्न रणनीतियों को आज़माता है: "क्या होगा यदि हम पहले फ़ाइल के आकार की जाँच करें?" या "क्या होगा यदि हम डेटा से पहले मेटाडेटा को देखें?" कोच उन रास्तों को पुरस्कृत करता है जो वास्तविक साक्ष्य पाते हैं और उन्हें खारिज कर देता है जो गलत रास्तों पर ले जाते हैं या तथ्य गढ़ते हैं।

इस "कोच" का उपयोग करके, टीम ने दो प्रमुख उपकरण बनाए। पहला, उन्होंने SciDataSailor-SFT-2K नामक एक विशाल प्रशिक्षण सेट बनाया, जिसमें 2,000 से अधिक सत्यापित "अन्वेषण कहानियाँ" हैं जहाँ एक AI ने सफलतापूर्वक एक डेटासेट को नेविगेट किया। दूसरा, उन्होंने SciDataSailor-Bench नामक एक परीक्षण क्षेत्र बनाया, जिसमें जीव विज्ञान, पृथ्वी विज्ञान और भौतिकी के वास्तविक डेटासेट पर आधारित 627 कार्य (डेटा का सारांश देने के लिए) और 586 प्रश्न (उत्तर देने के लिए) शामिल हैं। जब उन्होंने अपने प्रशिक्षित AI (एक छोटे, ओपन-सोर्स मॉडल) का इन चुनौतियों के विरुद्ध परीक्षण किया, तो परिणाम आश्चर्यजनक थे। प्रशिक्षण से पहले, AI एक ऐसे जासूस की तरह था जो बार-बार गलत दरवाजों पर दस्तक देता रहता था, भ्रमित हो जाता था और समय समाप्त होने की कगार पर पहुँच जाता था। SciDataSailor पद्धति के साथ प्रशिक्षित होने के बाद, वही AI बहुत अधिक सटीक हो गया। इसने कम चरणों में समस्याओं को हल करना शुरू कर दिया, कम गलतियाँ कीं, और वास्तव में सही उत्तर अधिक बार खोज पाया।

यह शोध पत्र विभिन्न प्रकार के AI के बीच एक दिलचस्प अंतर को भी उजागर करता है। "बड़े नाम" वाले प्रोप्राइटरी मॉडल (महंगे, क्लोज्ड-सोर्स वाले) पहले से ही काफी अच्छे थे, जो अनुभवी जासूसों की तरह व्यवहार कर रहे थे जो गोदाम के लेआउट को सहजता से जानते थे। हालाँकि, छोटे, ओपन-सोर्स मॉडल (जिन्हें कोई भी डाउनलोड कर सकता है) संघर्ष कर रहे थे, अक्सर परीक्षण और त्रुटि (trial and error) के चक्रों में फंस जाते थे। लेकिन सबसे रोमांचक बात यह है: एक बार जब छोटे मॉडल को SciDataSciSailor डेटा पर प्रशिक्षित किया गया, तो उन्होंने उस अंतर को काफी हद तक पाट दिया। उन्होंने कुशल होना सीख लिया, अपना "परीक्षण और त्रुटि" वाला व्यवहार रोका और सीधे साक्ष्य की ओर बढ़ना शुरू किया। लेखक सुझाव देते हैं कि जबकि ये AI एजेंट बेहतर हो रहे हैं, उन्हें वास्तविक दुनिया की जटिलताओं को संभालने के लिए इस तरह के विशिष्ट, साक्ष्य-आधारित प्रशिक्षण की अभी भी आवश्यकता है। वे अब केवल अनुमान नहीं लगा रहे हैं; वे डेटा के माध्यम से सफलतापूर्वक आगे बढ़ना सीख रहे हैं, एक सत्यापित कदम के बाद दूसरा कदम।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →