← नवीनतम पेपर
💬 NLP

CrossTrace: A Cross-Domain Dataset of Grounded Scientific Reasoning Traces for Hypothesis Generation

यह शोध पत्र CrossTrace को प्रस्तुत करता है, जो परिकल्पना सृजन (hypothesis generation) के लिए 1,389 ग्राउंडेड वैज्ञानिक तर्क प्रक्षेप पथों (reasoning traces) का पहला बड़े पैमाने का, क्रॉस-डोमेन डेटासेट है, जो यह प्रदर्शित करता है कि इस बहु-विषयक डेटा पर भाषा मॉडलों को फाइन-ट्यून करने से लगभग पूर्ण तथ्यात्मक सटीकता बनाए रखते हुए तर्क की गुणवत्ता, संरचनात्मक अनुपालन और क्रॉस-डोमेन हस्तांतरणीयता में महत्वपूर्ण सुधार होता है।

मूल लेखक: Andrew Bouras, OMS-II Research Fellow

प्रकाशित 2026-04-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Andrew Bouras, OMS-II Research Fellow

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नई रेसिपी (व्यंजन) बनाने की कोशिश कर रहे हैं। आपके पास सामग्री से भरी एक रसोई है (मौजूदा वैज्ञानिक शोध पत्र), लेकिन आपने पहले कभी खाना नहीं बनाया है। यदि आप केवल सामग्रियों को देखते रहेंगे, तो आप अनुमान लगा सकते हैं, "शायद मुझे आटे और पानी को मिलाना चाहिए?" यह एक अनुमान है, लेकिन यह एक बेहतरीन रेसिपी नहीं है।

अब, एक मास्टर शेफ की कल्पना करें जो आपको केवल अंतिम व्यंजन ही नहीं देता, बल्कि वह बिल्कुल सटीक तरीके से लिखता है कि उसने इसके बारे में कैसे सोचा: "मैंने देखा कि पानी के साथ आटा चिपचिपा हो जाता है, लेकिन अगर मैं इसमें नमक डाल दूँ, तो यह लचीला हो जाता है। चूंकि इस आटे को लचीला होना चाहिए, इसलिए मैं नमक डालूँगा।"

यह पेपर, CrossTrace, कंप्यूटर को वही मास्टर शेफ बनने के बारे में सिखाने के बारे में है।

यहाँ इस पेपर की कहानी है, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. समस्या: विज्ञान का "ब्लैक बॉक्स" (Black Box)

वैज्ञानिक सूचनाओं के बोझ तले दबे हुए हैं। हर साल, लाखों नए शोध पत्र प्रकाशित होते हैं। एक मानव शोधकर्ता केवल उनमें से एक बहुत छोटे हिस्से को ही पढ़ सकता है। वे विभिन्न क्षेत्रों के बीच के कनेक्शन (जैसे कि कैसे कंप्यूटर साइंस की एक तकनीक जीव विज्ञान की समस्या को हल कर सकती है) को मिस कर देते हैं।

आर्टिफिशियल इंटेलिजेंस (AI) को इन नए विचारों (परिकल्पनाओं/hypotheses) को लिखने में मदद करने के लिए प्रशिक्षित किया गया है। लेकिन अधिकांश AI प्रशिक्षण डेटा एक "ब्लैक बॉक्स" की तरह है। आप AI को एक प्रश्न देते हैं, और वह एक उत्तर निकाल देता है। वह अपना काम (process) नहीं दिखाता है। यह उस छात्र की तरह है जो गणित के टेस्ट में सही उत्तर तो प्राप्त करता है लेकिन अपने स्टेप्स (चरण) नहीं दिखाता। हमें नहीं पता कि क्या उसने वास्तव में गणित को समझा या सिर्फ अनुमान लगाया।

इसके अलावा, मौजूदा AI प्रशिक्षण डेटा आमतौर पर एक ही विषय तक सीमित होता है। यदि आप AI को केवल जीव विज्ञान के पेपर पर प्रशिक्षित करते हैं, तो वह कंप्यूटर साइंस में खराब हो जाता है, और इसके विपरीत भी।

2. समाधान: CrossTrace (तर्क की "रेसिपी बुक")

लेखक, एंड्रयू बोरास (Andrew Bouras) ने एक नया डेटासेट बनाया जिसे CrossTrace कहा जाता है। इसे वास्तविक वैज्ञानिक शोध पत्रों से स्टेप-बाय-स्टेप रीजनिंग रेसिपी का एक विशाल पुस्तकालय समझें।

  • इसके अंदर क्या है? 1,389 "ट्रेस" (traces)।
  • ये कहाँ से आए हैं? जीव विज्ञान (Biology) के पेपर, कंप्यूटर साइंस (AI) के पेपर, और वे पेपर जो इन दोनों को मिलाते हैं।
  • सीक्रेट सॉस (Secret Sauce): तर्क का हर एक चरण ग्राउंडेड (grounded) है। इसका मतलब है कि AI द्वारा सीखे गए प्रत्येक तार्किक चरण के लिए, उसे मूल पेपर के उस सटीक वाक्य की ओर इशारा करने के लिए मजबूर किया जाता है जो उसका समर्थन करता है। यह एक ऐसे छात्र की तरह है जिसे अपने होमवर्क के हर एक स्टेप के लिए अपनी पाठ्यपुस्तक का संदर्भ (cite) देना पड़ता है।

उपमा (Analogy):

  • पुराना तरीका: AI एक तोता है। वह उन पैटर्न को दोहराता है जो उसने सुने हैं लेकिन तर्क को नहीं समझता।
  • CrossTrace तरीका: AI एक जासूस है। वह सुरागों (टेक्स्ट) को देखना सीखता है, उन्हें तार्किक रूप से जोड़ता है (ट्रेस), और केस को सुलझाता है (नई परिकल्पना), और यह सब करते हुए अपनी साक्ष्य फ़ाइल (evidence file) खुली रखता है।

3. प्रयोग: क्या विषयों को "मिलाने" से मदद मिलती है?

लेखक जानना चाहते थे: क्या जीव विज्ञान में तर्क करना सीखने से AI को कंप्यूटर साइंस में तर्क करने में मदद मिलती है?

उन्होंने एक स्मार्ट AI मॉडल (Qwen2.5) लिया और उसे तीन अलग-अलग तरीकों से प्रशिक्षित किया:

  1. कंट्रोल ग्रुप (Control Group): कोई प्रशिक्षण नहीं (केवल एक कच्चा AI)।
  2. स्पेशलिस्ट (Specialist): केवल CrossTrace डेटा पर प्रशिक्षित।
  3. जनरलिस्ट (Generalist): जीव विज्ञान, AI और क्रॉस-डोमेन डेटा के संतुलित मिश्रण पर प्रशिक्षित।

परिणाम:

  • संरचना (Structure): कच्चे AI ने अव्यवस्थित, बिना संरचना वाला टेक्स्ट बनाया। प्रशिक्षित AI ने 100% समय सटीक "रेसिपी" फॉर्मेट का पालन किया।
  • गुणवत्ता (Quality): प्रशिक्षित AI के विचार मानव विशेषज्ञों की सोच के बहुत करीब थे।
  • बड़ा सरप्राइज: "जनरलिस्ट" मॉडल (जो विभिन्न विषयों के मिश्रण पर प्रशिक्षित था) ने उन मॉडलों के समान ही प्रदर्शन किया जो केवल एक विशिष्ट विषय पर प्रशिक्षित थे।

4. "अहा!" मोमेंट (Aha! Moment): तर्क एक सार्वभौमिक कौशल है

यह इस पेपर का सबसे महत्वपूर्ण हिस्सा है।

लेखक ने पाया कि वैज्ञानिक तर्क (Scientific reasoning) साइकिल चलाने सीखने जैसा है।

  • इससे कोई फर्क नहीं पड़ता कि आप मिट्टी के रास्ते (जीव विज्ञान) पर साइकिल चला रहे हैं या पक्की सड़क (कंप्यूटर साइंस) पर। संतुलन बनाना, पैडल मारना और स्टीयरिंग करना—यह कौशल एक ही है।
  • AI को जीव विज्ञान के पेपर का उपयोग करके "पैडल मारना" (स्टेप-बाय-स्टेप तर्क करना) सिखाकर, इसने कंप्यूटर साइंस की समस्याओं पर भी "पैडल मारना" सीख लिया।

AI को जीव विज्ञान या कोड के बारे में हर एक तथ्य को याद करने की आवश्यकता नहीं थी। उसे बस सोचने की संरचना (structure of thinking) को समझने की आवश्यकता थी। एक बार जब उसने संरचना सीख ली, तो वह इसे कहीं भी लागू कर सका।

5. क्या मनुष्य सहमत थे?

लेखक ने केवल कंप्यूटर के स्कोर पर भरोसा नहीं किया। उन्होंने तीन मानव विशेषज्ञों (एक डॉक्टर, एक AI शोधकर्ता और एक जीव विज्ञानी) से AI के नए विचारों को बिना यह जाने ग्रेड करने के लिए कहा कि वे विचार किस मॉडल ने बनाए हैं।

  • फैसला: विशेषज्ञों ने AI के विचारों को उपयोगी और वैज्ञानिक रूप से सुदृढ़ होने के लिए उच्च अंक दिए। वे इस बात पर लगभग पूरी तरह से सहमत थे कि तर्क सही था या नहीं।

सारांश: यह क्यों मायने रखता है

यह पेपर साबित करता है कि हमें अलग-अलग "जीव विज्ञान मस्तिष्क" और "कंप्यूटर साइंस मस्तिष्क" बनाने की आवश्यकता नहीं है। हमें बस AI को तार्किक रूप से सोचना सिखाने की आवश्यकता है, और वह भी वास्तविक, सत्यापित उदाहरणों का उपयोग करके।

AI को एक "प्रशिक्षण मैनुअल" देकर जो दिखाता है कि वैज्ञानिक डॉट्स (बिंदुओं) को कैसे जोड़ते हैं (प्रत्येक चरण के लिए साइटेशन के साथ), हम ऐसे स्मार्ट टूल्स बना सकते हैं जो शोधकर्ताओं को नए इलाज, नए एल्गोरिदम और विभिन्न क्षेत्रों के बीच नए कनेक्शन खोजने में पहले से कहीं अधिक तेज़ी से मदद कर सकें।

संक्षेप में: CrossTrace AI को केवल यह नहीं सिखाता कि क्या सोचना है, बल्कि यह भी सिखाता है कि कैसे सोचना है, और यह सच है कि "कैसे सोचना है" हर क्षेत्र में एक जैसा ही होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →