← नवीनतम पेपर
💬 NLP

PaperSearchQA: Learning to Search and Reason over Scientific Papers with RLVR

यह शोधपत्र PaperSearchQA प्रस्तुत करता है, जो एक ढांचा और डेटासेट है जिसमें 60k चुनौतीपूर्ण बायोमेडिकल QA नमूने और एक 16-मिलियन-एब्स्ट्रैक्ट कॉर्पस शामिल है, जिसे भविष्य के AI साइंटिस्ट सिस्टम की क्षमताओं को आगे बढ़ाने के लिए वैज्ञानिक साहित्य पर प्रभावी ढंग से खोजने और तर्क करने हेतु सत्यापन योग्य पुरस्कारों (RLVR) के साथ सुदृढीकरण लर्निंग एजेंटों (reinforcement learning agents) को प्रशिक्षित करने के लिए डिज़ाइन किया गया है।

मूल लेखक: James Burgess, Jan N. Hansen, Duo Peng, Yuhui Zhang, Alejandro Lozano, Min Woo Sun, Emma Lundberg, Serena Yeung-Levy

प्रकाशित 2026-01-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: James Burgess, Jan N. Hansen, Duo Peng, Yuhui Zhang, Alejandro Lozano, Min Woo Sun, Emma Lundberg, Serena Yeung-Levy

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अविश्वसनीय रूप से जटिल जिगसॉ पहेली (jigsaw puzzle) को हल करने की कोशिश कर रहे हैं, लेकिन पहेली के टुकड़े एक पुस्तकालय की 16 मिलियन अलग-अलग किताबों में बिखरे हुए हैं। आपके पास एक बहुत ही बुद्धिमान, लेकिन थोड़ा भुलक्कड़ सहायक (एक AI) है जो बहुत सी सामान्य बातें जानता है लेकिन उसके दिमाग में आपकी पहेली के विशिष्ट उत्तर नहीं हैं।

यह शोध पत्र उस सहायक को प्रशिक्षित करने का एक नया तरीका पेश करता है ताकि वह एक कुशल "रिसर्च डिटेक्टिव" (अनुसंधान जासूस) बन सके। यहाँ बताया गया है कि उन्होंने क्या किया, सरल उपमाओं का उपयोग करते हुए:

1. समस्या: "बुद्धिमान लेकिन अनभिज्ञ" सहायक

वर्तमान AI सहायक उन प्रतिभाशाली छात्रों की तरह हैं जिन्होंने बहुत सी किताबें पढ़ी हैं लेकिन उन्होंने हर एक तथ्य को याद नहीं किया है। यदि आप उनसे किसी वैज्ञानिक शोध पत्र के बारे में एक विशिष्ट प्रश्न पूछते हैं (जैसे, "इस वायरस का अध्ययन करने के लिए किस विशिष्ट कोशिका प्रकार का उपयोग किया जाता है?"), तो वे अनुमान लगा सकते हैं या गलत जानकारी दे सकते हैं क्योंकि वे सटीक उत्तर नहीं जानते।

पिछले तरीकों ने इन सहायकों को सही उत्तर दिखाकर सिखाने की कोशिश की (जैसे एक शिक्षक होमवर्क ग्रेड करता है)। लेकिन लेखकों ने एक बेहतर तरीका खोजा: वेरिफिएबल रिवॉर्ड्स के साथ रीइन्फोर्समेंट लर्निंग (RLVR)

2. समाधान: "ट्रायल एंड एरर" जिम

हर कदम पर सुधार करने वाले शिक्षक के बजाय, लेखकों ने एक जिम बनाया जहाँ AI खेल खेलकर सीखता है।

  • खेल: AI से एक विशिष्ट प्रश्न पूछा जाता है। उसे सोचना होता है, 16 मिलियन पेपर एब्स्ट्रैक्ट्स (सारांशों) में खोजना होता है, और एक उत्तर देना होता है।
  • स्कोर: AI को केवल तभी "पॉइंट" (रिवॉर्ड) मिलता है जब उसका अंतिम उत्तर बिल्कुल सही होता है। उसे कड़ी मेहनत करने या बीच के चरणों के लिए अंक नहीं मिलते।
  • परिणाम: क्योंकि AI तभी जीतता है जब वह सही उत्तर प्राप्त करता है, इसलिए वह यह सीख जाता है कि कैसे खोज करनी है, बेहतर परिणाम खोजने के लिए अपने प्रश्नों को कैसे फिर से लिखना है, और अपने काम की दोबारा जांच कैसे करनी है। वह सीखता है कि "कार्य करने से पहले सोचना"।

3. टूलकिट: PaperSearchQA

इस जासूस को प्रशिक्षित करने के लिए, टीम ने एक विशाल प्रशिक्षण मैदान बनाया:

  • लाइब्रेरी: उन्होंने बायोमेडिकल पेपर्स के 16 मिलियन सारांश एकत्र किए (जैसे इंडेक्स कार्ड का एक विशाल ढेर)।
  • परीक्षण प्रश्न: उन्होंने 60,000 विशिष्ट प्रश्न बनाए (जैसे "कौन सा जीन इस बीमारी का कारण बनता है?") जिनके पास एक स्पष्ट, तथ्यात्मक उत्तर है। उन्होंने इन प्रश्नों को इतना कठिन बनाया कि AI केवल अनुमान न लगा सके; उसे वास्तव में खोजना ही पड़े।
  • पैराफ्रेसिंग (शब्दों का हेर-फेर) का तरीका: प्रशिक्षण को अधिक कठिन और वास्तविक बनाने के लिए, उन्होंने आधे प्रश्नों को अलग शब्दों का उपयोग करके फिर से लिखा। यह AI को केवल कीवर्ड मिलाने के बजाय प्रश्न के अर्थ को समझने के लिए मजबूर करता है।

4. AI ने क्या सीखा ( "आहा!" क्षण)

जब उन्होंने इस जिम में AI को प्रशिक्षित किया, तो उन्होंने इसकी "सोचने की प्रक्रिया" को देखा और स्वाभाविक रूप से कुछ दिलचस्प व्यवहार उभरते देखे:

  • योजना बनाना (Planning): केवल अनुमान लगाने के बजाय, AI ने समस्या को तोड़ना शुरू कर दिया: "पहले, मुझे मुख्य शब्दों की पहचान करनी होगी। फिर, मैं खोजूँगा। फिर, मैं परिणामों की जाँच करूँगा।"
  • स्व-सत्यापन (Self-Verification): कभी-कभी AI को लगता था कि वह उत्तर जानता है, लेकिन वह अपने काम को दोबारा जांचने के लिए फिर से खोज करता था। उसने सीखा कि भले ही आपको लगता हो कि आप कुछ जानते हैं, लेकिन उसे ढूँढ लेना अधिक सुरक्षित है।
  • तर्क करना (Reasoning): उसने सर्च इंजन खोलने से पहले ही समस्या के बारे में सोचना शुरू कर दिया, अपनी आंतरिक जानकारी का उपयोग करके खोज को निर्देशित किया।

5. परिणाम

टीम ने इस नए "रिसर्च डिटेक्टिव" का पुराने तरीकों के विरुद्ध परीक्षण किया।

  • विजेता: इस "ट्रायल एंड एरर" विधि (RLVR) से प्रशिक्षित AI, उदाहरण द्वारा सिखाए गए AI या बिना सोचे-समझे केवल खोजने वाले AI की तुलना में सही उत्तर खोजने में बहुत बेहतर था।
  • चुनौती: इस प्रशिक्षण के बावजूद, यह कार्य अभी भी बहुत कठिन है। AI ने लगभग 40-45% उत्तर सही दिए, जो यह दर्शाता है कि वैज्ञानिक अनुसंधान एक कठिन काम है, उन्नत AI के लिए भी।

सारांश

संक्षेप में, लेखकों ने AI के लिए एक ट्रेनिंग सिम्युलेटर बनाया। उन्होंने इसे लाखों शोध पत्रों में खोज करने का अभ्यास कराकर और इसे केवल तभी पुरस्कृत करके कि यह तथ्यों को सही ढंग से प्राप्त करे, एक वैज्ञानिक के सहायक के रूप में काम करना सिखाया। AI ने योजना बनाना, खोजना और अपने काम को सत्यापित करना सीखा, जिससे वह विशिष्ट वैज्ञानिक प्रश्नों के उत्तर देने के लिए एक बहुत अधिक विश्वसनीय उपकरण बन गया।

महत्वपूर्ण नोट: यह शोध पत्र पूरी तरह से टेक्स्ट में तथ्य खोजने के लिए AI को प्रशिक्षित करने पर केंद्रित है। यह दावा नहीं करता है कि AI वर्तमान में रोगियों का निदान कर सकता है, वास्तविक प्रयोग चला सकता है, या अस्पताल में मानव वैज्ञानिकों की जगह ले सकता है। यह एक प्रोटोटाइप है जो मनुष्यों को जानकारी तेजी से खोजने में मदद करने वाले उपकरण के रूप में काम करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →