← नवीनतम पेपर
💬 NLP

DeepInnovator: Triggering the Innovative Capabilities of LLMs

यह शोध पत्र DeepInnovator को प्रस्तुत करता है, जो एक प्रशिक्षण ढांचा है जो संरचित वैज्ञानिक ज्ञान निकालने के लिए एक स्वचालित पाइपलाइन और अनुसंधान विचार सृजन को अनुमान और खंडन की एक पुनरावृत्ति प्रक्रिया के रूप में मॉडल करने वाले "नेक्स्ट आइडिया प्रेडिक्शन" प्रतिमान का लाभ उठाकर लार्ज लैंग्वेज मॉडल्स की नवीनता क्षमताओं को बढ़ाता है, जिसके परिणामस्वरूप एक ऐसा मॉडल प्राप्त होता है जो नवीन अनुसंधान विचारों को उत्पन्न करने में बेसलाइन्स से काफी बेहतर प्रदर्शन करता है और अग्रणी एलएलएम (LLMs) को टक्कर देता है।

मूल लेखक: Tianyu Fan, Fengji Zhang, Yuxiang Zheng, Bei Chen, Xinyao Niu, Chengen Huang, Junyang Lin, Chao Huang

प्रकाशित 2026-02-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tianyu Fan, Fengji Zhang, Yuxiang Zheng, Bei Chen, Xinyao Niu, Chengen Huang, Junyang Lin, Chao Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ DeepInnovator पेपर का सरल भाषा में अनुवाद दिया गया है, जिसमें रचनात्मक उपमाओं (analogies) का उपयोग किया गया है।

बड़ी तस्वीर: AI को एक "वैज्ञानिक" बनना सिखाना

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली छात्र है जिसने लाइब्रेरी की हर किताब पढ़ ली है, लेकिन उसने वास्तव में कभी कोई शोध पत्र (research paper) नहीं लिखा या कोई नया विचार नहीं दिया है। वे दूसरों द्वारा किए गए कार्यों का सारांश देने में तो माहिर हैं, लेकिन उन्हें यह कहने में संघर्ष होता है, "क्या होगा अगर हम यह नई चीज़ आज़माएँ?"

अधिकांश वर्तमान AI मॉडल के साथ यही समस्या है। वे उत्कृष्ट "लाइब्रेरियन" (मौजूदा ज्ञान का सारांश देने वाले) हैं, लेकिन खराब "आविष्कारक" (नया ज्ञान बनाने वाले) हैं।

DeepInnovator एक नई प्रशिक्षण विधि है जिसे उस AI छात्र को एक वास्तविक वैज्ञानिक में बदलने के लिए डिज़ाइन किया गया है। यह AI को न केवल पढ़ने के लिए, बल्कि अपने विचारों को सपने देखने, उनकी आलोचना करने और उन्हें तब तक परिष्कृत (refine) करने के लिए सिखाता है जब, तक कि वे क्रांतिकारी न बन जाएं।


दो चरणों वाला प्रशिक्षण शिविर (Two-Step Training Camp)

शोधकर्ताओं ने AI के लिए एक विशेष प्रशिक्षण शिविर बनाया जिसमें दो मुख्य चरण थे। इसे एक शेफ (chef) को एक नया व्यंजन आविष्कार करने के लिए प्रशिक्षित करने जैसा समझें।

चरण 1: "दिग्गजों के कंधों पर खड़ा होना" (The Library)

  • समस्या: आप एक नया व्यंजन तब तक आविष्कार नहीं कर सकते जब तक आपको यह न पता हो कि कौन सी सामग्रियां मौजूद हैं या लोग पहले से किन स्वादों को पसंद करते हैं।
  • समाधान: शोधकर्ताओं ने एक स्वचालित रोबोट बनाया जिसने लाखों वैज्ञानिक शोध पत्रों ( "दिग्गजों") को खंगाला। केवल उन्हें पढ़ने के बजाय, रोबोट ने प्रत्येक पेपर से "सीक्रेट सॉस" निकाला: मूल विचार, उनके द्वारा हल की गई समस्याएं, और जहाँ वे विफल रहे।
  • उपमा: कल्पना कीजिए कि एक अव्यवस्थित, 500 पन्नों की कुकबुक को हर रेसिपी के लिए एक साफ, व्यवस्थित इंडेक्स कार्ड में बदलना। अब AI के पास मानव ज्ञान का एक संरचित मानचित्र (map) है, जिससे वह उन अंतरालों (gaps) को देख सकता है जहाँ नए विचार फिट हो सकते हैं।

चरण 2: "अनुमान और खंडन" (Conjectures and Refutations - The Kitchen)

  • समस्या: केवल एक मानचित्र होना ही काफी नहीं है। आपको खाना बनाना, कुछ व्यंजन जलाना और उन्हें ठीक करना भी सीखना होगा।
  • समाधान: AI को एक "अगले विचार की भविष्यवाणी" (Next Idea Prediction) कार्य दिया जाता है। यह एक कच्चे, अव्यवस्थित विचार से शुरू होता है। फिर, यह "हॉट एंड कोल्ड" का खेल खेलता है:
    1. अनुमान (Conjecture): AI एक नया शोध विचार सुझाता है।
    2. खंडन (Refutation): एक "जज" (एक अन्य AI) विचार को देखता है और कहता है, "यह बहुत अस्पष्ट है," या "यह एक बड़ी समस्या को अनदेखा करता है।"
    3. परिष्करण (Refinement): AI को आलोचना के आधार पर अपने विचार को ठीक करना होता है और फिर से प्रयास करना होता है।
  • उपमा: एक मूर्तिकार (sculptor) के बारे में सोचें। वे पत्थर के एक विशाल ब्लॉक (एक कच्चा विचार) से शुरू करते हैं। वे बार-बार बुरे हिस्सों को तराशते हैं (खंडन) और अच्छे हिस्सों को चिकना करते हैं (परिष्करण) जब तक कि एक सुंदर मूर्ति उभर न आए। DeepInnovator AI को यह मानसिक तराशने का काम स्वचालित रूप से करना सिखाता है।

गुप्त मंत्र (The Secret Sauce): "जी-हुज़ूर" (Yes-Man) जाल से बचना

AI को प्रशिक्षित करने में सबसे बड़ी चुनौतियों में से एक है रिवॉर्ड हैकिंग (Reward Hacking)

  • जाल: यदि आप AI को कहते हैं, "मुझे एक अच्छा विचार दें," तो यह केवल यह सीख सकता है कि, "यहाँ एक बहुत लंबा, शानदार दिखने वाला विचार है!" क्योंकि वह सोचता है कि लंबाई का अर्थ गुणवत्ता है। वह वास्तव में स्मार्ट होने के बजाय शिक्षक को धोखा देने के बारे में सीख जाता है।
  • समाधान: शोधकर्ताओं ने शिक्षक (Teacher) को आलोचक (Critic) से अलग कर दिया।
    • आलोचक (Comment Model) AI को बताता है कि क्या गलत है (जैसे, "आपने यह परीक्षण कैसे करना है, यह नहीं समझाया")।
    • शिक्षक (Reward Model) तय करता है कि क्या नया विचार वास्तव में पुराने विचार से बेहतर है।
  • उपमा: एक स्पोर्ट्स कोच की कल्पना करें।
    • असिस्टेंट कोच (आलोचक) चिल्लाता है, "तुम्हारी फुटवर्क बहुत खराब है!"
    • हेड कोच (शिक्षक) खेल देखता है और तय करता है, "क्या तुमने इस बार वास्तव में गोल किया?"
    • खिलाड़ी असिस्टेंट कोच को खुश करने के लिए केवल तेज़ दौड़ने का नाटक नहीं कर सकता; उसे हेड कोच को खुश करने के लिए वास्तव में गोल करना होगा। यह AI को अच्छे ग्रेड पाने के लिए धोखाधड़ी करने से रोकता है।

परिणाम: एक छोटा मॉडल, बड़े विचार

शोधकर्ताओं ने अपने नए AI, जिसे DeepInnovator-14B कहा जाता है, का परीक्षण किया।

  • आश्चर्य: भले ही यह एक "मध्यम आकार" का मॉडल है (GPT-4o जैसे विशाल मॉडल से छोटा), इसने अपने अनप्रशिक्षित संस्करण को भारी अंतर से हराया (80-93% बार जीत हासिल की)।
  • सामान्यीकरण (Generalization): भले ही इसे गणित, वित्त और कंप्यूटर विज्ञान के शोध पत्रों पर प्रशिक्षित किया गया था, फिर भी यह कानून (Law) और बायोटेक्नोलॉजी (Biotechnology) जैसे क्षेत्रों में भी बेहतरीन विचार उत्पन्न कर सका जिन्हें इसने पहले कभी नहीं देखा था।
  • निष्कर्ष: इसने साबित कर दिया कि अभिनव (innovative) होने के लिए आपको एक विशाल, महंगे दिमाग की आवश्यकता नहीं है। आपको बस सही प्रशिक्षण विधि (सोचने का "तरीका") की आवश्यकता है।

एक वाक्य में सारांश

DeepInnovator AI को केवल अतीत का सारांश देने के बजाय भविष्य का आविष्कार करना सिखाता है, जो इसे मानव ज्ञान का एक संरचित मानचित्र और आत्म-आलोचना की एक कठोर प्रणाली प्रदान करता है, जिससे एक निष्क्रिय पाठक एक सक्रिय, अभिनव वैज्ञानिक में बदल जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →