← नवीनतम पेपर
💬 NLP

Evaluating LLMs' Divergent Thinking Capabilities for Scientific Idea Generation with Minimal Context

यह शोध पत्र LiveIdeaBench प्रस्तुत करता है, जो एक नवीन बेंचमार्क है जो न्यूनतम संदर्भ का उपयोग करके वैज्ञानिक विचार सृजन के लिए LLMs की अपसारी सोच (divergent thinking) क्षमताओं का मूल्यांकन करता है, यह प्रकट करते हुए कि रचनात्मक प्रदर्शन का सामान्य बुद्धिमत्ता मेट्रिक्स द्वारा खराब पूर्वानुमान लगाया जाता है और वैज्ञानिक रचनात्मकता को बढ़ाने के लिए विशेष प्रशिक्षण रणनीतियों की आवश्यकता का सुझाव देता है।

मूल लेखक: Kai Ruan, Xuan Wang, Jixiang Hong, Peng Wang, Yang Liu, Hao Sun

प्रकाशित 2026-02-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kai Ruan, Xuan Wang, Jixiang Hong, Peng Wang, Yang Liu, Hao Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभा खोजकर्ता (talent scout) हैं जो अगली महान आविष्कारक की तलाश में हैं। आपके पास बुद्धिमान रोबोटों (लार्ज लैंग्वेज मॉडल्स, या LLMs) से भरा एक कमरा है। पारंपरिक रूप से, उनका परीक्षण करने के लिए, आप उन्हें एक मशीन का विशाल, विस्तृत ब्लूप्रिंट देंगे और उनसे मशीन के एक विशिष्ट टूटे हुए हिस्से को ठीक करने के लिए कहेंगे। यह उनकी निर्देशों का पालन करने की क्षमता और ज्ञात समस्याओं को हल करने की क्षमता (कन्वर्जेंट थिंकिंग - Convergent Thinking) का परीक्षण करता है।

लेकिन यह शोध पत्र एक अलग सवाल पूछता है: क्या ये रोबोट केवल एक शब्द सुनकर एक नया आविष्कार कर सकते हैं? यह डाइवर्जेंट थिंकिंग (Divergent Thinking) है—रचनात्मकता की चमक।

यहाँ 'LiveIdeaBench' को सरल उपमाओं के माध्यम से समझाया गया है:

1. समस्या: "लाइब्रेरी टेस्ट" बनाम "ब्लैंक कैनवस"

वर्तमान में AI के अधिकांश परीक्षण एक छात्र को एक मोटी पाठ्यपुस्तक देने और उससे पूछने जैसे हैं, "प्रश्न 5 का उत्तर क्या है?" यदि छात्र ने पुस्तक पढ़ ली है, तो उसे 'A' ग्रेड मिलेगा। यह इस बात को मापता है कि वे मौजूदा जानकारी को कितनी अच्छी तरह ढूंढ और संश्लेषित (synthesize) कर सकते हैं।

हालाँकि, वास्तविक वैज्ञानिक सफलताएँ अक्सर तब होती हैं जब कोई व्यक्ति एक एकल अवधारणा (जैसे "गुरुत्वाकर्षण" या "बैक्टीरिया") को देखता है और कहता है, "क्या होगा अगर हम इस अजीब चीज़ को आज़माएँ?"

  • शोध पत्र का लक्ष्य: लेखकों ने LiveIdeaBench नामक एक नया परीक्षण बनाया है। उन्हें AI को एक पाठ्यपुस्तक देने के बजाय, वे इसे एक एकल कीवर्ड (जैसे "मौसम का पूर्वानुमान" या "सहजीविता/symbiosis") देते हैं और पूछते हैं: "मुझे सिर्फ इस शब्द के आधार पर एक बिल्कुल नया, उपयोगी वैज्ञानिक विचार दें।"

2. जज: आलोचकों का एक पैनल, न कि एक शिक्षक

अतीत में, हम शायद एक शिक्षक से विचारों को ग्रेड देने के लिए कह सकते थे। लेकिन क्या होगा यदि वह शिक्षक पक्षपाती या थका हुआ हो?

  • समाधान: लेखकों ने उपलब्ध शीर्ष 10 सबसे बुद्धिमान AI मॉडलों का एक "जूरी" बनाया है। जब एक रोबोट एक विचार उत्पन्न करता है, तो शीर्ष रोबोटों का एक अलग समूह जज के रूप में कार्य करता है।
  • ग्रेडिंग रूब्रिक: वे केवल "सटीकता" नहीं देखते। वे पाँच रचनात्मक गुणों पर ग्रेड देते हैं (गिल्फ़ोर्ड के एक पुराने मनोवैज्ञानिक सिद्धांत के आधार पर):
    • मौलिकता (Originality): क्या यह विचार अजीब और नया है, या यह केवल किसी ऐसी चीज़ की नकल है जिसे हम पहले से जानते हैं?
    • व्यवहार्यता (Feasibility): क्या एक मानव वास्तव में इसे बना सकता है, या यह शुद्ध जादू है?
    • स्पष्टता (Clarity): क्या विचार स्पष्ट रूप से समझाया गया है, या यह एक भ्रमित करने वाला ढेर है?
    • प्रवाह (Fluency): क्या रोबोट कई अलग-अलग विचार उत्पन्न कर सकता है, या केवल एक?
    • लचीलापन (Flexibility): क्या यह किसी भी विषय (भौतिकी से लेकर कविता तक) को संभाल सकता है, या यह केवल गणित पर काम करता है?

3. बड़ा आश्चर्य: "स्मार्ट" होने का मतलब हमेशा "रचनात्मक" होना नहीं होता

यह इस शोध पत्र का सबसे रोमांचक हिस्सा है।

  • अपेक्षा: हम आमतौर पर सोचते हैं कि "सबसे स्मार्ट" रोबोट (जो गणित और तर्क के सभी परीक्षणों में जीतता है) सबसे अधिक रचनात्मक भी होगा।
  • वास्तविकता: शोध पत्र ने पाया कि गणित में अच्छा होने का मतलब यह नहीं है कि आप मंथन (brainstorming) करने में अच्छे हैं।
    • उपमा: कल्पना कीजिए कि एक फॉर्मूला 1 कार (उच्च सामान्य बुद्धिमत्ता) है। यह ट्रैक पर अविश्वसनीय रूप से तेज़ और सटीक है। लेकिन यदि आप इसे एक कीचड़ भरे खेत में रखते हैं और इसे पेड़ों के बीच से एक नया रास्ता खोजने के लिए कहते हैं, तो यह फंस सकती है। वहीं, एक मजबूत ऑफ-रोड ट्रक (कम "सामान्य बुद्धिमत्ता" स्कोर वाले मॉडल) पेड़ों के बीच से शानदार ढंग से रास्ता निकाल सकता है।
    • डेटा: कुछ मॉडल जो सामान्य बुद्धिमत्ता परीक्षणों में निम्न रैंक पर थे (जैसे QwQ-32B-preview), उन्होंने वैज्ञानिक विचार उत्पन्न करने में "सुपर-स्मार्ट" मॉडलों (जैसे Claude-3.7) के समान या उनसे बेहतर प्रदर्शन किया।

4. "सोचने" का जाल: लंबाई \neq गुणवत्ता

कई लोग मान लेते हैं कि यदि कोई AI बहुत सारे "सोचने के चरणों" के साथ एक लंबा, जटिल स्पष्टीकरण लिखता है, तो विचार बेहतर ही होगा।

  • निष्कर्ष: लेखकों ने इसका विश्लेषण किया और पाया कि इनके बीच कोई वास्तविक संबंध नहीं है।
  • उपमा: यह एक शेफ द्वारा सैंडविच बनाने के तरीके के बारे में 10 पन्नों का निबंध लिखने जैसा है। निबंध लंबा और तार्किक हो सकता है, लेकिन सैंडविच खुद अभी भी बेकार हो सकता है। शोध पत्र ने पाया कि AI के तर्क की लंबाई ने यह भविष्यवाणी नहीं की कि अंतिम विचार कितना अच्छा था। कभी-कभी सबसे अच्छे विचार संक्षिप्त और प्रभावशाली प्रतिक्रियाओं से आए।

5. यह क्यों मायने रखता है

लेखक तर्क देते हैं कि हमें AI को केवल एक विशाल विश्वकोश के रूप में देखना बंद करना चाहिए जो केवल प्रश्नों के उत्तर देता है। नई दवाओं या सामग्रियों की खोज में वैज्ञानिकों की मदद करने के लिए, हमें ऐसे AI की आवश्यकता है जो संभावनाओं के सपने देख सके

  • सीख: हमें AI को अलग तरह से प्रशिक्षित करने की आवश्यकता है। उन्हें केवल पहेलियाँ हल करना (कन्वर्जेंट थिंकिंग) सिखाने के बजाय, हमें उन्हें अवधारणाओं के साथ खेलने और जंगली संबंध बनाने (डाइवर्जेंट थिंकिंग) की आवश्यकता है।
  • भविष्य: कल्पना कीजिए कि भविष्य में आपके पास अपनी गणनाओं की जाँच करने के लिए एक "मैथ बॉट" और एक नया बड़ा परिकल्पना (hypothesis) सोचने में मदद करने के लिए एक अलग "ड्रीम बॉट" है। वे मिलकर काम करते हैं, लेकिन उन्हें अलग-अलग कौशल की आवश्यकता होती है।

एक वाक्य में सारांश

LiveIdeaBench एक नया परीक्षण है जो साबित करता है कि सबसे स्मार्ट AI हमेशा सबसे रचनात्मक वाला नहीं होता है, जो हमें दिखाता है कि विज्ञान में वास्तव में मदद करने के लिए, हमें अपने रोबोटों को केवल पाठ्यपुस्तक रटने के बजाय एक खाली पन्ने से मंथन करना सिखाने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →