← नवीनतम पेपर
💬 NLP

ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition

यह शोधपत्र ResearchBench को प्रस्तुत करता है, जो कि पहला बड़े पैमाने का, संदूषण-मुक्त बेंचमार्क है जो वैज्ञानिक खोज पर LLMs का मूल्यांकन करने के लिए कार्य को प्रेरणा पुनर्प्राप्ति (inspiration retrieval), परिकल्पना संरचना (hypothesis composition) और रैंकिंग में विभाजित करता है, जिससे यह पता चलता है कि मॉडल 12 विषयों में नवीन ज्ञान संबंधों को खोजने में उत्कृष्ट हैं।

मूल लेखक: Yujie Liu, Zonglin Yang, Tong Xie, Jinjie Ni, Ben Gao, Yuqiang Li, Shixiang Tang, Wanli Ouyang, Erik Cambria, Dongzhan Zhou

प्रकाशित 2026-04-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yujie Liu, Zonglin Yang, Tong Xie, Jinjie Ni, Ben Gao, Yuqiang Li, Shixiang Tang, Wanli Ouyang, Erik Cambria, Dongzhan Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक वैज्ञानिक हैं जो कुछ नया आविष्कार करने की कोशिश कर रहे हैं, जैसे कि एक बेहतर बैटरी या किसी बीमारी का इलाज। आमतौर पर, आप एक समस्या (रिसर्च क्वेश्चन/अनुसंधान प्रश्न) से शुरुआत करते हैं और देखते हैं कि पहले से क्या ज्ञात है (बैकग्राउंड/पृष्ठभूमि)। सबसे कठिन हिस्सा वह "स्पार्क ऑफ जीनियस" (प्रतिभा का क्षण) है—किसी पूरी तरह से अलग क्षेत्र से एक अजीब, असंबंधित विचार खोजना, जो आपके काम में मिलकर एक शानदार समाधान बना सके।

यह पेपर, ResearchBench, आर्टिफिशियल इंटेलिजेंस (AI) के लिए एक विशाल, हाई-टेक जिम की तरह है ताकि यह परीक्षण किया जा सके कि क्या वह उस "स्पार्क ऑफ जीनियस" का काम कर सकता है।

यहाँ बताया गया है कि उन्होंने AI का परीक्षण कैसे किया, सरल उपमाओं (analogies) का उपयोग करके:

1. बड़ा विचार: विज्ञान एक रेसिपी की तरह है

शोधकर्ताओं का मानना है कि लगभग हर महान वैज्ञानिक खोज केवल तीन सामग्रियों वाली एक रेसिपी है:

  1. समस्या (The Problem): हम क्या ठीक करने की कोशिश कर रहे हैं?
  2. प्रेरणा (The Inspiration): कहीं और से आया एक रैंडम, असंबंधित विचार (जैसे, कंप्यूटर चिप को ठीक करने के लिए खाना पकाने की तकनीक का उपयोग करना)।
  3. मिश्रण (The Mix): उन्हें मिलाकर एक नया परिकल्पना (hypothesis - समाधान का एक अनुमान) बनाना।

उन्होंने "विज्ञान करने" के काम को टेस्ट करने के लिए इसे तीन विशिष्ट कार्यों में विभाजित किया:

  • कार्य A: खजाने की खोज (Inspiration Retrieval): क्या AI उस अजीब, असंबंधित विचार को ढूंढ सकता है जो वास्तव में मदद करता है?
  • कार्य B: शेफ (Hypothesis Composition): क्या AI समस्या और विचार को मिलाकर एक सुसंगत नई रेसिपी बना सकता है?
  • कार्य C: आलोचक (Hypothesis Ranking): क्या AI दस अलग-अलग रेसिपी देख सकता है और उनमें से उस एक को चुन सकता है जिसके काम करने की संभावना सबसे अधिक है?

2. टेस्ट किचन: ResearchBench

इसे टेस्ट करने के लिए, उन्होंने ResearchBench नामक एक विशाल डेटाबेस बनाया।

  • मेन्यू (The Menu): उन्होंने भौतिकी (Physics) से लेकर कानून (Law) तक 12 विभिन्न क्षेत्रों के 1,386 बिल्कुल नए वैज्ञानिक शोध पत्रों (जो 2024 या उसके बाद प्रकाशित हुए हैं) को देखा। उन्होंने ये तारीखें इसलिए चुनीं ताकि AI अपने ट्रेनिंग के दौरान उत्तरों को याद करके "चीटिंग" न कर सके।
  • स्वचालन (The Automation): हर पेपर को पढ़ने के लिए इंसानों के बजाय, उन्होंने एक रोबोट टीम ("एजेंटिक फ्रेमवर्क") बनाई जो शोध पत्रों को पढ़ती है और स्वचालित रूप से समस्या, पृष्ठभूमि, "स्पार्क" विचार और अंतिम समाधान को निकाल लेती है।
  • गुणवत्ता जांच (The Quality Check): वास्तविक मानव विशेषज्ञों (विज्ञान के PhD छात्रों) ने रोबोट के काम का स्वाद चखा। उन्होंने पुष्टि की कि रोबोट सही सामग्री खोजने में लगभग 92% सटीक था।

3. परिणाम: AI ने कैसा प्रदर्शन किया?

🏆 खजाने की खोज (Retrieval): AI एक जीनियस जासूस है

  • चुनौती: AI को "छिपे हुए संबंध" को खोजना था। उदाहरण के लिए, यदि समस्या ट्रैफिक जाम के बारे में थी, तो AI को चींटी की कॉलोनियों (ant colonies) के बारे में एक पेपर खोजना था (जो ट्रैफिक एल्गोरिदम के लिए एक सामान्य वास्तविक दुनिया की प्रेरणा है)।
  • परिणाम: AI इसमें आश्चर्यजनक रूप से अच्छा था! भले ही संबंध बहुत कमजोर हो या विचार पूरी तरह से असंबंधित लग रहे हों, AI उन्हें पहचान सकता था।
  • उपमा: कल्पना कीजिए कि आप लाखों किताबों वाली लाइब्रेरी में हैं। यदि आप किसी इंसान से पूछें, "मुझे बेकिंग के बारे में कोई ऐसी किताब ढूंढ कर दो जो मुझे खराब इंजन को ठीक करने में मदद कर सके," तो वे कह सकते हैं, "यह असंभव है।" हालाँकि, AI ने कहा, "ओह, मुझे ओवन में हीट डिस्ट्रीब्यूशन (ऊष्मा वितरण) पर एक किताब मिली जो यह समझाती है कि इंजन को बेहतर तरीके से कैसे ठंडा किया जाए।" इसने उन पैटर्न्स को खोज निकाला जो इंसानों से छूट गए थे।

🍳 शेफ (Composition): AI एक अच्छा प्रशिक्षु (Apprentice) है

  • चुनौती: एक बार जब AI ने "स्पार्क" (प्रेरणा) ढूंढ ली, तो उसे दोनों को मिलाकर एक नई वैज्ञानिक परिकल्पना लिखनी थी।
  • परिणाम: AI ठीक-ठाक था, लेकिन वह परफेक्ट नहीं था। वह सामग्रियों को मिला तो सकता था, लेकिन कभी-कभी रेसिपी थोड़ी अस्त-व्यस्त होती थी या कोई महत्वपूर्ण चरण छूट जाता था। यह एक ऐसे शेफ की तरह है जो सामग्री तो जानता है लेकिन अभी तक खाना पकाने की तकनीक में महारत हासिल नहीं कर पाया है।

⚖️ आलोचक (Ranking): AI एक भ्रमित जज है

  • चुनौती: AI को एक "अच्छी" परिकल्पना और एक "बुरी" परिकल्पना को देखना था और विजेता चुनना था।
  • परिणाम: यह सबसे कठिन हिस्सा था। AI अक्सर भ्रमित हो गया।
  • खामी (The Glitch): शोधकर्ताओं ने एक मजेदार खामी पाई: AI में एक "पोजीशन बायस" (स्थिति का पक्षपात) था। यदि आपने उसे परिकल्पना A पहले और B बाद में दिखाई, तो उसने A को चुना। यदि आपने उन्हें आपस में बदल दिया, तो उसने B को चुना। यह एक ऐसे जज की तरह था जो वास्तव में बेहतर होने के बावजूद, बस पहले दिखने वाले व्यक्ति को ही चुन लेता है।

4. बड़ा निष्कर्ष: "रिसर्च माइन" (अनुसंधान की खान)

लेखक निष्कर्ष निकालते हैं कि हमें AI को केवल एक कैलकुलेटर या चैटबॉट के रूप में नहीं सोचना चाहिए। वे इसे एक "रिसर्च हाइपोथेसिस माइन" कहते हैं।

  • खदान (The Mine): AI विभिन्न क्षेत्रों के ज्ञान के बीच छिपे हुए संबंधों की एक गहरी खान है।
  • खनिक (The Miners): AI जितना अधिक शक्तिशाली होगा (मॉडल जितना बड़ा होगा), उसके पास इन कनेक्शनों को खोदने के लिए उतने ही अधिक "खनिक" होंगे।
  • भविष्य: भले ही AI अभी भी अंतिम समाधान लिखने में परफेक्ट नहीं है, लेकिन यह उन कच्चे माल (प्रेरणाओं) को ढूंढने में अविश्वसनीय रूप से अच्छा है जिन्हें खोजने के बारे में इंसान शायद कभी न सोचें।

संक्षेप में: यह पेपर दिखाता है कि AI एक शानदार "आइडिया स्काउट" (विचार खोजने वाला) बनता जा रहा है। यह मानव ज्ञान की लाइब्रेरी में घूम सकता है, दो ऐसी चीजों को ढूंढ सकता है जो असंबंधित लगती हैं, और कह सकता है, "हे, अगर आप इन्हें मिला दें, तो आप कुछ नया खोज सकते हैं!" यह अभी मुख्य वैज्ञानिक बनने के लिए तैयार नहीं है, लेकिन यह प्रेरणा के स्पार्क को खोजने के लिए अब तक का सबसे अच्छा रिसर्च असिस्टेंट है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →