← नवीनतम पेपर
🤖 AI

Can Large Language Models Derive New Knowledge? A Dynamic Benchmark for Biological Knowledge Discovery

एआई की ज्ञान खोज की क्षमता के मूल्यांकन में स्थिर बेंचमार्क और डेटा संदूषण (data contamination) की सीमाओं को संबोधित करने के लिए, यह शोध पत्र DBench-Bio पेश करता है, जो एक गतिशील, पूर्णतः स्वचालित और मासिक रूप से अपडेट होने वाला बेंचमार्क है, जो 12 बायोमेडिकल उप-क्षेत्रों को कवर करता है और नए जैविक ज्ञान को प्राप्त करने की लार्ज लैंग्वेज मॉडल्स की क्षमता का कड़ाई से आकलन करता है।

मूल लेखक: Chaoqun Yang, Xinyu Lin, Shulin Li, Wenjie Wang, Ruihan Guo, Fuli Feng, Tat-Seng Chua

प्रकाशित 2026-03-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chaoqun Yang, Xinyu Lin, Shulin Li, Wenjie Wang, Ruihan Guo, Fuli Feng, Tat-Seng Chua

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप यह परीक्षण करने की कोशिश कर रहे हैं कि क्या कोई छात्र वास्तव में नए तथ्यों की खोज (discovery) करने में जीनियस है, या वह केवल एक सुपर-फोटोकॉपीयर है जिसने पूरी लाइब्रेरी को रट लिया है।

यह शोध पत्र, जिसका शीर्षक है "Can Large Language Models Derive New Knowledge?", इस उत्तर को खोजने के लिए एक विशेष परीक्षण बनाने के बारे में है। लेखकों ने यह देखने के लिए एक टूल बनाया है जिसे DBench-Bio कहा जाता है कि क्या AI वास्तव में नए वैज्ञानिक विचार बना सकता है या यह केवल उन चीजों को दोहरा रहा है जो उसने पहले से सीखी हुई हैं।

यहाँ सरल शब्दों में इसका विवरण दिया गया है:

1. समस्या: "चीटिंग" करने वाला छात्र

कल्पना कीजिए कि आप एक छात्र को गणित की परीक्षा देते हैं। यदि परीक्षा में 2020 में प्रकाशित किसी पाठ्यपुस्तक से प्रश्न पूछे जाते हैं, और छात्र ने 2021 में उस पाठ्यपुस्तक का अध्ययन किया था, तो छात्र को पूर्ण अंक मिल सकते हैं। लेकिन क्या उसने गणित सीखा है, या उसने केवल उत्तरों को रट लिया है?

  • पुराना तरीका: अधिकांश AI परीक्षण स्थिर (static/frozen) डेटासेट का उपयोग करते हैं। हो सकता है कि AI ने इन प्रश्नों को अपने प्रशिक्षण (सीखने) के दौरान देखा हो। इसलिए, जब वह उन्हें सही बताता है, तो हमें पता नहीं चलता कि वह बुद्धिमान है या पुराने डेटा को याद करके चीटिंग कर रहा है।
  • लक्ष्य: हमें एक ऐसा परीक्षण चाहिए जहाँ प्रश्न बिल्कुल नए हों, जो AI के प्रशिक्षण (training) समाप्त होने के बाद प्रकाशित हुए हों। यह सुनिश्चित करता है कि AI ने उत्तर पहले कभी नहीं देखे हैं।

2. समाधान: "जीवित" परीक्षण (DBench-Bio)

लेखकों ने इस नए परीक्षण को बनाने के लिए एक गतिशील, स्वचालित मशीन बनाई है। इसे एक हाई-स्पीड न्यूज़ एग्रीगेटर की तरह समझें जो केवल नवीनतम वैज्ञानिक शोध पत्रों को ही पढ़ता है।

यहाँ उनका "मशीन" तीन चरणों में कैसे काम करता है:

  • चरण 1: वीआईपी गेस्ट लिस्ट (डेटा अधिग्रहण - Data Acquisition)
    यह मशीन विज्ञान की "लाइब्रेरी" (विशेष रूप से शीर्ष स्तर की जीव विज्ञान जर्नल्स) में जाती है। यह केवल उन्हीं शोध पत्रों को चुनती है जो AI के जारी होने के बाद प्रकाशित हुए हैं। यह ऐसा ही है जैसे कहना, "हम केवल उन फिल्मों के बारे में सवाल पूछ रहे हैं जो आपके थिएटर से बाहर जाने के बाद रिलीज हुई हैं।" यह गारंटी देता है कि AI ने उत्तर नहीं देखे हैं।
  • चरण 2: अनुवादक (QA निष्कर्षण - QA Extraction)
    यह मशीन इन जटिल वैज्ञानिक शोध पत्रों को पढ़ती है और एक अत्यंत बुद्धिमान AI से उन्हें सरल प्रश्न और उत्तर (Question and Answer) जोड़ों में बदलने के लिए कहती है।
    • उदाहरण: प्रोटीन के बारे में एक शुष्क पैराग्राफ के बजाय, यह इसे इस तरह बदल देता है: "प्रोटीन X कैंसर कोशिकाओं को कैसे रोकता है?" और "यह एक विशिष्ट एंजाइम को तोड़कर उन्हें रोकता है।"
  • चरण 3: सख्त संपादक (QA फ़िल्टर - QA Filter)
    कभी-कभी, AI अनुवादक गलतियाँ करता है या उबाऊ प्रश्न बना देता है। दूसरा AI एक सख्त संपादक के रूप में कार्य करता है। वह जाँच करता है:
    • क्या यह प्रश्न वास्तव में जीव विज्ञान के बारे में है? (प्रासंगिकता - Relevance)
    • क्या उत्तर स्पष्ट और समझने में आसान है? (स्पष्टता - Clarity)
    • क्या यह शोध पत्र का मुख्य बिंदु है, या केवल एक छोटा, महत्वहीन विवरण? (केंद्रीयता - Centrality)
    • यदि उत्तर कमजोर है, तो मशीन उसे हटा देती है।

3. परिणाम: AI एक अच्छा लाइब्रेरियन है, लेकिन एक बुरा आविष्कारक है

लेखकों ने इस नए "जीवित परीक्षण" का उपयोग करके दुनिया के सबसे स्मार्ट AI (जैसे GPT-5, Gemini, आदि) का परीक्षण किया। यहाँ उन्हें क्या मिला:

  • "फोटोकॉपीयर" प्रभाव: AI उन तथ्यों को खोजने में अद्भुत है जिन्हें वह पहले से जानता है। यदि आप उनसे स्थापित विज्ञान के बारे में पूछते हैं, तो वे उच्च स्कोर करते हैं।
  • "खोज" की विफलता: जब उन्हें बिल्कुल नई खोजों (कल प्रकाशित शोध पत्रों) को समझने के लिए कहा गया, तो AI संघर्ष करते दिखे। वे अक्सर:
    • गलत अनुमान लगाते थे: उन्होंने ऐसे तर्कपूर्ण लगने वाले तंत्र (mechanisms) बना दिए जो पूरी तरह से गलत थे।
    • पुराने विचारों को दोहराते थे: उन्होंने "यह सूजन (inflammation) को कम करता है" जैसे सामान्य उत्तर दिए, बजाय उस विशिष्ट नई प्रक्रिया के जो शोध पत्र में पाई गई थी।
    • उत्तर देने से मना कर दिया: उन्होंने स्वीकार किया कि वे नहीं जानते।
    • अत्यधिक आत्मविश्वास के साथ अनुमान लगाना: उन्होंने आत्मविश्वास के साथ एक ऐसी कहानी बनाई जो तार्किक तो लग रही थी, लेकिन गलत थी।

4. बड़ा निष्कर्ष

शोध पत्र निष्कर्ष निकालता है कि वर्तमान AI अभी तक एक "वैज्ञानिक" नहीं है। यह एक बहुत ही उन्नत रिसर्च असिस्टेंट है जो उन चीजों को पढ़ और सारांशित कर सकता है जो मनुष्यों ने पहले ही लिख दी हैं।

हालाँकि, यह अपने आप नया ज्ञान प्राप्त (derive new knowledge) नहीं कर सकता। यह अज्ञात के बारे में वास्तविक तर्क लगाने के बजाय याद रखने और पैटर्न पहचानने पर निर्भर करता है।

उपमा सारांश

  • पुराने बेंचमार्क: पिछले साल पढ़े गए किसी पुस्तक पर छात्र को परीक्षा देने जैसा। (क्या उसने सीखा, या केवल रटा?)
  • DBench-Bio: कल लिखी गई एक पुस्तक पर छात्र को परीक्षा देने जैसा, जिसे उसने पहले कभी नहीं देखा है।
  • परिणाम: छात्र (AI) पिछले साल पढ़ी गई पुस्तक को पूरी तरह से सुना सकते हैं, लेकिन कल की पुस्तक के सामने आने पर, वे ज्यादातर या तो अनुमान लगाते हैं या मनगढ़ंत बातें बनाते हैं।

लेखक आशा करते हैं कि यह नया "जीवित परीक्षण" डेवलपर्स को ऐसे AI बनाने में मदद करेगा जो वास्तव में सोच सकें और नई चीजों की खोज कर सकें, न कि केवल पुरानी चीजों को याद रख सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →