← नवीनतम पेपर
🤖 AI

FALSIFYBENCH: Evaluating Inductive Reasoning in LLMs with Rule Discovery Games

यह शोधपत्र FALSIFYBENCH प्रस्तुत करता है, जो वैज्ञानिक खोज के लिए LLMs की आगमनात्मक तर्क क्षमता (inductive reasoning) का मूल्यांकन करने हेतु वासन 2-4-6 कार्य से प्रेरित एक बेंचमार्क है, जो यह प्रकट करता है कि रीजनिंग मॉडल, इंस्ट्रक्शन-ट्यून्ड मॉडल्स की तुलना में मुख्य रूप से अपनी नेगेटिव टेस्टिंग की क्षमता के कारण बेहतर प्रदर्शन करते हैं और उनकी विफलता परिकल्पना नेविगेशन (hypothesis navigation) के पहचाने जाने योग्य पैटर्न से उत्पन्न होती है।

मूल लेखक: Leonardo Bertolazzi, Katya Tentori, Raffaella Bernardi

प्रकाशित 2026-06-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Leonardo Bertolazzi, Katya Tentori, Raffaella Bernardi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक दोस्त के साथ एक अनुमान लगाने वाला खेल खेल रहे हैं जो एक गुप्त नियम जानता है, लेकिन आप नहीं। आपका दोस्त आपको उन नियमों के तीन उदाहरण देता है जो उस पर फिट बैठते हैं, जैसे "2, 4, 6।" आपका काम अपने स्वयं के नंबरों के सेट प्रस्तावित करके और यह पूछकर गुप्त नियम का पता लगाना है, "क्या यह इसमें फिट बैठता है?"

यह प्रसिद्ध "वासन 2-4-6 टास्क" है, जो सोचने के तरीके का अध्ययन करने के लिए उपयोग किया जाने वाला एक प्रसिद्ध पहेली है। जिस पेपर के बारे में आप पूछ रहे हैं, वह FALSIFYBENCH है, और यह इस खेल को आर्टिफिशियल इंटेलिजेंस (AI) को देता है, लेकिन नंबरों के बजाय, यह शब्दों और श्रेणियों (जैसे "जानवर" या "औज़ार") का उपयोग करता है।

यहाँ शोधकर्ताओं ने क्या किया और क्या पाया, इसका विवरण सरल उपमाओं का उपयोग करते हुए दिया गया है।

खेल: "छिपी हुई श्रेणी खोजें"

AI को एक जासूस के रूप में सोचें जो एक रहस्य सुलझाने की कोशिश कर रहा है।

  • सेटअप: AI को तीन चीजें दिखाई जाती हैं, मान लीजिए एक "चमगादड़" (bat), एक "स्किमर" (skimmer), और एक "टार्सियर" (tarsier)।
  • लक्ष्य: AI को उस छिपी हुई श्रेणी का अनुमान लगाना है जिससे ये संबंधित हैं (जैसे, "जानवर")।
  • चुनौती: AI को उत्तर नहीं पता है। उसे एक नियम का अनुमान लगाना होगा, उसका परीक्षण करना होगा और फीडबैक प्राप्त करना होगा।
    • यदि AI "उड़ने वाली चीजें" का अनुमान लगाता है और एक "चमगादड़" का परीक्षण करता है, तो सिस्टम कहता है, "हाँ, यह फिट बैठता है।"
    • यदि AI एक "मछली" का परीक्षण करता है और सिस्टम कहता है, "नहीं, यह फिट नहीं बैठता है," तो AI सीख जाता है कि उसका नियम बहुत व्यापक था।
    • यदि AI एक "व्हेल" का परीक्षण करता है और सिस्टम कहता है, "हाँ, यह फिट बैठता है," लेकिन AI ने "उड़ने वाली चीजें" सोचा था, तो AI सीख जाता है कि उसका नियम बहुत संकीर्ण था।

बड़ी समस्या: "यस-मैन" (हाँ में हाँ मिलाने वाला) जाल

शोधकर्ताओं ने पाया कि अधिकांश AI मॉडल (और इंसान) एक विशिष्ट सोचने की त्रुटि से ग्रस्त होते हैं जिसे पुष्टि पूर्वाग्रह (Confirmation Bias) कहा जाता है।

कल्पना कीजिए कि आप एक जासूस हैं जिसे यकीन है कि अपराधी "बटलर" (नौकर) है।

  • "यस-मैन" रणनीति (पुष्टि): आप केवल ऐसे सवाल पूछते हैं जो यह साबित करें कि बटलर ने यह किया है। "क्या बटलर का कोई मकसद था?" "हाँ।" "क्या बटलेट कमरे में था?" "हाँ।" आप आश्वस्त महसूस करते हैं, लेकिन आप वास्तव में यह कभी नहीं जाँचते कि बटलर निर्दोष तो नहीं है। आप केवल "हाँ" वाले उत्तरों की तलाश कर रहे हैं।
  • "डेविल्स एडवोकेट" (विपक्षी तर्क) रणनीति (असत्यीकरण/Falsification): आप सक्रिय रूप से यह साबित करने की कोशिश करते हैं कि बटलर अपराधी नहीं है। आप पूछते हैं, "क्या अपराध के समय बटलर समुद्र तट पर था?" यदि उत्तर "हाँ" है, तो आपका सिद्धांत नष्ट हो जाता है, और आपको एक नया संदिग्ध खोजना पड़ता है। आपको अपनी थ्योरी को तोड़ने के लिए प्रयास करना चाहिए।

पेपर का मुख्य निष्कर्ष:
वे AI मॉडल जिन्होंने "डेविल्स एडवोकेट" की तरह काम किया (अपनी ही थ्योरी को तोड़ने की कोशिश की), वे पहेली सुलझाने में बहुत बेहतर थे। वे मॉडल जो "यस-मैन" की तरह व्यवहार करते थे (केवल यह साबित करने के लिए सबूत ढूंढते थे कि वे सही थे), वे अटक गए। वे संकीर्ण नियम (जैसे "उड़ने वाले स्तनधारी") का अनुमान लगाते रहे और उन्हें कभी एहसास नहीं हुआ कि वास्तविक नियम व्यापक ("सभी जानवर") था।

परिणाम: किसने सबसे अच्छा खेला?

टीम ने 12 अलग-अलग AI मॉडल का परीक्षण किया। यहाँ उन्होंने क्या पाया:

  1. "तर्क करने वाले" (Reasoning) मॉडल जीते: नए AI मॉडल जिन्हें बोलने से पहले "सोचने" के लिए डिज़ाइन किया गया है (अक्सर "रीजनिंग मॉडल" कहा जाता है), वे मानक मॉडलों की तुलना में बेहतर जासूस थे। वे अपनी थ्योरी को तोड़ने की कोशिश करने के लिए अधिक इच्छुक थे।
  2. कोई भी परफेक्ट नहीं है: यहाँ तक कि सर्वश्रेष्ठ AI मॉडल भी इस खेल को पूरी तरह से हल नहीं कर पाए। उन्होंने अभी भी गलतियाँ कीं, जो यह दर्शाता है कि AI अभी भी वैज्ञानिक खोज का मास्टर नहीं है।
  3. यह स्मार्ट होने के बारे में नहीं, बल्कि रणनीति के बारे में है: शोधकर्ताओं ने जांचा कि क्या AI इसलिए विफल हो रहा था क्योंकि वह शब्दों की परिभाषा नहीं जानता था (जैसे यह न जानना कि "बैट" क्या है)। उन्होंने पाया कि यह समस्या नहीं थी। AI शब्दों को जानता था; बस उसकी रणनीति खराब थी। वह गलत हो सकने वाले विचारों का परीक्षण करने से डरता था।

"टर्न-बाय-टर्न" विश्लेषण

शोधकर्ताओं ने केवल यह नहीं देखा कि कौन जीता; उन्होंने यह भी देखा कि AI ने हर एक चाल कैसे खेली। उन्होंने पाया कि AI दो मुख्य तरीकों से विफल हुआ:

  1. जंगल में खो जाना: एक विशिष्ट अनुमान से सामान्य अनुमान की ओर धीरे-धीरे बढ़ने के बजाय (जैसे "चमगादड़" से "स्तनधारी" और फिर "जानवर" की ओर जाना), AI कभी-कभी पूरी तरह से असंबंधित अनुमानों (जैसे "B से शुरू होने वाली चीजें") पर कूद जाता था।
  2. गलत विवरणों पर ध्यान केंद्रित करना: कभी-कभी, शब्दों के अर्थ का अनुमान लगाने के बजाय, AI शब्दों के दिखावट के आधार पर अनुमान लगाता था। उदाहरण के लिए, वह अनुमान लगा सकता था, "नियम यह है कि सभी शब्दों में तीन अक्षर हैं," या "वे सभी एक स्वर (vowel) से शुरू होते हैं।" यह एक जासूस के लिए अपराध स्थल को अनदेखा करने और संदिग्ध के जूतों के रंग पर ध्यान केंद्रित करने जैसा है।

निचोड़ (Bottom Line)

यह पेपर एक नया टेस्ट (FALSIFYBENCH) पेश करता है ताकि यह देखा जा सके कि क्या AI वास्तविक वैज्ञानिक सोच रख सकता है। निष्कर्ष यह है कि हालांकि AI "सोचने" में बेहतर हो रहा है, लेकिन यह अभी भी विज्ञान के सबसे महत्वपूर्ण हिस्से के लिए संघर्ष करता है: गलत होने का साहस।

एक अच्छा वैज्ञानिक (या एक अच्छा जासूस) होने के लिए, आपको अपने विचारों को गलत साबित करने की सक्रिय रूप से कोशिश करनी पड़ती है। वे AI मॉडल जिन्होंने ऐसा करना सीखा, वे विजेता थे, लेकिन उन्हें मानव वैज्ञानिकों की जगह लेने से पहले अभी भी एक लंबा रास्ता तय करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →