← नवीनतम पेपर
💻 computer science

A2RBench: An Automatic Paradigm for Formally Verifiable Abstract Reasoning Benchmark Generation

यह शोध पत्र A2RBench प्रस्तुत करता है, जो अद्वितीय समाधान सुनिश्चित करने के लिए चक्र निरंतरता (cycle consistency) का उपयोग करके औपचारिक रूप से सत्यापन योग्य अमूर्त तर्क बेंचमार्क उत्पन्न करने के लिए एक स्वचालित पाइपलाइन है, जो यह प्रकट करता है कि वर्तमान LLMs अमूर्त तर्क में मनुष्यों की तुलना में काफी खराब प्रदर्शन करते हैं और उच्च-आयामी कार्यों के साथ संघर्ष करते हैं।

मूल लेखक: Qingchuan Ma, Yuexiao Ma, Yongkang Xie, Tianyu Xie, Xiawu Zheng, Rongrong Ji

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qingchuan Ma, Yuexiao Ma, Yongkang Xie, Tianyu Xie, Xiawu Zheng, Rongrong Ji

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सोचना सिखाने की कोशिश कर रहे हैं। आप जानना चाहते हैं कि क्या वह वास्तव में एक नए नियम को समझ सकता है या वह केवल एक तोते की तरह शब्दों को दोहरा रहा है जो उसने पहले सुना है। यही वह मुख्य चुनौती है जिसे A2RBench हल करता है।

यहाँ बताया गया है कि कैसे उन्होंने AI के लिए एक बेहतर परीक्षण बनाया, इसे सरल भाषा में समझाया गया है।

1. समस्या: "नकली जीनियस" का जाल

वर्तमान AI मॉडल (LLMs) बुद्धिमान दिखने में बहुत माहिर हैं। लेकिन शोधकर्ताओं को डर है कि वे केवल "स्टोकेस्टिक पैरट्स" (stochastic parrots) हैं—वे केवल अगले शब्द का अनुमान लगाते हैं जो उन्होंने पहले देखा है, न कि वास्तव में तर्क को समझने की कोशिश करते हैं।

मौजूदा परीक्षणों में एक दोष है:

  • छोटे परीक्षण (जैसे प्रसिद्ध ARC) वास्तविक सोच की जाँच करने के लिए बेहतरीन हैं, लेकिन मनुष्यों को हर एक पहेली को खुद से बनाना पड़ता है। AI को पूरी तरह से परखने के लिए पर्याप्त पहेलियाँ बनाने में यह बहुत धीमा है।
  • बड़े परीक्षण (जैसे गणित के सवाल) बड़ी संख्या में बनाना आसान है, लेकिन हो सकता है कि AI केवल अपने प्रशिक्षण डेटा से उत्तरों को याद कर रहा हो, न कि वास्तव में समस्या को हल कर रहा हो।

2. समाधान: एक स्व-जाँच करने वाली फैक्ट्री

लेखकों ने A2RBench बनाया, जो एक स्वचालित फैक्ट्री की तरह है जो लॉजिक पहेलियाँ बनाती है। लेकिन यहाँ एक जादुई ट्रिक है: फैक्ट्री पहेली और उसका उत्तर (answer key) एक साथ बनाती है, और फिर AI को दिखाने से पहले यह जाँचती है कि क्या वे आपस में पूरी तरह फिट बैठते हैं।

वे साइकिल कंसिस्टेंसी (Cycle Consistency) नामक अवधारणा का उपयोग करते हैं। इसे ताले और चाबी की तरह समझें:

  1. फॉरवर्ड लॉक (एन्कोडर): AI को अक्षरों की एक सूची को उलझाने (scramble करने) के लिए एक नियम बनाने के लिए कहा जाता है (जैसे, "HELLO" को "HLELO" में बदलना)।
  2. बैकवर्ड की (डिकोडर): AI को इसे वापस "HELLO" में अनस्क्रैम्बल करने के लिए भी एक नियम बनाना होगा।
  3. सुरक्षा जाँच: फैक्ट्री बॉक्स को लॉक करने की कोशिश करती है और फिर तुरंत उसे अनलॉक करने की कोशिश करती है। यदि परिणाम बिल्कुल "HELLO" ही रहता है, तो नियम वैध है। यदि बॉक्स अटक जाता है या अक्षर बदल जाते हैं, तो नियम को कचरे में फेंक दिया जाता है।

यह गारंटी देता है कि उत्पन्न की गई प्रत्येक पहेली का एक अद्वितीय सही उत्तर है और वह केवल एक भ्रम (hallucination) या बनावटी विचार नहीं है।

3. फैक्ट्री प्रक्रिया

यह पाइपलाइन चार चरणों में काम करती है, जैसे कि एक प्रोडक्शन लाइन:

  • सीड जनरेशन (Seed Generation): एक "डिजाइनर AI" कुछ उच्च गुणवत्ता वाले, जटिल लॉजिक नियम बनाता है (जैसे ताश के पत्तों को फेंटना या 3D क्यूब को घुमाना)।
  • एक्सपेंशन (Expansion): एक "बिल्डर AI" उन वैध नियमों को लेता है और इनपुट बदलकर हजारों विविधताएँ बनाता है (जैसे, 5 पत्तों के बजाय 52 पत्तों का डेक, या 2D स्क्वायर के बजाय 3D क्यूब का उपयोग करना)।
  • वेरिफिकेशन (Verification): फैक्ट्री कोड चलाकर यह सुनिश्चित करती है कि इन नई विविधताओं के लिए "ताला और चाबी" अभी भी पूरी तरह से काम करते हैं।
  • इवैल्यूएशन (Evaluation): "सॉल्वर AI" (जिस मॉडल का परीक्षण किया जा रहा है) पहेलियों को हल करने की कोशिश करता है।

4. उन्होंने क्या पाया: AI की कमजोरियाँ

उन्होंने दुनिया के 14 सबसे स्मार्ट AI मॉडलों का इस नए बेंचमार्क के विरुद्ध परीक्षण किया। परिणाम आश्चर्यजनक और विनम्र करने वाले थे:

  • तोता बनाम विचारक: सबसे अच्छे AI मॉडल भी केवल लगभग 40% पहेलियों को सही हल कर पाए। इसकी तुलना में, मनुष्यों ने लगभग 69% सही हल किया। AI अभी भी वास्तविक "सिस्टम 2" सोच (धीमी, विचारशील तर्क प्रक्रिया) करने के लिए संघर्ष कर रहा है और अक्सर पैटर्न मिलान पर निर्भर रहता है।
  • डायमेंशनल ट्रैप (आयामी जाल): आप सोचेंगे कि 2D पहेलियाँ (स्क्वायर) की तुलना में 3D पहेलियाँ (क्यूब) कठिन होती हैं। लेकिन AI ने 3D की तुलना में 2D पहेलियों पर खराब प्रदर्शन किया!
    • क्यों? पहेलियाँ बनाने वाला "डिजाइनर AI" जटिल 2D नियम बनाने की कोशिश करते समय भ्रमित हो गया। उसने वैध बनाए रखने के लिए गलती से 3D नियमों को सरल बना दिया। इसलिए, AI ने "कठिन" 3D पहेलियों को बेहतर तरीके से हल किया क्योंकि वे तर्क के मामले में वास्तव में आसान थीं।
  • जटिलता का विरोधाभास (Complexity Paradox): कभी-कभी, AI को अधिक जटिल, अस्त-व्यस्त इनपुट देने से उसे हल करना आसान हो जाता है!
    • उपमा: एक भूलभुलैया (maze) की कल्पना करें। यदि भूलभुलैया सरल है, तो AI रास्ते का अनुमान लगा सकता है। लेकिन यदि भूलभुलैया बहुत विशिष्ट, संरचित सुरागों (उच्च जटिलता) से भरी है, तो यह वास्तव में AI को एकमात्र तार्किक पथ का पालन करने के लिए मजबूर करती है, जिससे इसके रैंडम अनुमान लगाने की क्षमता कम हो जाती है।

5. "सिंबल" का भ्रम

शोधकर्ताओं ने यह भी परीक्षण किया कि क्या AI केवल विशिष्ट प्रतीकों (symbols) को याद कर रहा है (जैसे यह जानना कि "A", "B" से पहले आता है)। उन्होंने प्रतीकों को बदल दिया (जैसे "A" को "X" में और "B" को "Y" में बदलना) लेकिन तर्क को समान रखा।

  • कई मॉडल प्रतीकों के बदलते ही विफल हो गए। इससे सिद्ध हुआ कि वे अमूर्त नियम (abstract rule) को समझने के बजाय परिचित टोकन (जैसे "Hello" शब्द को पहचानना) पर निर्भर थे।

सारांश

A2RBench एक नया, स्वचालित तरीका है यह परीक्षण करने का कि क्या AI वास्तव में सोच रहा है या केवल नकल कर रहा है। यह सुनिश्चित करने के लिए कि प्रत्येक परीक्षण निष्पक्ष और हल करने योग्य है, यह "ताला और चाबी" सत्यापन प्रणाली का उपयोग करता है। परिणाम बताते हैं कि हालांकि AI बेहतर हो रहा है, लेकिन याद किए गए पैटर्न पर निर्भर हुए बिना जटिल नियमों को समझने के मामले में मानव अमूर्त तर्क (abstract reasoning) के बराबर पहुँचने के लिए उसे अभी लंबा रास्ता तय करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →