FormInv: A Measurement Protocol for Semantic Invariance in Mathematical Reasoning Benchmarks
यह शोध पत्र FormInv प्रस्तुत करता है, जो एक ऐसा मापन प्रोटोकॉल है जो यह उजागर करता है कि गणितीय तर्क संबंधी बेंचमार्क में सिमेंटिक इनवेरिएंस (अर्थगत अपरिवर्तनीयता) की खामियां मॉडल रैंकिंग को कैसे विकृत करती हैं और समग्र सटीकता तथा सिमेंटिक निरंतरता के बीच एक महत्वपूर्ण अंतर को प्रकट करती है, जो यह प्रदर्शित करता है कि बेंचमार्क डिजाइन के विकल्प अप्रत्यक्ष रूप से यह निर्धारित करते हैं कि कौन से मॉडल श्रेष्ठ दिखाई देते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "FormInv" पेपर का सरल भाषा और रोजमर्रा के उदाहरणों का उपयोग करते हुए स्पष्टीकरण दिया गया है।
मुख्य विचार: "आकार बदलने वाला" टेस्ट (The "Shape-Shifting" Test)
कल्पना कीजिए कि एक छात्र गणित की परीक्षा दे रहा है। आप उससे पूछते हैं, "क्या 4 का वर्गमूल (square root) 0 के बराबर या उससे बड़ा है?" वह उत्तर देता है, "हाँ।" फिर, आप ठीक वही सवाल पूछते हैं लेकिन शब्दों को थोड़ा बदल देते हैं: "क्या 0, 4 के वर्गमूल के बराबर या उससे छोटा है?"
यदि छात्र वास्तव में बुद्धिमान है, तो उसे दोनों का उत्तर "हाँ" देना चाहिए। लेकिन क्या होगा यदि वह पहले वाले का सही उत्तर दे लेकिन दूसरे वाले में गलत हो जाए?
यही वह बात है जो इस शोध पत्र ने सबसे उन्नत AI मॉडल्स (जैसे GPT-4o, Claude, और DeepSeek) के बारे में खोजी है। भले ही वे गणित में अविश्वसनीय रूप से अच्छे हैं, लेकिन वे आश्चर्यजनक रूप से नाजुक (fragile) हैं। यदि आप बिना अर्थ बदले प्रश्न का आकार बदल देते हैं, तो AI अक्सर भ्रमित हो जाता है और अलग उत्तर देता है।
लेखक इस स्थिरता की कमी को "सिमेंटिक इनवेरिएंस गैप" (Semantic Invariance Gap) कहते हैं। सरल शब्दों में: AI गणित को समझता नहीं है; वह केवल वाक्य के पैटर्न को पहचानता है।
समस्या: "ट्रिक क्वेश्चन" का जाल (The "Trick Question" Trap)
यह पेपर तर्क देता है कि वर्तमान बेंचमार्क (AI के लिए मानक परीक्षण) दोषपूर्ण हैं क्योंकि वे सवाल केवल एक विशिष्ट तरीके से पूछते हैं। यह एक ड्राइवर को केवल एक सीधे राजमार्ग पर चलाने के परीक्षण जैसा है। वे वहां बेहतरीन ड्राइविंग कर सकते हैं, लेकिन यदि आप उनसे उसी मार्ग पर चलने को कहें लेकिन लेन बदल दें, तो वे दुर्घटनाग्रस्त हो सकते हैं।
शोधकर्ताओं ने पाया कि:
- उच्च स्कोर भ्रामक हैं: एक AI मानक टेस्ट पर 96% उत्तर सही दे सकता है। लेकिन जब आप उन्हीं सवालों को अलग तरीकों से पूछते हैं, तो वह "96%" काफी कम हो जाता है क्योंकि AI यह समझने में विफल रहता है कि सवाल एक ही हैं।
- "रैंकिंग रिवर्सल" (The Ranking Reversal): यह सबसे चौंकाने वाला हिस्सा है। आप सवाल कैसे पूछते हैं, इस पर निर्भर करता है कि विजेता कौन है।
- यदि आप सवाल "क्रम A" में पूछते हैं, तो मॉडल X जीतता है।
- यदि आप उन्हीं सवालों को "क्रम B" में पूछते हैं, तो मॉडल Y जीतता है।
- यह एक स्पोर्ट्स लीग की तरह है जहाँ खेल के नियम बदलने पर चैंपियनशिप जीतने वाली टीम बदल जाती है, भले ही खिलाड़ी वही हों।
समाधान: "सर्वसम्मति ऑडिट" (The "Unanimity Audit")
आप इन खराब सवालों को कैसे पकड़ें? लेखकों ने FormInv नामक एक प्रोटोकॉल बनाया है।
इसे एक टैलेंट शो के जजों के पैनल की तरह समझें। यदि आपके पास 9 अलग-अलग जज (AI मॉडल्स) हैं और वे सभी इस बात पर सहमत हैं कि एक विशिष्ट प्रश्न भ्रमित करने वाला या टूटा हुआ है, तो संभावना है कि प्रश्न टूटा हुआ है, जज नहीं।
- प्रोटोकॉल: वे एक प्रश्न लेते हैं और 9 अलग-अलग AI मॉडल्स से उसका उत्तर पूछते हैं।
- खोज: यदि 9 में से 6 मॉडल प्रश्न के "पैराफ्रेज्ड" (शब्दों में बदले गए) संस्करण का गलत उत्तर देते हैं, लेकिन वे सभी मूल संस्करण का सही उत्तर देते हैं, तो सिस्टम उस बदले हुए प्रश्न को "टूटा हुआ" (broken) घोषित कर देता है।
- परिणाम: उन्होंने पाया कि मौजूदा परीक्षणों में लगभग 3% से 47% "बदले हुए" प्रश्न वास्तव में गणितीय रूप से गलत या भ्रमित करने वाले थे। AI गणित में विफल नहीं हो रहा था; बल्कि टेस्ट (परीक्षण) AI के प्रति विफल हो रहा था।
"नो-फ्री-बेंचमार्क" नियम (The "No-Free-Benchmark" Rule)
यह पेपर एक साहसी दावा करता है: कोई भी टेस्ट परफेक्ट नहीं होता।
कल्पना कीजिए कि आप 9 अलग-अलग कारों को रैंक करने की कोशिश कर रहे हैं।
- यदि आप उन्हें गति (speed) पर टेस्ट करते हैं, तो कार A जीतती है।
- यदि आप उन्हें ईंधन दक्षता (fuel efficiency) पर टेस्ट करते हैं, तो कार B जीतती है।
- यदि आप उन्हें हैंडलिंग (handling) पर टेस्ट करते हैं, तो कार C जीतती है।
लेखक कहते हैं कि AI गणित परीक्षणों के साथ भी ऐसा ही होता है। चूंकि कोई भी एक AI हर प्रकार के बदलाव (rewording) में परफेक्ट नहीं है, इसलिए टेस्ट डिजाइन करने वाला व्यक्ति यह चुन सकता है कि किस "प्रकार" के सवाल शामिल करने हैं। सवालों को चुनकर, वे गुप्त रूप से यह तय कर रहे होते हैं कि दौड़ कौन जीतेगा। यह पेपर इस चुनाव को पारदर्शी बनाने के लिए एक उपकरण प्रदान करता है ताकि हमें पता चल सके कि मॉडल क्यों जीता।
मुख्य निष्कर्ष (Key Takeaways)
- सटीकता (Accuracy) ही सब कुछ नहीं है: एक मॉडल 96% सटीक हो सकता है लेकिन फिर भी आधे समय विफल हो सकता है जब आप प्रश्न को फिर से लिखते हैं। इसका मतलब है कि वह वास्तव में गणित को "समझता" नहीं है; वह केवल पैटर्न के आधार पर अनुमान लगा रहा है।
- "इनवेरिएंस गैप" (The Invariance Gap): यह एक नया स्कोर है जो मापता है कि एक AI कितना सुसंगत (consistent) है। यदि एक AI सवाल पूछे जाने के तरीके के बावजूद एक ही उत्तर देता है, तो उसका "इनवेरिएंस" स्कोर उच्च होता है। अध्ययन में सर्वश्रेष्ठ मॉडल्स भी लगभग 82% निरंतरता प्राप्त कर पाए, जिसका अर्थ है कि वे लगभग 5 में से 1 सवाल पर असंगत थे।
- टेस्ट को ठीक करना: लेखकों ने एक टूल (FormInv) बनाया है जो स्वचालित रूप से यह जांचता है कि क्या कोई टेस्ट प्रश्न "टूटा हुआ" है, यह देखकर कि क्या कई AI मॉडल्स भ्रमित हो रहे हैं। उन्होंने इसका उपयोग मौजूदा टेस्ट को ठीक करने के लिए किया, जिससे शीर्ष AI मॉडल्स की रैंकिंग बदल गई।
सारांश उपमा (Summary Analogy)
कल्पना कीजिए कि आप एक अनुवादक (translator) का परीक्षण कर रहे हैं।
- पुराना तरीका: आप अनुवादक से "The cat is on the mat" को फ्रेंच में अनुवाद करने के लिए कहते हैं। वे इसे पूरी तरह से करते हैं। आप उन्हें 'A' ग्रेड देते हैं।
- नया तरीका (FormInv): आप उनसे "The mat has a cat on it," "Is the cat on the mat?" और "On the mat sits the cat" का अनुवाद करने के लिए कहते हैं।
- परिणाम: वे पहले वाले को सही करते हैं लेकिन अन्य में विफल हो जाते हैं। आपको एहसास होता है कि वे वास्तव में फ्रेंच नहीं समझते; उन्होंने बस पहले वाक्य को रट लिया था।
FormInv वह उपकरण है जो हमें दूसरा सेट के सवाल पूछने के लिए मजबूर करता है ताकि हम देख सकें कि कौन वास्तव में भाषा को समझता है और कौन केवल पैटर्न को याद कर रहा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।