When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMs
यह शोध पत्र CALVER को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) प्रतीकात्मक सत्यापनकर्ता (symbolic verifier) है जो पर्ल के कारण संबंधी मानदंडों (Pearl's causal criteria) के विरुद्ध संरचित तर्क प्रक्षेप पथों (structured reasoning traces) को स्कोर करके कारण संबंधी तर्क (causal reasoning) में पारंपरिक वोटिंग और रिवॉर्ड-आधारित विधियों से बेहतर प्रदर्शन करता है ताकि तब भी वैध उत्तरों की पहचान की जा सके जब कई सही समाधान मौजूद हों।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे हैं, जैसे कि यह पता लगाना कि आपके कमरे में रखा एक पौधा क्यों मर रहा है। आप एक सुपर-स्मार्ट एआई (AI) जासूस से सुरागों को देखने के लिए कह सकते हैं। एआई केवल एक उत्तर नहीं देता; यह समस्या पर दस अलग-अलग तरीकों से विचार करने की कोशिश करता है, जैसे कि एक जासूस दस अलग-अलग सिद्धांतों को आजमा रहा हो। आमतौर पर, यदि एआई बुद्धिमान है, तो उन दस में से अधिकांश सिद्धांत एक ही होंगे, और जो उत्तर सबसे अधिक बार आता है, वह संभवतः सही होता है। इसे "वोटिंग" या "सेल्फ-कंसिस्टेंसी" (self-consistency) कहा जाता है, और यह गणितीय समस्याओं या सरल तर्क पहेलियों के लिए बहुत अच्छा काम करता है जहाँ केवल एक ही सही उत्तर होता है।
लेकिन क्या होता है जब रहस्य के कई सही उत्तर होते हैं? कल्पना कीजिए कि पौधा मरने के तीन अलग-अलग संभावित कारण हैं: बहुत अधिक धूप, पर्याप्त पानी की कमी, या कोई कीड़ा। ये तीनों ही वैध कारण हैं। यदि आप एआई को दस बार सोचने के लिए कहते हैं, तो वह शायद "धूप" तीन बार, "पानी" तीन बार, और "कीड़ा" तीन बार अनुमान लगा सकता है। वोट बँट गए! इस बीच, एआई गलती से "पौधा भूखा है" चार बार अनुमान लगा सकता है। भले ही "भूखा है" एक बेतुका, गलत उत्तर हो, लेकिन यह केवल इसलिए जीत जाता है क्योंकि यह सबसे लोकप्रिय अनुमान था। यही वह पेचीदा समस्या है जिस पर यह शोध पत्र काम करता है: जब कई सही उत्तर होते हैं, तो सामान्य "बहुमत का नियम" वास्तव में गलत उत्तर चुन सकता है।
शोधकर्ता, जो आर्टिफिशियल इंटेलिजेंस और कॉज़ल रीजनिंग (causal reasoning - जिसका अर्थ है केवल "कारण और प्रभाव को समझना") के क्षेत्र में काम कर रहे हैं, ने पाया कि यह "बँटे हुए वोट" (split vote) वाली समस्या एआई के लिए एक बड़ी सिरदर्द है। उन्होंने पाया कि जब एआई से किसी समस्या को ठीक करने का कोई भी वैध तरीका खोजने के लिए कहा जाता है, तो सही उत्तर अक्सर कई अलग-अलग विकल्पों में बिखरे हुए होते हैं, जबकि एक गलत उत्तर गलती से सबसे लोकप्रिय बन सकता है।
इसे ठीक करने के लिए, टीम ने CALVER (Causal Axiom-Level VERification) नामक एक नया टूल बनाया। CALVER को एक लोकप्रियता प्रतियोगिता के बजाय एक सख्त, नियम मानने वाले रेफरी के रूप में समझें। उत्तरों को गिनने के बजाय, CALVER कारण और प्रभाव के नियमों के एक सेट के विरुद्ध हर एक अनुमान की जाँच करता है। यह पूछता है, "क्या यह उत्तर भौतिकी और तर्क के नियमों के अनुसार वास्तव में समझ में आता है?" यदि कोई उत्तर नियमों का पालन करता है, तो उसे उच्च स्कोर मिलता है, भले ही वह अपने प्रकार का अकेला उत्तर क्यों न हो। यदि कोई उत्तर नियमों को तोड़ता है, तो उसे शून्य मिलता है, भले ही वह सबसे लोकप्रिय अनुमान क्यों न रहा हो।
यह शोध पत्र दिखाता है कि नियमों की जाँच करना केवल वोटों को गिनने से कहीं बेहतर काम करता है। अपने परीक्षणों में, CALVER लगभग 42.1% बार सही उत्तर खोजने में सक्षम था, जबकि पुराने "सबसे लोकप्रिय के लिए वोट देने" वाले तरीके ने इसे केवल लगभग 30% बार ही सही पाया। यह अंतर तब और बढ़ गया जब उन्होंने एआई को अधिक बार प्रयास करने (32 प्रयासों तक) की अनुमति दी, जिसमें CALVER भारी अंतर से आगे निकल गया। उन्होंने यह भी साबित किया कि यह तब भी काम करता है जब एआई को नियमों को स्पष्ट रूप से दिए जाने के बजाय, नियमों को समझने के लिए एक उलझी हुई कहानी पढ़नी पड़ती है।
लेखक बहुत सावधानी से कहते हैं कि यह कोई जादू नहीं है; यह एक विशिष्ट समस्या के लिए एक विशिष्ट समाधान है। उन्होंने गणितीय रूप से सिद्ध किया कि जब कई वैध उत्तर होते हैं, तो वोटिंग अक्सर विफल हो जाती है, और उन्होंने प्रयोगों के माध्यम से दिखाया कि नियमों की जाँच करना काम करता है। उन्होंने इन परीक्षणों को उन तर्क पहेलियों पर भी किया जिनका पौधों या कारणों से कोई लेना-देना नहीं है, और वही "नियमों की जाँच करने" वाला विचार अभी भी काम करता है। हालाँकि, उन्होंने यह भी नोट किया कि यदि समस्या सरल है और इसका केवल एक ही सही उत्तर है, तो पुराना वोटिंग तरीका अभी भी ठीक है। लेकिन उन पेचीदा स्थितियों के लिए, जहाँ एक पहेली को हल करने के कई सही तरीके हैं, CALVER वह नया चैंपियन है जो एआई को लोकप्रियता के जाल में फँसने से रोकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।