← नवीनतम पेपर
🤖 AI

Risk-Controlled Lean-as-Judge for Natural-Language Mathematical Reasoning

यह शोध पत्र COVCAL को प्रस्तुत करता है, जो एक जोखिम-नियंत्रण ढांचा (risk-control framework) है जो प्रूफ़ कवरेज और नैदानिक संकेतों (diagnostic signals) के आधार पर उत्तरों को गतिशील रूप से चुनकर, प्राकृतिक-भाषा गणितीय समस्याओं के लिए जज के रूप में लीन (Lean) औपचारिकीकरण (formalization) के उपयोग की विश्वसनीयता को प्रमाणित करता है, यह प्रदर्शित करते हुए कि जहाँ छोटे ऑटोफॉर्मलाइज़र (autoformalizers) जोखिम-नियंत्रित स्वीकृति के लिए बहुत विरल संकेत प्रदान करते हैं, वहीं विशिष्ट फॉर्मलाइज़र सख्त जोखिम सीमाओं के तहत उच्च-सटीकता चयन को सक्षम करते हैं।

मूल लेखक: Pauline Bourigault, Xiaotong Ji, Matthieu Zimmer, Rasul Tutunov, Haitham Bou Ammar

प्रकाशित 2026-05-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pauline Bourigault, Xiaotong Ji, Matthieu Zimmer, Rasul Tutunov, Haitham Bou Ammar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप गणित के होमवर्क की ढेरी को ग्रेड दे रहे एक शिक्षक हैं। आपके पास Lean नाम का एक बहुत ही सख्त, सुपर-स्मार्ट रोबोट सहायक है। Lean का काम यह जांचना है कि क्या छात्र का उत्तर गणितीय रूप से सटीक है, इसके लिए एक औपचारिक प्रमाण (formal proof) बनाने की कोशिश करना है।

आमतौर पर, यदि Lean कहता है "Proof Successful" (प्रमाण सफल), तो आप जानते हैं कि उत्तर सही है। लेकिन क्या होगा यदि Lean कहता है "Proof Failed" (प्रमाण विफल)? क्या इसका मतलब यह है कि छात्र गलत है? या इसका मतलब केवल यह है कि रोबोट भ्रमित हो गया, उसके पास समय खत्म हो गया, या वह छात्र की लिखावट को समझ नहीं पाया?

यह शोध पत्र, "Risk-Controlled Lean-as-Judge," ठीक इसी समस्या का समाधान करता है। लेखक तर्क देते हैं कि हमें Lean के "No" (नहीं) सिग्नल पर आँख मूंदकर भरोसा नहीं करना चाहिए। इसके बजाय, उन्होंने COVCAL (कवरेज-कैलिब्रेटेड) नामक एक नया सिस्टम बनाया है जो एक स्मार्ट फिल्टर की तरह काम करता है, जो यह तय करता है कि कब Lean पर भरोसा किया जाए और कब यह कहना है, "मेरे पास निर्णय लेने के लिए पर्याप्त जानकारी नहीं है।"

यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:

1. समस्या: "कवरेज क्लिफ" (The Coverage Cliff)

कल्प diजिये कि आप एक विशाल जंगल में एक विशिष्ट प्रकार के पक्षी की तलाश कर रहे हैं।

  • अच्छी खबर: यदि आपको एक पक्षी मिल जाता है और वह स्पष्ट रूप से सही प्रजाति का है, तो आप 96% सुनिश्चित हैं कि आप सही हैं।
  • बुरी खबर: यदि आपको वह पक्षी नहीं मिलता है, तो इसका मतलब यह नहीं है कि पक्षी वहाँ नहीं है। हो सकता है कि आपने केवल 10% जंगल देखा हो (कम कवरेज), या आपके दूरबीन धुंधले थे (रोबोट गणित को समझने में विफल रहा)।

इस घटना को शोध पत्र में "कवरेज क्लिफ" कहा गया है।

  • उच्च कवरेज (High Coverage): यदि रोबोट ने अधिकांश संभावित उत्तरों की जाँच की और एक विजेता खोज लिया, तो वह विजेता लगभग निश्चित रूप से सही है (96% सटीकता)।
  • निम्न कवरेज (Low Coverage): यदि रोबोट ने केवल उत्तरों का एक छोटा सा हिस्सा ही जाँचा और विफल रहा, तो उसके द्वारा चुना गया "विजेता" मूल रूप से एक अनुमान है (केवल 20% सटीकता)।

एक "विफल खोज" को "गलत उत्तर" मानने का खतरा बना रहता है। शोध पत्र दिखाता है कि एक विफल प्रमाण अक्सर केवल एक "गायब मानचित्र" होता है, न कि "गलत मंजिल"।

2. समाधान: COVCAL (द स्मार्ट फिल्टर)

लेखकों ने COVCAL बनाया है, एक ऐसा सिस्टम जो केवल यह नहीं पूछता कि "क्या Lean ने इसे सिद्ध किया?" बल्कि यह तीन प्रश्न पूछता है:

  1. क्या हमने पर्याप्त जंगल देखा? (Typed Coverage: क्या रोबोट गणित की भाषा को समझ पाया?)
  2. क्या हमें वास्तव में कोई विजेता मिला? (Proved Coverage: क्या रोबोट ने एक उत्तर को सफलतापूर्वक सिद्ध किया?)
  3. क्या विजेता दूसरों की तुलना में स्पष्ट रूप से बेहतर है? (Formal Margin: क्या रोबोट ने शीर्ष उत्तर को सिद्ध किया, या उसने एक मजबूत, अप्रमाणित प्रतिद्वंद्वी को अनदेखा करते हुए एक कमजोर उत्तर को सिद्ध कर दिया?)

नियम: COVCAL एक उत्तर को तभी स्वीकार करता है जब "प्रमाण" मजबूत हो और "कवरेज" इतना उच्च हो कि निश्चित होने के लिए पर्याप्त हो। यदि कवरेज बहुत कम है, तो COVCAL कहता है, "I abstain" (मैं इससे परहेज करता हूँ)। यह अनुमान लगाने से इनकार कर देता है।

3. शर्त: रोबोट को विशेषज्ञ होना चाहिए

लेखकों ने अनुवाद करने के लिए दो अलग-अलग "रोबोट दिमागों" (autoformalizers) का परीक्षण किया:

  • द जनरलिस्ट (7B मॉडल): यह रोबोट कई चीजों में ठीक है लेकिन जटिल गणित को अनुवाद करने में खराब है। यह केवल 28% समस्याओं को अनुवाद करने में सक्षम रहा। क्योंकि इसने बहुत कुछ मिस कर दिया, इसलिए "कवरेज क्लिफ" बहुत तीव्र था। सुरक्षा प्रणाली (COVCAL) को "Reject All" (सभी को अस्वीकार करें) कहना पड़ा क्योंकि यह सुरक्षित होने के लिए पर्याप्त डेटा प्राप्त नहीं कर सका।
  • द स्पेशलिस्ट (8B Prover मॉडल): इस रोबोट को विशेष रूप से गणितीय प्रमाणों पर प्रशिक्षित किया गया था। इसने 79% समस्याओं का अनुवाद किया। अचानक, डेटा इतना घना हो गया! सुरक्षा प्रणाली अब कह सकती थी, "ठीक है, मैं पर्याप्त जंगल देख पा रहा हूँ। मैं इस प्रमाण पर भरोसा कर सकता हूँ।"

सबक: यह केवल एक बड़ा रोबोट होने के बारे में नहीं है; यह इस बारे में है कि आपके पास काम के लिए सही रोबोट हो। एक विशेष रोबोट (specialized robot) सुरक्षा प्रणाली को प्रभावी बनाता है; एक सामान्य (general) रोबोट इसे विफल कर देता है।

4. "फेथफुलनेस" (Faithfulness) का आश्चर्य

लेखकों ने एक मैन्युअल ऑडिट (मानवीय जाँच) भी किया। उन्होंने एक अजीब बात पाई:

  • कभी-कभी Lean एक ऐसे कथन को सिद्ध करता है जो सत्य है, लेकिन वास्तविक प्रश्न के लिए अप्रासंगिक है।
  • उपमा: कल्पना कीजिए कि एक छात्र से पूछा गया, "2 + 2 क्या है?" छात्र एक प्रमाण लिखता है कि "2 + 2 = 4" सत्य है, लेकिन वह यह भी सिद्ध करता है कि "चंद्रमा पनीर से बना है" सत्य है। Lean उस पनीर वाले प्रमाण की जाँच कर सकता है और कह सकता है "Success!" भले ही उसने गणित के प्रश्न का उत्तर न दिया हो।
  • शोध पत्र में पाया गया कि लगभग आधे "सफल" प्रमाण वास्तव में इनमें से अप्रासंगिक सत्यों के ही उदाहरण थे। यही कारण है कि सिस्टम को सावधान रहने की आवश्यकता है: Lean से मिलने वाला "ग्रीन लाइट" हमेशा यह नहीं बताता कि उत्तर सही है; यह केवल यह बताता है कि कथन सही है।

सारांश

यह शोध पत्र AI गणितीय प्रमाणों का उपयोग करने का एक नया तरीका प्रस्तावित करता है:

  1. विफलता पर घबराएं नहीं: एक विफल प्रमाण आवश्यक रूप से गलत उत्तर नहीं है; यह केवल एक अनुवाद त्रुटि हो सकती है।
  2. कवरेज की जाँच करें: प्रमाण पर तभी भरोसा करें जब रोबोट ने निश्चित होने के लिए पर्याप्त संभावित उत्तरों की जाँच की हो।
  3. अनिश्चित होने पर परहेज करें: यदि रोबोट ने समस्या के पर्याप्त हिस्से को नहीं देखा है, तो सिस्टम को गलत अनुमान लगाने के बजाय यह स्वीकार करना चाहिए कि वह नहीं जानता।
  4. विशेषज्ञता मायने रखती है: इस सुरक्षा प्रणाली को प्रभावी ढंग से चलाने के लिए आपको एक गणित-विशेषज्ञ रोबोट की आवश्यकता है।

संक्षेप में, COVCAL एक सुरक्षा हार्नेस (safety harness) है जो हमें बताता है कि हम गणित रोबोट पर कब भरोसा कर सकते हैं और कब हमें पीछे हटकर कहना चाहिए, "मुझे और सबूतों की आवश्यकता है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →