OProver: A Unified Framework for Agentic Formal Theorem Proving
OProver, Lean 4 में एजेंटिक औपचारिक प्रमेय प्रमाण (agentic formal theorem proving) के लिए एक एकीकृत ढांचा है जो इटरेटिव प्रूफ रिवीज़न को कंपाइलर फीडबैक और रिट्रीवल के साथ एकीकृत करता है, जो निरंतर प्रीट्रेनिंग, रिपेयर ट्रेजेक्टरीज पर सुपरवाइज्ड फाइन-ट्यूनिंग और कठिन मामलों पर रीइन्फोर्समेंट लर्निंग को संयोजित करने वाले एक नवीन प्रशिक्षण पाइपलाइन के माध्यम से कई बेंचमार्क में अत्याधुनिक प्रदर्शन प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही कठिन गणितीय पहेली को हल करने की कोशिश कर रहे हैं, लेकिन आपको उसका समाधान Lean 4 नामक एक सख्त, रोबोटिक भाषा में लिखना होगा। यदि आप एक भी छोटी सी टाइपिंग की गलती या तार्किक त्रुटि करते हैं, तो कंप्यूटर (जिसे "कंपाइलर" कहा जाता है) उसे खारिज कर देगा और कहेगा, "नहीं, गलत।"
लंबे समय तक, इन पहेलियों को हल करने वाले AI मॉडल एक छात्र की तरह काम करते थे जो परीक्षा दे रहा हो: वे एक उत्तर का अनुमान लगाते थे, और यदि वह गलत होता, तो वे शून्य से फिर से नया अनुमान लगाते थे। वे वास्तव में यह नहीं समझते थे कि वे क्यों गलत थे, और उन्होंने गलतियों को सुधारने के लिए कंप्यूटर के विशिष्ट फीडबैक का उपयोग नहीं किया।
OProver एक नया सिस्टम है जो खेल बदल देता है। केवल अनुमान लगाने के बजाय, यह एक परफेक्शनिस्ट जासूस (perfectionist detective) की तरह काम करता है जो कभी हार नहीं मानता। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:
1. "एजेंटिक" जासूस (The Prover)
OProver को केवल एक स्थिर पाठ्यपुस्तक के रूप में नहीं, बल्कि एक ऐसे जासूस के रूप में सोचें जिसके पास एक बहु-चरणीय जांच प्रक्रिया (multi-step investigation process) है।
- पुराना तरीका: जासूस एक सिद्धांत लिखता है, जज (कंप्यूटर) कहता है "गलत," और जासूस शुरू से एक पूरी तरह से नया सिद्धांत लिखता है।
- OProves का तरीका: जासूस एक सिद्धांत लिखता है। जज कहता है, "आपने यहाँ एक गलती की है: आपने संख्या के गलत प्रकार का उपयोग किया है।" जासूस फिर उस सिद्धांत के उस विशिष्ट भाग को संशोधित (edit) करता है, उसे फिर से जाँचता है, और उसे तब तक परिष्कृत करता रहता है जब तक कि जज यह न कह दे, "सही!"
OProver इस "संशोधित और परिष्कृत" (edit and refine) नृत्य को स्वचालित रूप से करने के लिए प्रशिक्षित है। यह केवल अनुमान नहीं लगाता; यह जज की विशिष्ट शिकायतों को सुनने और उन्हें ठीक करने के लिए प्रशिक्षित होता है।
2. "समाधानों का पुस्तकालय" (Retrieval)
जासूस लिखने से पहले, वे शून्य में काम नहीं करते हैं। वे एक विशाल पुस्तकालय (जिसे रिट्रीवल मेमोरी कहा जाता है) में जाते हैं।
- यदि जासूस त्रिभुजों (triangles) के बारे में एक पहेली हल करने की कोशिश कर रहा है, तो पुस्तकालय तुरंत उन शीर्ष 5 सर्वश्रेष्ठ प्रमाणों (proofs) को निकाल लेता है जो अन्य जासूसों ने सफलतापूर्वक हल किए थे।
- OProver इन "चीट शीट्स" को पढ़ता है ताकि देख सके कि अन्य लोगों ने समान समस्याओं को कैसे हल किया, और उनके रणनीतियों का उपयोग एक मार्गदर्शक के रूप में करता है। यह जासूस को सामान्य जाल से बचने में मदद करता है।
3. "स्व-सुधार चक्र" (The Training)
यह सबसे जादुई हिस्सा है। आमतौर पर, AI मॉडल को डेटा के एक निश्चित सेट पर प्रशिक्षित किया जाता है और फिर अकेला छोड़ दिया जाता है। OProver अलग है; इसमें एक स्व-सुधार चक्र (self-improving cycle) है।
- चरण 1: OProver कई पहेलियों को हल करने की कोशिश करता है।
- चरण 2: जब वह सफल होता है, तो वह उस समाधान को पुस्तकालय में सहेज लेता है ताकि भविष्य की समस्याओं के लिए उसका उपयोग "चीट शीट" के रूप में किया जा सके।
- चरण 3: जब वह विफल होता है, तो वह विफलता की पूरी कहानी सहेजता है—कि कैसे वह विफल हुआ, कंप्यूटर ने क्या कहा, और उसने अंततः इसे कैसे ठीक किया।
- चरण 4: सिस्टम इन "विफलता की कहानियों" का उपयोग खुद को बेहतर बनाने के लिए सीखने के रूप में करता है।
यह एक ऐसे छात्र की तरह है जो, हर परीक्षा के बाद, न केवल सही उत्तर याद रखता है, बल्कि यह भी लिखता है कि वे प्रश्न गलत क्यों हुए और उन नोट्स को अपने अध्ययन गाइड में जोड़ देता है। समय के साथ, छात्र स्मार्ट होता जाता है, और अध्ययन गाइड अधिक घनी और अधिक सहायक होती जाती है।
4. परिणाम: एक सुपर-स्टूडेंट
इस सिस्टम का परीक्षण पांच अलग-अलग "मैथ ओलंपियाड" (हाई स्कूल स्तर से लेकर बहुत कठिन विश्वविद्यालय प्रतियोगिताओं तक) पर किया गया।
- उपलब्धि: OProver (विशेष रूप से 32-बिलियन-पैरामीटर वाला संस्करण) सभी ओपन-सोर्स AI प्रोवर्स में शीर्ष प्रदर्शन करने वाला बन गया। इसने किसी भी अन्य समान सिस्टम की तुलना में अधिक समस्याओं को सही ढंग से हल किया, यहाँ तक कि बहुत बड़े मॉडलों को भी पीछे छोड़ दिया।
- यह क्यों मायने रखता है: इसने सिद्ध किया कि AI को फीडबैक सुनने, पिछले समाधानों को देखने और अपने काम को बार-बार सुधारने की क्षमता देना, केवल उसे अनुमान लगाने में बड़ा या स्मार्ट बनाने से कहीं अधिक शक्तिशाली है।
सारांश में
OProver एक गणित हल करने वाला AI है जो केवल "अनुमान और जाँच" (guess and check) नहीं करता है। यह एक सहयोगात्मक शिक्षार्थी (collaborative learner) है जो:
- पहले समान हल की गई समस्याओं को ढूँढता है।
- एक प्रमाण लिखता है।
- कंप्यूटर के विशिष्ट त्रुटि संदेशों को सुनता है।
- उन त्रुटियों को ठीक करने के लिए अपने काम को संशोधित करता है।
- तब तक दोहराता है जब तक कि वह सफल न हो जाए, फिर अगले समय के लिए सबक सहेज लेता है।
विफलता को सीखने के अवसर में बदलकर और यह रिकॉर्ड रखकर कि क्या काम करता है, OProver आज औपचारिक रूप से गणितीय प्रमेयों (mathematical theorems) को सिद्ध करने वाला सबसे अच्छा ओपन-सोर्स AI बन गया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।