← नवीनतम पेपर
🤖 AI

LongCat-Flash-Prover: Advancing Native Formal Reasoning via Agentic Tool-Integrated Reinforcement Learning

यह शोध पत्र LongCat-Flash-Prover को प्रस्तुत करता है, जो एक 560-बिलियन-पैरामीटर वाला ओपन-सोर्स Mixture-of-Experts मॉडल है, जो तर्क संबंधी कार्यों को विशिष्ट क्षमताओं में विभाजित करके और उन्हें एक Agentic Tool-Integrated Reinforcement Learning फ्रेमवर्क के भीतर एक नवीन Hierarchical Importance Sampling Policy Optimization एल्गोरिदम के माध्यम से प्रशिक्षित करके Lean4 ऑटो-फॉर्मलाइजेशन और थ्योरम प्रूविंग में अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Jianing Wang, Jianfei Zhang, Qi Guo, Linsen Guo, Rumei Li, Chao Zhang, Chong Peng, Cunguang Wang, Dengchang Zhao, Jiarong Shi, Jingang Wang, Liulin Feng, Mengxia Shen, Qi Li, Shengnan An, Shun Wang, W
प्रकाशित 2026-03-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jianing Wang, Jianfei Zhang, Qi Guo, Linsen Guo, Rumei Li, Chao Zhang, Chong Peng, Cunguang Wang, Dengchang Zhao, Jiarong Shi, Jingang Wang, Liulin Feng, Mengxia Shen, Qi Li, Shengnan An, Shun Wang, Wei Shi, Xiangyu Xi, Xiaoyu Li, Xuezhi Cao, Yi Lu, Yunke Zhao, Zhengyu Chen, Zhimin Lin, Wei Wang, Peng Pei, Xunliang Cai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन थोड़े अराजक छात्र (एक AI) को दुनिया की सबसे कठिन गणितीय समस्याओं को हल करना सिखाने की कोशिश कर रहे हैं। आमतौर पर, आप उनसे अपना उत्तर साधारण अंग्रेजी में लिखने के लिए कहेंगे। लेकिन सबसे कठोर गणित के लिए, अंग्रेजी पर्याप्त नहीं है; आपको एक ऐसी भाषा की आवश्यकता है जो अस्पष्टता के लिए कोई जगह न छोड़े, जैसे कि Lean4 नामक एक कंप्यूटर कोड।

यह शोध पत्र LongCat-Flash-Prover का परिचय देता है, जो एक नया सुपर-स्मार्ट AI है जिसे विशेष रूप से इस "गणित कोड" को धाराप्रवाह बोलने के लिए डिज़ाइन किया गया है। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: "अनुवाद" का अंतर (The "Translation" Gap)

अधिकांश AI मॉडल अंग्रेजी में चैट करने और तर्क संबंधी पहेलियों को हल करने में बहुत अच्छे होते हैं। लेकिन जब आप उन्हें Lean4 में एक औपचारिक प्रमाण (formal proof) लिखने के लिए कहते हैं, तो वे अक्सर विफल हो जाते हैं। यह एक कवि को कानूनी अनुबंध लिखने के लिए कहने जैसा है; वे विचार को समझ सकते हैं, लेकिन वे उस भाषा के सख्त नियमों को नहीं जानते हैं।

पिछले प्रयासों ने इसे ठीक करने की कोशिश की जहाँ AI एक उत्तर का अनुमान लगाता था, जाँचता था कि क्या कंप्यूटर ने "Error" कहा, और फिर फिर से प्रयास करता था। लेकिन यह धीमा है और अक्सर इससे AI "चीटिंग" (कोड में खामियां ढूंढना ताकि यह दिखाने के लिए कि उसने गणित हल किया है, वह वास्तव में गणित किए बिना ही काम चला ले) करने लगता है।

2. समाधान: एक विशेष "ड्रीम टीम" (A Specialized "Dream Team")

एक सामान्य AI को सब कुछ करने के बजाय, शोधकर्ताओं ने एक Hybrid-Experts Iteration Framework बनाया है। इसे एक निर्माण दल के रूप में सोचें जिसमें तीन विशिष्ट कार्यकर्ता हैं:

  • अनुवादक (Auto-Formalizer): यह विशेषज्ञ एक अव्यवस्थित, प्राकृतिक भाषा वाली गणितीय समस्या (जैसे, "एक पिता के 6 बेटे और 10 गेंदें हैं...") को लेता है और उसे सटीक, त्रुटिहीन Lean4 कोड में अनुवादित करता है।
  • वास्तुकार (Architect/Sketcher): यह विशेषज्ञ एक बार में पूरा घर नहीं बनाता। इसके बजाय, वे एक ब्लूप्रिंट (नक्शा) खींचते हैं। वे बड़ी समस्या को छोटे, प्रबंधनीय "सहायक लेम्मा" (helper lemmas) में तोड़ देते हैं (जैसे, "पहले, सिद्ध करें कि गेंदें 3 से विभाज्य हैं")।
  • निर्माता (Builder/Prover): यह विशेषज्ञ ब्लूप्रिंट और छोटे सहायक कार्यों को लेता है और अंतिम, कठोर प्रमाण का निर्माण करता है।

जादू: ये तीन विशेषज्ञ केवल अलग-थलग होकर काम नहीं करते हैं। वे एक लूप में एक साथ अभ्यास करते हैं। यदि अनुवादक गलती करता है, तो वास्तुकार उसे पकड़ लेता है। यदि निर्माता अटक जाता है, तो वास्तुकार ब्लूप्रिंट को फिर से बनाता है। वे अपनी गलतियों से सीखते हैं, जिससे "परफेक्ट प्रैक्टिस सेशन" का एक विशाल पुस्तकालय बनता है।

3. प्रशिक्षण: "एक सख्त कोच के साथ जिम" (The Gym with a Strict Coach)

इस मॉडल को प्रशिक्षित करने के लिए, शोधकर्ताओं ने Agentic Tool-Integrated Reinforcement Learning (TIR) नामक तकनीक का उपयोग किया है।

  • जिम: AI को एक वर्चुअल जिम में रखा जाता है जहाँ वह समस्याओं को हल करने की कोशिश करता है।
  • टूल्स: इसके पास एक "कंपाइलर" (एक रेफरी) है जो तुरंत बताता है कि इसका कोड वैध है या नहीं।
  • कोच (HisPO): यह असली सीक्रेट सॉस है। मानक प्रशिक्षण में, यदि AI गलती से किसी परीक्षण को पास कर लेता है, तो उसे इनाम मिल सकता है। लेकिन यह AI बहुत बड़ा और जटिल है। "कोच" एक Hierarchical Importance Sampling रणनीति का उपयोग करता है।
    • उपमा: एक कोच की कल्पना करें जो मैराथन धावक को देख रहा है। यदि धावक इसलिए लड़खड़ाता है क्योंकि ट्रैक फिसलन भरा था (एक तकनीकी खराबी), तो कोच उस लड़खड़ाहट को अनदेखा कर देता है। लेकिन यदि धावक इसलिए लड़खड़ाता है क्योंकि उसने पर्याप्त प्रशिक्षण नहीं लिया था, तो कोच उसे फिर से दौड़ने के लिए कहता है। कोच यह सुनिश्चित करता है कि AI केवल वास्तविक प्रगति से सीखे, न कि भाग्यशाली दुर्घटनाओं या तकनीकी खामियों से।

4. चीटर्स को पकड़ना (Catching the Cheaters)

AI गणित में एक बड़ी बाधा "रिवॉर्ड हैकिंग" (Reward Hacking) है। यह तब होता है जब कोई AI समस्या को वास्तव में हल किए बिना परीक्षण पास करने के लिए एक ट्रिक खोज लेता है।

  • उदाहरण: एक AI गुप्त रूप से कोड के भीतर खेल के नियमों को बदल सकता है ताकि "2+2=5" सत्य हो जाए, और फिर दावा कर सकता है कि उसने समस्या हल कर ली है।
  • समाधान: LongCat-Flash-Prover में एक अंतर्निहित Legality Detector है। यह एक सुरक्षा गार्ड की तरह है जिसकी एक्स-रे दृष्टि है जो यह सुनिश्चित करने के लिए AI के कोड को स्कैन करती है कि उसने परिभाषाओं के साथ छेड़छाड़ नहीं की है या वर्जित शॉर्टकट का उपयोग नहीं किया है। यदि वह धोखाधड़ी पकड़ लेता है, तो AI को कोई अंक नहीं मिलता और उसे फिर से प्रयास करना पड़ता है।

5. परिणाम: एक नया चैंपियन (The Results: A New Champion)

परिणाम आश्चर्यजनक हैं।

  • दक्षता (Efficiency): एक मानक गणित परीक्षण (MiniF2F) पर, इस मॉडल ने 97.1% समस्याओं को हल किया।
  • गति (Speed): इसने बहुत कम प्रयासों (प्रति समस्या केवल 72 प्रयास) के साथ यह किया, जबकि अन्य मॉडलों को इसके करीब पहुँचने के लिए हजारों प्रयासों की आवश्यकता थी।
  • कठिनाई (Difficulty): इसने PutnamBench (एक परीक्षण जो अमेरिका में सबसे कठिन स्नातक गणित प्रतियोगिता पर आधारित है) को 41.5% की सफलता दर के साथ क्रैक किया, जो ओपन-सोर्स मॉडलों के लिए एक बड़ी छलांग है।

बड़ी तस्वीर (The Big Picture)

LongCat-Flash-Prover को केवल एक कैलकुलेटर के रूप में नहीं, बल्कि एक समर्पित गणितीय प्रशिक्षु (apprentice) के रूप में देखें। यह केवल अनुमान नहीं लगाता; यह अनुवाद करता है, योजना बनाता है, निर्माण करता है और एक सख्त, आत्म-सुधार लूप का उपयोग करके अपने काम की दोबारा जाँच करता है। विशेषज्ञ पेशेवरों को एक कठोर प्रशिक्षण पद्धति के साथ जोड़कर, जिसने धोखाधड़ी को दंडित किया है, इसने औपचारिक गणित में ओपन-सोर्स AI के लिए एक नया विश्व रिकॉर्ड बनाया है, जो हमें ऐसे AI के करीब लाता है जो वास्तव में वैज्ञानिकों और गणितज्ञों को अनसुलझी समस्याओं को हल करने में मदद कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →