← नवीनतम पेपर
🤖 AI

ProofCouncil: An LLM Agent for Solving Open Mathematical Problems

यह शोध पत्र ProofCouncil को प्रस्तुत करता है, जो एक ओपन-सोर्स LLM एजेंट है जो एक ऑथर-क्रिटिक आर्किटेक्चर का उपयोग करता है जिसने दस में से छह वास्तविक दुनिया की गणितीय समस्याओं को स्वायत्त रूप से हल करके और ओपन प्रॉब्लम्स के एक व्यापक सेट पर महत्वपूर्ण प्रगति प्रदर्शित करके FirstProof चुनौती में अत्याधुनिक प्रदर्शन प्राप्त किया है।

मूल लेखक: Johannes Schmitt, Tim Gehrunger, Jasper Dekoninck, Gergely Bérczi, Uri Kreitner, Liam Price, David Holmes

प्रकाशित 2026-07-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Johannes Schmitt, Tim Gehrunger, Jasper Dekoninck, Gergely Bérczi, Uri Kreitner, Liam Price, David Holmes

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक बिल्कुल नए, सुपर-स्मार्ट रोबोट को दुनिया की सबसे पेचीदा गणितीय पहेलियों का ढेर थमा दिया है। ये कोई साधारण "लुप्त संख्या खोजें" वाले पहेली नहीं हैं; ये वे ओपन प्रॉब्लम्स (खुले प्रश्न) हैं जिन पर वास्तविक मानव गणितज्ञ वर्षों से सिर खपा रहे हैं, और अभी तक कोई उनका उत्तर नहीं जानता।

ProofCouncil से मिलिए। इसे एक एकल रोबट के रूप में नहीं, बल्कि एक छोटी, उच्च-दांव वाली गणित कार्यशाला (वर्कशॉप) के रूप में सोचें।

वर्कशॉप क्रू: ऑथर, क्रिटिक और द स्क्वाड

इस प्रणाली का केंद्र "हॉट पोटैटो" (गर्म आलू) का एक चतुर खेल है जो दो मुख्य पात्रों द्वारा खेला जाता है: ऑथर (लेखक) और क्रिटिक (समीक्षक)

  • द ऑथर एक सपने देखने वाला है। यह एक AI है जो एक आदर्श प्रमाण (एक चरण-दर-चरण गणितीय तर्क) लिखने की कोशिश करता है। इसके पास एक जादुई नोटबुक है जहाँ यह विचार लिखता है, कोड आज़माता है, और सुराग खोजने के लिए वेब पर भी खोज करता है।
  • द क्रिटिक एक सख्त संपादक है। यह जो कुछ भी ऑथर ने लिखा है उसे पढ़ता है और कहता है, "रुको, यह चरण समझ में नहीं आ रहा है," या "तुम इस हिस्से को साबित करना भूल गए!" यह केवल यह नहीं कहता कि "गलत है"; यह कमियों को ठीक करने के लिए विशिष्ट फीडबैक भी देता है।

ट्विस्ट यह है कि ऑथर केवल एक बार नहीं लिखता। यह लिखता है, आलोचना प्राप्त करता है, फिर से लिखता है, फिर से आलोचना प्राप्त करता है, और चलता रहता है। यह एक लेखक और एक संपादक की तरह है जो एक कहानी को तब तक तराशते हैं जब तक कि वह एकदम सही न हो जाए।

लेकिन कभी-कभी, ऑथर अटक जाता है। तब वे काउंसिल (परिषद) और कंप्यूट नोड को बुलाते हैं।

  • द काउंसिल अन्य सुपर-स्मार्ट AI मॉडल्स का एक पैनल है (विशेषज्ञों की एक टीम की तरह)। ऑथर उनसे पूछता है, "हे, मैं इस विशिष्ट भाग पर अटक गया हूँ; क्या इसे देखने का कोई दूसरा तरीका है?"
  • द कंप्यूट नोड भारी काम करने वाला है। यदि समस्या के लिए भारी गणना या किसी विशेष गणित सॉफ्टवेयर टूल की आवश्यकता है जिसे ऑथर अकेले नहीं चला सकता, तो यह नोड भारी काम करता है, कोड चलाता है और नंबरों को क्रंच करता है ताकि यह जांचा जा सके कि कोई धारणा सच है या नहीं।

हर कुछ राउंड के बाद, क्रिटिक एक "मानसिक ब्रेक" लेता है और एक नई शुरुआत करता है। यह महत्वपूर्ण है क्योंकि यदि क्रिटिक ऑथर की गलतियों का बहुत अधिक आदी हो जाता है, तो वह उन्हें देखना बंद कर सकता है। ताज़ा नज़रें यह सुनिश्चित करती हैं कि प्रमाण वास्तव में ठोस है।

बड़ा परीक्षण: फर्स्टप्रूफ चैलेंज

टीम ने ProofCouncil को उसके अंतिम परीक्षण में डाला: एक चुनौती जिसे FirstProof कहा गया। नियम सरल लेकिन कठोर थे: केवल सार्वजनिक उपकरणों का उपयोग करके 24 घंटों में 10 वास्तविक, अनसुलझे गणितीय प्रश्नों को हल करना।

परिणाम? ProofCouncil शो का स्टार था। 10 समस्याओं में से, इसने 6 समस्याओं के लिए समाधान सफलतापूर्वक तैयार किए जिन्हें मानव विशेषज्ञों ने सही पाया (केवल मामूली सुधारों की आवश्यकता थी)। यह प्रतियोगिता में किसी भी अन्य टीम का सर्वश्रेष्ठ प्रदर्शन था।

उन्होंने इसे वास्तविक गणितज्ञों द्वारा भेजे गए 30 अन्य ओपन प्रॉब्लम्स पर भी आजमाया। मिले हुए फीडबैक के 21 समस्याओं में से:

  • 5 को पूरी तरह से सही समाधान माना गया।
  • 2 को बहुत आशाजनक देखा गया, बस अंतिम जांच की प्रतीक्षा थी।
  • 8 ने उपयोगी प्रगति की, भले ही वे काम पूरा नहीं कर पाए।
  • 4 में कोई त्रुटि नहीं थी लेकिन वे कोई खास बदलाव नहीं ला सके।
  • 2 ने प्रश्न को गलत समझा और इसके बजाय एक आसान संस्करण को हल किया।

महत्वपूर्ण बात यह है कि किसी भी विशेषज्ञ ने इसके आउटपुट को गणितीय रूप से गलत (गलत तर्क के साथ) नहीं बताया। मुख्य विफलता खराब गणित नहीं थी; बल्कि कभी-कभी प्रश्न के विवरण को गलत समझना था।

प्रतिभा की लागत

यहाँ एक पकड़ है: इतना स्मार्ट होने के लिए बहुत महंगा है। एक एकल समस्या पर ProofCouncil चलाने की लागत कंप्यूटर समय और मॉडल कॉल्स के रूप में लगभग $350 थी। इसकी तुलना एक सरल, सिंगल-शॉट AI प्रयास से करें जिसकी लागत केवल $12 थी लेकिन उसने कम समस्याएं हल कीं। शोध पत्र सुझाव देता है कि हालांकि "टीम दृष्टिकोण" बेहतर काम करता है, लेकिन वर्तमान में यह एक लग्जरी आइटम है। लेखक स्वीकार करते हैं कि उन्होंने अभी तक इसे सस्ता बनाने की कोशिश नहीं की है, जो भविष्य के शोधकर्ताओं के लिए एक काम है।

इसने क्या नहीं किया (और इसने क्या दावा नहीं किया)

यह जानना महत्वपूर्ण है कि इस रोबोट ने क्या नहीं किया।

  • इसने चुनौती की सभी 10 समस्याओं को हल नहीं किया (यह 4 को मिस कर गया)।
  • इसने कोई पॉलिश की हुई, प्रकाशन के लिए तैयार रिसर्च पेपर तैयार नहीं किया। समीक्षा करने वाले गणितज्ञों ने नोट किया कि लेखन सघन (dense) था और गैर-विशेषज्ञों के लिए इसे पठनीय बनाने के लिए मानवीय संपादन की आवश्यकता थी।
  • इसने यह "सिद्ध" नहीं किया कि AI किसी भी गणितीय समस्या को हल कर सकता है। इसने दिखाया कि कुछ कठिन समस्याओं के लिए, एक अकेला AI काम करने के बजाय मिलकर काम करने वाली AI टीमों का समूह बेहतर होता है।

निचोड़

ProofCouncil सुझाव देता है कि यदि आप वास्तव में कठिन, ओपन मैथ प्रॉब्लम को हल करना चाहते हैं, तो आपको केवल एक AI से यह कहने के लिए नहीं पूछना चाहिए कि "जाओ इसे हल करो।" इसके बजाय, आपको एक ऐसी प्रणाली की आवश्यकता है जहाँ एक AI लिखे, दूसरा उसे चुनौती दे, तीसरा नए दृष्टिकोण प्रदान करे, और चौथा भारी गणितीय गणना करे।

FirstProof चुनौती की दुनिया में, यह "ऑथर-क्रिटिक-काउंसिल" टीम अब तक की सबसे सफल रणनीति रही। इसने पूरा पहाड़ फतह नहीं किया, लेकिन यह किसी भी अन्य से ऊँचाई तक पहुँचा, यह साबित करते हुए कि जब AI एजेंट एक मानव अनुसंधान टीम की तरह मिलकर काम करते हैं, तो वे उन समस्याओं से भी निपट सकते हैं जिन्हें पहले पहुंच से बाहर माना जाता था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →