← नवीनतम पेपर
💬 NLP

STAR-PólyaMath: Multi-Agent Reasoning under Persistent Meta-Strategic Supervision

यह शोधपत्र STAR-PólyaMath को प्रस्तुत करता है, जो एक निरंतर मेटा-स्ट्रैटेजिस्ट (Meta-Strategist) और संरचित रीज़नर-वेरिफायर (Reasoner-Verifier) लूप्स वाला एक मल्टी-एजेंट फ्रेमवर्क है, जो मेटा-स्तरीय पर्यवेक्षण के माध्यम से मतिभ्रम (hallucination), मेमोरी विखंडन (memory fragmentation) और टूल के दुरुपयोग को प्रभावी ढंग से कम करके आठ शीर्ष-स्तरीय गणितीय बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Jiaao Wu, Xian Zhang, Hanzhang Liu, Sophia Zhang, Fan Yang, Yinpeng Dong

प्रकाशित 2026-05-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiaao Wu, Xian Zhang, Hanzhang Liu, Sophia Zhang, Fan Yang, Yinpeng Dong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक अविश्वसनीय रूप से कठिन गणितीय पहेली को हल करने की कोशिश कर रहे हैं, जैसे कि एक चैंपियनशिप-स्तर की शतरंज की समस्या या एक जटिल एस्केप रूम। यदि आप इसे अकेले हल करने की कोशिश करते हैं, तो आप एक लूप में फंस सकते हैं, शुरुआत में एक गलती कर सकते हैं, और फिर उस गलती पर ताश के पत्तों का महल बनाने में घंटों बिता सकते हैं। आप इतने निराश भी हो सकते हैं कि दीवार पर बेतरतीब ढंग से औजार फेंकने लगें (जैसे कि ब्रूट-फोर्स गणनाएं), इस उम्मीद में कि शायद कुछ काम कर जाए, भले ही वह सही दृष्टिकोण न हो।

STAR-PólyaMath एक नया सिस्टम है जिसे इन "लॉन्ग-होराइजन" (दीर्घकालिक) गणित की समस्याओं को हल करने के लिए डिज़ाइन किया गया है, जो एक अकेले जीनियस के बजाय एक अत्यधिक संगठित निर्माण दल (construction crew) की तरह काम करता है। यह एक निरंतर पर्यवेक्षक की देखरेख में काम करने वाले तीन अलग-अलग भूमिकाओं का उपयोग करता है।

यह कैसे काम करता है, इसके सरल उदाहरण यहाँ दिए गए हैं:

1. तीन भूमिकाएँ (दल/क्रू)

एक ही AI द्वारा सब कुछ करने के बजाय, यह सिस्टम काम को तीन विशिष्ट एजेंटों में विभाजित करता है:

  • द रीज़नर (द बिल्डर - निर्माता): यह वह है जो वास्तव में गणित करता है। यह समाधान खोजने की कोशिश करता है, चरणों को लिखता है, और गणनाओं की जांच करने के लिए कोड चलाता है। इसे ईंटें बिछाने वाले राजमिस्त्री के रूप में सोचें।
  • द वेरिफायर (द इंस्पेक्टर - निरीक्षक): यह एजेंट निर्माण नहीं करता; यह जांच करता है। हर बार जब बिल्डर एक चरण पूरा करता है, तो इंस्पेक्टर क्लिपबोर्ड लेकर आता है। वे जांचते हैं: "क्या आपने वास्तव में वही किया जो आपने कहा था?" और "क्या गणित सही है?" यदि बिल्डर ने गलती की है, तो इंस्पेक्टर तुरंत काम रोक देता है।
  • द मेटा-स्ट्रेटेजिस्ट (द प्रोजेक्ट मैनेजर - परियोजना प्रबंधक): यह पेपर का सबसे बड़ा नवाचार है। बिल्डर और इंस्पेक्टर के विपरीत, जो किसी बाधा से टकराने पर रीसेट हो सकते हैं या भूल सकते हैं, प्रोजेक्ट मैनेजर कभी नहीं भूलता। उन्हें हर असफल प्रयास, हर गलत दिशा और हर बार जब टीम एक लूप में फंस गई थी, सब याद रहता है। वे पूरे ऑपरेशन की "याददाश्त" हैं।

2. प्रक्रिया (निर्माण स्थल)

यह सिस्टम केवल उत्तर की ओर नहीं दौड़ता। यह एक सख्त, व्यवस्थित कार्यप्रवाह का पालन करता है:

  • एक्सप्लोरेशन (द स्काउट - खोजकर्ता): निर्माण शुरू करने से पहले, रीज़नर समस्या का एक त्वरित, सस्ता स्कैन करता है। यह एक स्काउट की तरह है जो पैटर्न या आसान जीत की तलाश कर रहा है। यदि समस्या सरल है, तो वे इसे यहीं हल करते हैं और रुक जाते हैं।
  • प्लानिंग (द ब्लूप्रिंट - खाका): यदि समस्या कठिन है, तो रीज़नर एक चरण-दर-चरण ब्लूप्रिंट (आमतौर पर 6 से 10 चरण) तैयार करता है। सिस्टम यह जांचता है कि क्या ब्लूप्रिंट संरचनात्मक रूप से समझ में आने योग्य है, इससे पहले कि कोई निर्माण शुरू करे।
  • द चैलेंज लूप (द डिबेट - बहस): यहीं असली जादू होता है।
    • बिल्डर एक चरण पूरा करने की कोशिश करता है।
    • इंस्पेक्टर इसकी जांच करता है।
    • यदि इंस्पेक्टर कहता है, "नहीं, यह गलत है," तो वे केवल आगे नहीं बढ़ते। वे एक बहस में प्रवेश करते हैं। बिल्डर को अपने काम का बचाव करना होगा या गलती स्वीकार कर उसे ठीक करना होगा। वे तब तक बहस करते हैं जब तक कि वे सहमत न हो जाएं या एक सीमा तक न पहुंच जाएं।
    • यदि इंस्पेक्टर किसी पिछले चरण में गलती पाता है, तो वे बिल्डर को उस विशिष्ट हिस्से को ठीक करने के लिए वापस भेजते हैं (ट्रेस-बैक), यह सुनिश्चित करते हुए कि त्रुटि आगे न फैले।

3. सीक्रेट सॉस: "पर्सिस्टेंट" मैनेजर (दृढ़ निश्चयी प्रबंधक)

पेपर का तर्क है कि पिछले AI सिस्टम इसलिए विफल होते हैं क्योंकि वे "अनुत्पादक लूपों" में फंस जाते हैं। कल्पना कीजिए कि एक बिल्डर एक ऐसी दीवार में कील ठोकने की कोशिश कर रहा है जो वास्तव में कांच की बनी है। वह उसे मारता रहता है, निराश होता है, और फिर से मारता रहता है।

पुराने सिस्टमों में, AI बस कांच पर प्रहार करना जारी रख सकता है।

STAR-PólyaMath में, मेटा-स्ट्रेटेजिस्ट पूरी प्रक्रिया को देखता है। यदि वे देखते हैं कि टीम तीन बार एक ही दीवार से टकरा रही है, या यदि टीम हथौड़े का उपयोग करने की कोशिश कर रही है जबकि उन्हें पेचकस की आवश्यकता है, तो मैनेजर हस्तक्षेप करता है।

  • हस्तक्षेप: मैनेजर कहता है, "रुको! तुम समय बर्बाद कर रहे हो। जिस 3/4 उत्तर को तुम सिद्ध करने की कोशिश कर रहे हो, वह वास्तव में गलत है, न कि केवल कठिन। हमें इस पूरे प्लान को फेंकने और एक अलग रणनीति के साथ एक नया प्लान शुरू करने की आवश्यकता है।"
  • स्मृति: क्योंकि मैनेजर सभी असफल प्रयासों को याद रखता है, इसलिए वे कह सकते हैं, "फिर से 'कॉम्ब' (कंघी) आकार का प्रयास न करें; हमने पहले ही इसे आजमाया था और यह विफल रहा।" यह सिस्टम को एक ही गलती दोबारा करने से रोकता है।

4. परिणाम (ट्रॉफी केस)

लेखकों ने दुनिया की सबसे कठिन गणितीय प्रतियोगिताओं (जैसे AIME, IMO और Putnam) पर इस सिस्टम का परीक्षण किया।

  • स्कोर: इसने लगभग हर टेस्ट पर पूर्ण या लगभग पूर्ण स्कोर प्राप्त किया।
  • तुलना: सबसे कठिन टेस्ट (MathArena Apex 2025) पर, पिछले सर्वश्रेष्ठ AI (GPT-5.5) ने लगभग 80% स्कोर किया। STAR-PólyaMath ने 93.75% स्कोर किया।
  • जीत का कारण: पेपर यह साबित करता है कि सफलता एक "स्मार्टर" ब्रेन मॉडल का उपयोग करने से नहीं आई। भले ही उन्होंने मॉडल्स को आपस में बदल दिया हो, यह सिस्टम केवल तभी अच्छा काम करता था जब ऑर्केस्ट्रेशन (मैनेजर, इंस्पेक्टर और डिबेट) मौजूद था। यह प्रक्रिया है, न कि केवल व्यक्ति, जो अंतर पैदा करती है।

सारांश

STAR-PólyaMath को एक ऐसी टीम के रूप में समझें जहाँ:

  1. एक व्यक्ति समाधान का निर्माण करता है।
  2. एक व्यक्ति हर चाल की बेरहमी से आलोचना करता है।
  3. एक व्यक्ति हर विफलता को याद रखता है और टीम को रणनीति बदलने के लिए मजबूर करता है यदि वे फंस जाते हैं, यह सुनिश्चित करते हुए कि वे कभी भी ऐसे रास्ते पर समय बर्बाद न करें जो पहले ही मृत अंत (dead end) साबित हो चुका है।

यह "निरंतर पर्यवेक्षण" (persistent supervision) इस प्रणाली को उन समस्याओं को हल करने की अनुमति देता है जो एक एकल AI के लिए बहुत लंबी और जटिल हैं, क्योंकि वह बिना भटके या भ्रमित हुए उन्हें हल नहीं कर पाता।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →