← नवीनतम पेपर
🤖 AI

VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct

VeriEvol एक पुनरावृत्ति ढांचा (iterative framework) है जो टाइप-अवेयर इवोल्यूशन ऑपरेटर्स के माध्यम से प्रॉम्प्ट कठिनाई विस्तार को, मल्टी-सोर्स हाइपोथेसिस-टेस्ट फाल्सिफिकेशन के माध्यम से उत्तर विश्वसनीयता प्रवर्तन से अलग करके मल्टीमॉडल गणितीय तर्क को स्केल करता है, जिससे उच्च-गुणवत्ता वाला सत्यापित डेटा उत्पन्न होता है जो विजुअल-मैथ बेंचमार्क पर मॉडल के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।

मूल लेखक: Haoling Li, Kai Zheng, Jie Wu, Can Xu, Qingfeng Sun, Han Hu, Yujiu Yang

प्रकाशित 2026-06-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haoling Li, Kai Zheng, Jie Wu, Can Xu, Qingfeng Sun, Han Hu, Yujiu Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े नादान छात्र को चित्रों (जैसे आरेख, चार्ट और ग्राफ़) का उपयोग करके जटिल गणित की समस्याओं को हल करना सिखाने की कोशिश कर रहे हैं।

अतीत में, शोधकर्ताओं ने इस छात्र को केवल उसे अधिक होमवर्क देकर स्मार्ट बनाने की कोशिश की। वे हजारों नए प्रश्न तैयार करते थे। लेकिन एक समस्या थी: वे अक्सर प्रश्नों को केवल लंबा या थोड़ा कठिन बना देते थे, बिना वास्तव में यह जांचे कि उनके उत्तर सही हैं या नहीं। यह ऐसा था जैसे कोई शिक्षक एक परीक्षा दे रहा हो जिसमें उत्तर कुंजी (answer key) में ही गलतियाँ हों। यदि छात्र गलत उत्तरों से पढ़ता, तो वह बेहतर होने के बजाय और खराब हो जाता।

VeriEvol एक नया सिस्टम है जो यह बदल देता है कि हम यह होमवर्क कैसे बनाते हैं। केवल "अधिक" प्रश्नों के बजाय, यह "बेहतर" प्रश्नों और "सत्यापित" (verified) उत्तरों पर ध्यान केंद्रित करता है। लेखक इसे "वेरिफिएबल इवोल-इंस्ट्रक्ट" (Verifiable Evol-Instruct) फ्रेमवर्क कहते हैं।

यह कैसे काम करता है, इसे सरल चरणों में यहाँ दिया गया है:

1. "इवोल्यूशन" जिम (प्रश्नों को कठिन बनाना)

कल्पना कीजिए कि आपके पास एक सरल अभ्यास है: "इस त्रिभुज के चित्र को देखें और मुझे बताएं कि इसकी कितनी भुजाएं हैं।" यह बहुत आसान है।

VeriEvol के पास एक विशेष कोच (Evolution Module) है जो चित्र और प्रश्न को देखता है, और फिर होमवर्क को बहुत कठिन बनाता है, लेकिन यह सुनिश्चित करता है कि प्रश्न के लिए चित्र को देखना अभी भी आवश्यक हो।

  • रूपक (Metaphor): केवल "कितनी भुजाएं हैं?" पूछने के बजाय, कोच इसे बदलकर यह लिख देता है: "यदि आप इस त्रिभुज को आधा काट दें और घुमा दें, तो समान परिधि वाले वर्ग की तुलना में इसका क्षेत्रफल कैसे बदलेगा?"
  • चाल (The Trick): कोच इतना स्मार्ट है कि वह जानता है कि किस प्रकार का चित्र है। यदि यह एक चार्ट है, तो वह चार्ट-आधारित प्रश्न बनाएगा। यदि यह एक ज्यामिति (geometry) का चित्र है, तो वह ज्यामिति का प्रश्न बनाएगा। वह छात्र को केवल यादृच्छिक शब्द नहीं फेंकता; वह एक विशिष्ट चुनौती बनाता है जो छात्र को वास्तव में चित्र को देखने के लिए मजबूर करती है ताकि वह इसे हल कर सके।

2. "स्केप्टिक" डिटेक्टिव (उत्तरों की जाँच करना)

यह सबसे महत्वपूर्ण हिस्सा है। आमतौर पर, जब कोई कंप्यूटर उत्तर उत्पन्न करता है, तो हम मान लेते हैं कि वह सही है। VeriEvol कहता है, "बिल्कुल नहीं। आइए पहले यह साबित करने की कोशिश करें कि यह गलत है।"

उन्होंने एक जासूसी प्रणाली बनाई जिसे HTV-Agent कहा जाता है।

  • रूपक: एक अदालत की कल्पना करें। कंप्यूटर एक उत्तर (एक "परिकल्पना") उत्पन्न करता है। HTV-Agent संदिग्ध वकीलों की एक टीम है जिनका एकमात्र काम यह सबूत खोजना है कि उत्तर गलत है।
  • वे कैसे लड़ते हैं:
    • वे अलग-अलग "गवाहों" (अलग-अलग AI सॉल्वर) का उपयोग करते हैं यह देखने के लिए कि क्या वे सभी सहमत हैं।
    • वे गणित की जाँच करने के लिए एक "कैलकुलेटर" (कोड निष्पादन/code execution) का उपयोग करते हैं।
    • वे यह जाँचने के लिए "आंखों" (विजुअल टूल्स) का उपयोग करते हैं कि क्या उत्तर में दिए गए नंबर वास्तव में चित्र के पिक्सेल से मेल खाते हैं।
  • फैसला: यदि जासूस यह साबित करने के लिए कोई भी सबूत ढूंढ लेते हैं कि उत्तर गलत है, तो उस होमवर्क को कचरे में फेंक दिया जाता है। एक उत्तर तभी स्वीकार किया जाता है जब जासूस उसे तोड़ने की पूरी कोशिश करते हैं और विफल रहते हैं। केवल तभी वह एक "सत्यापित" (Verified) उत्तर बनता है।

3. परिणाम: एक अत्यंत विश्वसनीय पाठ्यपुस्तक

यह सिस्टम इन दो चरणों को लेता है और उन्हें दोहराता है:

  1. एक सरल प्रश्न लें।
  2. इसे एक कठिन, चित्र-आधारित चुनौती में विकसित (evolve) करें।
  3. एक उत्तर उत्पन्न करें।
  4. उत्तर को "स्केप्टिक डिटेक्टिव्स" के पास भेजें।
  5. यदि जासूस इसे तोड़ नहीं पाते हैं, तो इसे रखें। यदि वे ऐसा करते हैं, तो इसे फेंक दें और फिर से प्रयास करें।

परिणामस्वरूप 2,50,000+ गणितीय समस्याओं की एक विशाल लाइब्रेरी मिलती है जहाँ प्रत्येक उत्तर को तनाव-परीक्षण (stress-tested) किया गया है और सत्यापित किया गया है।

जब उन्होंने इसका उपयोग किया तो क्या हुआ?

शोधकर्ताओं ने इस "छात्र" AI (एक 7-बिलियन पैरामीटर मॉडल) पर इसका परीक्षण किया।

  • VeriEvol के बिना: छात्र ठीक था, लेकिन अक्सर चित्रों से भ्रमित हो जाता था या टेक्स्ट पैटर्न के आधार पर अनुमान लगाता था।
  • VeriEvol के साथ: छात्र काफी बेहतर हो गया।
    • जब उन्होंने केवल "विकसित" (Evolved) प्रश्नों का उपयोग किया (कठोर सत्यापनकर्ता के बिना), तो छात्र में सुधार हुआ।
    • जब उन्होंने यह सुनिश्चित करने के लिए "स्केप्टिक डिटेक्टिव" को जोड़ा कि उत्तर एकदम सही हैं, तो छात्र में और भी अधिक सुधार हुआ।
    • पैमाना (Scale): उन्होंने दिखाया कि जैसे-जैसे उन्होंने इन सत्यापित प्रश्नों की संख्या बढ़ाई (10,000 से 2,50,000 तक), छात्र लगातार स्मार्ट होता गया, जिससे यह सिद्ध हुआ कि डेटा की मात्रा से अधिक उसकी गुणवत्ता मायने रखती है।

यह क्यों महत्वपूर्ण है (सरल शब्दों में)

अधिकांश AI अनुसंधान "शिक्षक" (AI ऑप्टिमाइज़र) को स्मार्ट बनाने की कोशिश करते हैं। VeriEvol कहता है, "आइए पहले पाठ्यपुस्तक को ठीक करें।"

"प्रश्नों को कठिन बनाने" की प्रक्रिया को "उत्तर सही हैं या नहीं, इसकी जाँच करने" से अलग करके, उन्होंने एक ऐसा सिस्टम बनाया है जहाँ डेटा स्वयं भरोसेमंद है। उन्होंने केवल एक बेहतर छात्र नहीं बनाया; उन्होंने एक बेहतर पाठ्यक्रम बनाया। उन्होंने अपने सभी "डिटेक्टिव रिपोर्ट्स" (उन ट्रैसेस के साथ कि कैसे उन्होंने हर उत्तर को सत्यापित किया) को भी जारी किया ताकि अन्य शोधकर्ता उनके काम का ऑडिट कर सकें, यह सुनिश्चित करने के लिए कि कोई होमवर्क में नकल न कर रहा हो।

संक्षेप में: VeriEvol एक ऐसा सिस्टम है जो स्वचालित रूप से चित्रों के आधार पर कठिन गणित के प्रश्न लिखता है और फिर डिजिटल जासूसों की एक टीम का उपयोग यह सुनिश्चित करने के लिए करता है कि AI सीखने से पहले उनके उत्तर 100% सही हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →