← नवीनतम पेपर
💻 computer science

Categorizing Mathematical Concepts with LLM Voting Ensembles in Mathswitch

यह शोध पत्र मैथस्विच (Mathswitch) प्रोजेक्ट के विकीडेटा-व्युत्पन्न गणितीय अवधारणा अभिलेखों से शोर (noise) को फ़िल्टर करने में लार्ज लैंग्वेज मॉडल्स के एक वोटिंग एन्सेम्बल की प्रभावकारिता का मूल्यांकन करता है, और भविष्य की सुधार रणनीतियों को सूचित करने के लिए विशिष्ट असहमति पैटर्न की पहचान करता है।

मूल लेखक: Katja Berčič, Slobodan Stanojevikj

प्रकाशित 2026-06-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Katja Berčič, Slobodan Stanojevikj

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक विशाल, अराजक पुस्तकालय है जिसका नाम Mathswitch है। इसका लक्ष्य इंटरनेट के हर कोने से गणित से जुड़ी हर किताब, नोट और आरेख (diagram) को इकट्ठा करना है—चाहे वह औपचारिक पाठ्यपुस्तकें हों या साधारण विकिपीडिया लेख—और उन्हें एक ही शेल्फ पर रखना है ताकि आप उन सभी को एक साथ खोज सकें।

समस्या क्या है? यह पुस्तकालय Wikidata नामक एक विशाल, सार्वजनिक बुलेटिन बोर्ड से किताबें खींचने की कोशिश कर रहा है। यह बुलेटिन बोर्ड सभी द्वारा संपादित किया जाता है, इसलिए यह थोड़ा अस्त-व्यस्त है। कभी-कभी "tree" (वह पेड़ जिस पर आप चढ़ सकते हैं) के बारे में एक पोस्ट गणितीय संरचना (math structure) वाले "tree" के पोस्ट के साथ मिल जाती है। कभी-कभी, "function" (एक काम जो आप करते हैं) के बारे में एक पोस्ट "function" (एक गणितीय सूत्र) के साथ मिल जाती है।

यदि पुस्तकालय ने बस उन सभी चीजों को उठा लिया जो कुछ हद तक गणित जैसी दिखती थीं, तो गणित की शेल्फ गैर-गणितीय कचरे से भर जाती, जिससे असली चीज़ों को खोजना कठिन हो जाता।

समाधान: AI न्यायाधीशों का एक पैनल

इस गंदगी को साफ करने के लिए, इस शोध पत्र के लेखकों ने एक AI न्यायाधीशों का वोटिंग पैनल बनाया है। इसे तीन अलग-अलग न्यायाधीशों (विशेष रूप से, तीन अलग-अलग AI मॉडल: DeepSeek, Gemma, और Qwen) वाले एक न्यायालय के रूप में सोचें।

यह प्रक्रिया इस प्रकार काम करती है:

  1. मुकदमा (The Trial): जब Wikidata से कोई नया आइटम आता है, तो सिस्टम उस आइटम को तीनों AI न्यायाधीशों को दिखाता है।
  2. साक्ष्य (The Evidence): न्यायाधीश उस आइटम का नाम, एक संक्षिप्त विवरण, कुछ कीवर्ड और लेख के अंश (snippet) को देखते हैं।
  3. फैसला (The Verdict): प्रत्येक न्यायाधीश पूछता है, "क्या यह एक वास्तविक गणितीय अवधारणा (mathematical concept) है?" वे हाँ या नहीं में वोट देते हैं और एक कॉन्फिडेंस स्कोर (वे कितने निश्चित हैं) भी देते हैं।
  4. बहुमत का नियम (The Majority Rule): यदि दो में से तीन न्यायाधीशों ने "हाँ" कहा, तो वह आइटम गणित की शेल्फ पर रहता है। यदि दो ने "नहीं" कहा, तो उसे बाहर फेंक दिया जाता है।

उन्होंने इसका परीक्षण कैसे किया

लेखकों को यह जानने की आवश्यकता थी कि क्या उनके AI न्यायाधीश वास्तव में अपना काम अच्छी तरह से कर रहे हैं। उन्होंने इसके लिए कुछ परीक्षण किए:

  • "आसान" परीक्षण (पॉजिटिव कंट्रोल): उन्होंने 1,000 ऐसे आइटम लिए जो पहले से ही गणित के रूप में ज्ञात थे क्योंकि उनके पास एक विशेष "MathWorld" ID टैग था (जैसे कि अनुमोदन की एक स्वर्ण मुहर)। उन्होंने AI न्यायाधीशों से इन वस्तुओं को वर्गीकृत करने के लिए कहा।

    • परिणाम: न्यायाधीश अविश्वसनीय रूप से सटीक थे, उन्होंने इन वस्तुओं को गणित के रूप में पहचानने में 98.2% सटीकता दिखाई। यहाँ तक कि जब लेखकों ने न्यायाधीशों से "MathWorld" टैग छिपा दिया ताकि वे केवल उस मुहर को देखकर नकल न कर सकें, तब भी न्यायाधीश लगभग हर बार सही थे। इससे यह साबित हुआ कि न्यायाधीश वास्तव में सामग्री को पढ़ रहे थे, न कि केवल शॉर्टकट देख रहे थे।
  • "कठिन" परीक्षण (नेगेटिव कंट्रोल): उन्होंने भौतिकी (Physics) (जैसे "Kepler's orbit" या "entropy") के बारे में 500 आइटम लिए।

    • परिणाम: अधिकांश के लिए न्यायाधीशों ने सही कहा कि "नहीं, यह गणित नहीं है।" हालाँकि, उन 10 आइटम्स के लिए जो गणित और भौतिकी के बीच की धुंधली रेखा पर थे (जैसे कि दोनों क्षेत्रों में उपयोग किए जाने वाले जटिल समीकरण), न्यायाधीशों ने आत्मविश्वास से "हाँ" कहा। इसने दिखाया कि न्यायाधीश समझते हैं कि गणित और भौतिकी अक्सर आपस में जुड़े होते हैं, बजाय इसके कि वे किसी भी ऐसी चीज़ को जो शुद्ध गणित नहीं है, आँख बंद करके खारिज कर दें।

जहाँ न्यायाधीश भ्रमित हुए

शोध पत्र में उन कुछ मामलों को भी देखा गया जहाँ न्यायाधीशों ने गलतियाँ कीं या "गोल्ड स्टैंडर्ड" (MathWorld) से असहमति जताई। उन्होंने भ्रम के तीन मुख्य कारण पाए:

  1. "खाली विवरण" की समस्या (The "Empty Description" Problem): कभी-कभी, एक Wikidata प्रविष्टि केवल "गणितीय अवधारणा" (Mathematical Concept) के रूप में विवरण देती है। यह एक खाली कवर वाली किताब की तरह है। न्यायाधीशों के पास संदर्भ (context) के अभाव में, उन्होंने केवल शीर्षक के आधार पर अनुमान लगाया। उदाहरण के लिए, उन्हें लगा कि "Wiener sausage" एक खाद्य पदार्थ है और "Fence" निर्माण कार्य है, जबकि वे वास्तव में अस्पष्ट गणितीय अवधारणाओं के नाम थे। समाधान? वोट देने से पहले न्यायाधीशों को अधिक संदर्भ दें।
  2. "बहुत संकीर्ण" पूर्वाग्रह (The "Too Narrow" Bias): एक न्यायाधीश (Gemma) बहुत सख्त था। यदि कोई गणितीय अवधारणा वास्तविक दुनिया में उपयोग की जाती थी (जैसे जीव विज्ञान या इंजीनियरिंग में), तो इस न्यायाधीश ने सोचा, "वह एक अनुप्रयोग (application) है, गणित स्वयं नहीं," और "नहीं" में वोट दिया। अन्य न्यायाधीश अधिक लचीले थे और इसे गणित के रूप में पहचानते थे।
  3. "कार्यक्षेत्र" का अंतर (The "Scope" Mismatch): कभी-कभी, MathWorld विश्वकोश में ऐसी चीजें शामिल होती हैं जो गणित से संबंधित हैं (जैसे सिग्नल प्रोसेसिंग उपकरण या ऐतिहासिक तथ्य), जिन्हें AI न्यायाधीश गणितीय अवधारणाओं के रूप में बहुत दूर का मान रहे थे। यह न्यायाधीशों की गलती नहीं थी; यह केवल इस बात पर राय का अंतर था कि "गणित" को कितनी सख्ती से परिभाषित किया जाए।

निष्कर्ष

शोध पत्र यह निष्कर्ष निकालता है कि AI न्यायाधीशों के वोटिंग पैनल का उपयोग करना Wikidata से शोर (noise) को छानने का एक व्यावहारिक और प्रभावी तरीका है। इसके लिए लेबल किए गए उदाहरणों के विशाल डेटासेट के साथ सिखाने की आवश्यकता नहीं है; AI पहले से ही जानता है कि गणित कैसा लगता है।

इस प्रणाली का उपयोग करके, Mathswitch स्वचालित रूप से अपने पुस्तकालय को साफ कर सकता है, वास्तविक गणितीय अवधारणाओं को रख सकता है और गैर-गणितीय कचरे को बाहर निकाल सकता है, साथ ही अपनी गलतियों से सीखकर भविष्य में और भी बेहतर हो सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →