← नवीनतम पेपर
🤖 machine learning

Self-Consistency via Marginal Sharpening

यह शोध पत्र "सेल्फ-कंसिस्टेंसी वाया मार्जिनल शार्पनिंग" प्रस्तावित करता है, जो एक कुशल इन्फरेंस-टाइम सैंपलिंग एल्गोरिदम है जो पूर्ण आउटपुट पूर्णताओं के बजाय उत्तर मार्जिनल्स पर एक शार्पेंड वितरण को लक्षित करके तर्क प्रदर्शन में सुधार करता है, जिससे गणित और कोडिंग बेंचमार्क पर काफी कम कम्प्यूटेशनल लागत के साथ मानक पावर सैंपलिंग से बेहतर प्रदर्शन करता है।

मूल लेखक: Aleksei Arzhantsev, Otmane Sakhi, Nicolas Chopin

प्रकाशित 2026-05-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aleksei Arzhantsev, Otmane Sakhi, Nicolas Chopin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: केवल सबसे तेज़ आवाज़ को न चुनें; उस विचार को खोजें जिसे सबसे अधिक समर्थन प्राप्त हो

कल्पना कीजिए कि आप एक बहुत ही कठिन पहेली सुलझाने की कोशिश कर रहे हैं। आप मदद के लिए एक सुपर-स्मार्ट AI से पूछते हैं। AI केवल उत्तर नहीं देता; वह पहले "सोचता है", यानी अंतिम समाधान देने से पहले एक लंबी तर्क प्रक्रिया (एक "रीजनिंग ट्रेस") लिखता है।

समस्या यह है कि AI एक ही पहेली को हल करने के कई अलग-अलग तरीके सोच सकता है।

  • पथ A: बीजगणित (algebra) का उपयोग करके इसे हल करता है।
  • पथ B: एक ग्राफ का उपयोग करके इसे हल करता है।
  • पथ C: अनुमान और जाँच (guessing and checking) द्वारा इसे हल करता है।

ये तीनों पथ एक ही सही उत्तर तक ले जाते हैं, लेकिन वे पन्ने पर पूरी तरह से अलग दिखते हैं।

पुराना तरीका: "बहुमत मतदान" (एक त्रुटिपूर्ण दृष्टिकोण)

वर्तमान में, बेहतर उत्तर प्राप्त करने का मानक तरीका यह है कि AI को 32 बार सोचने के लिए कहें और फिर उस उत्तर को चुनें जो सबसे अधिक बार आता है। यह एक कमरे में मौजूद लोगों से उनके उत्तर चिल्लाने के लिए कहने और सबसे अधिक चिल्लाए गए उत्तर को चुनने जैसा है।

समस्या: यदि AI पहेली को 32 अलग-अलग तरीकों से हल करता है, लेकिन 16 कहते हैं "26,000" और अन्य 16 कहते हैं "26,000" (बस थोड़ा अलग तरीके से लिखा गया, जैसे "26k" या "छब्बीस हज़ार"), तो एक साधारण वोट विभाजित हो सकता है और विजेता चुनने में विफल हो सकता है। यह हर अलग वाक्य को एक अलग विचार मानता है, भले ही विचार एक ही हो।

नया तरीका: "मार्जिनल शार्पनिंग" (पेपर का समाधान)

लेखक AI को सुनने का एक स्मार्ट तरीका प्रस्तावित करते हैं। एक विशिष्ट वाक्य के कितनी बार आने की गिनती करने के बजाय, वे उस विचार को खोजना चाहते हैं जिसे सबसे अधिक अलग-अलग तर्क पथों (reasoning paths) का समर्थन प्राप्त है।

इसे इस प्रकार सोचें:

  • पुराना तरीका: आपके पास मोतियों की एक थैली है। आप 32 मोती निकालते हैं। यदि 16 लाल हैं और 16 नीले हैं, तो आप फंस जाते हैं।
  • नया तरीका: आप मोतियों के पैटर्न को देखते हैं। आप महसूस करते हैं कि भले ही लाल और नीले मोती अलग दिखते हों, लेकिन वे सभी एक ही "कांच" से बने हैं। आप विचारों को उनके रंग (विशिष्ट शब्दों) के बजाय उनके अंतर्निहित पदार्थ (उत्तर) के आधार पर समूहबद्ध करते हैं।

पेपर इसे "मार्गिनल शार्पनिंग" कहता है। यह "मेसी थिंकिंग" (अव्यवस्थित सोच) वाले हिस्से को अनदेखा करता है और पूरी तरह से अंतिम उत्तर की संभावना को तेज करने (sharpening) पर ध्यान केंद्रित करता है। यह पूछता है: "किस उत्तर को सबसे अधिक संभावित तरीकों से समर्थन प्राप्त है?"

यह कैसे काम करता है: "समानांतर विचारक" (Parallel Thinkers) का उदाहरण

पेपर इसे बिना अनंत काल तक प्रतीक्षा किए करने के लिए एक चतुर एल्गोरिदम पेश करता है। कल्पना कीजिए कि आपके पास एक मामले की जांच करने के लिए 32 जासूसों (रीजनिंग ट्रेसेस) की एक टीम है।

  1. सेटअप: आप सभी 32 जासूसों को स्वतंत्र रूप रूप से अपराध स्थल की जांच करने के लिए भेजते हैं। वे सभी अपने स्वयं के अद्वितीय सिद्धांत और नोट्स (रीजनिंग ट्रेसेस) के साथ वापस आते हैं।
  2. पुराना तरीका: आप प्रत्येक जासूस को अपना अंतिम निष्कर्ष लिखने के लिए कहते हैं। यदि 16 कहते हैं "बटलर ने किया" और 16 कहते हैं "बटलर ने अपराध किया," तो आप शब्दावली के कारण भ्रमित हो सकते हैं।
  3. नया तरीका (मार्जिनल शार्पनिंग):
    • आप उनके द्वारा पूरी रिपोर्ट लिखने का इंतज़ार नहीं करते हैं।
    • इसके बजाय, आप अंतिम निष्कर्ष को शब्द दर शब्द बनाते हैं।
    • उत्तर के पहले शब्द के लिए, आप सभी 32 जासूसों से पूछते हैं: "आपके नोट्स के आधार पर सबसे संभावित पहला शब्द क्या है?"
    • यदि 25 लोग सोचते हैं कि उत्तर "The" से शुरू होता है, तो आप "The" लिखते हैं।
    • अगले शब्द के लिए, आप फिर से पूछते हैं, लेकिन अब आप उन जासूसों को अधिक महत्व देते हैं जो "The" शब्द के साथ अभी भी "ट्रैक पर" हैं।
    • आप इसे तब तक करते रहते हैं जब तक कि वाक्य समाप्त न हो जाए।

इस प्रक्रिया को "पैरेलल ऑटोरेग्रेसिव डिकोडिंग" कहा जाता है। यह एक ऐसे गायक दल (choir) की तरह है जहाँ हर कोई एक अलग धुन गाता है, लेकिन आप केवल उन सुरों को रिकॉर्ड करते हैं जिन पर उनमें से अधिकांश सहमत होते हैं, जिससे एक एकल, सामंजस्यपूर्ण गीत (अंतिम उत्तर) बनता है जो समूह के सामूहिक ज्ञान का प्रतिनिधित्व करता है।

यह बेहतर क्यों है? (परिणाम)

पेपर ने गणित की समस्याओं और कोडिंग चुनौतियों पर इसका परीक्षण किया। यहाँ उन्हें क्या मिला:

  1. यह बहुत तेज़ है: पुराने "पावर सैंपलिंग" तरीके (जो पूर्ण वाक्य खोजने की कोशिश करते हैं) पूरी किताब को 100 बार फिर से लिखने की कोशिश करने जैसे हैं ताकि सबसे अच्छा संस्करण मिल सके। इसमें बहुत समय लगता है। नया तरीका एक साथ 32 लोगों द्वारा किताब लिखने और चलते-चलते उनके सबसे अच्छे विचारों को मिलाने जैसा है। पेपर कहता है कि लंबे, जटिल समस्याओं के लिए यह 38 गुना तक तेज़ है।
  2. यह कोडिंग में बेहतर है: कंप्यूटर प्रोग्रामिंग में, अक्सर कोड लिखने के कई तरीके होते हैं जो बिल्कुल एक ही चीज़ करते हैं। एक साधारण वोट विफल हो सकता है क्योंकि कोड अलग दिखता है। मार्जिनल शार्पनिंग कोड के बाहरी अंतरों को अनदेखा करती है और तर्क (logic) पर ध्यान केंद्रित करती है, जिससे यह काम करने वाले प्रोग्राम बनाने में बहुत बेहतर हो जाता है।
  3. यह गणित के लिए वोट देने जितना ही अच्छा है: सरल गणित समस्याओं के लिए जहाँ उत्तर केवल एक संख्या है (जैसे "42"), साधारण मतदान अच्छी तरह से काम करता है। नया तरीका उतना ही अच्छा है, लेकिन यह वहां तक बहुत तेज़ी से पहुँचता है और जटिल, अव्यवस्थित उत्तरों को बेहतर ढंग से संभालता है।

सारांश

पेपर का तर्क है कि जब एक AI "सोचता" है, तो हमें केवल उसके द्वारा लिखे गए अंतिम वाक्य को नहीं देखना चाहिए। हमें उत्तर के पीछे के समर्थन (support) को देखना चाहिए। मार्जिनल शार्पनिंग नामक विधि का उपयोग करके, हम कई अलग-अलग "तर्क पथों" के अंतर्दृष्टि को जोड़कर उस उत्तर को पा सकते हैं जिसमें AI सबसे अधिक आश्वस्त है, जिससे हम जटिल कार्यों (जैसे कोड लिखना) के लिए पिछले तरीकों की तुलना में अधिक तेज़ी से और अधिक सटीकता से काम कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →