← नवीनतम पेपर
💬 NLP

Inference Time Optimization with Confidence Dynamics

यह शोध पत्र कॉन्फिडेंस डायनेमिक गेन (CDG) को प्रस्तुत करता है, जो एक नवीन इन्फरेंस-टाइम ऑप्टिमाइज़ेशन विधि है जो सही बनाम गलत रीजनिंग ट्रेसेस के विशिष्ट कॉन्फिडेंस ट्राजेक्टरी पैटर्न का लाभ उठाकर कई लार्ज लैंग्वेज मॉडल्स और गणितीय बेंचमार्क में उत्तर चयन और प्रदर्शन को महत्वपूर्ण रूप से सुधारती है।

मूल लेखक: Yu Wang, Minghao Liu, Jiayun Wang, Jinrui Huang, Ankit Shah, Wei Wei

प्रकाशित 2026-05-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yu Wang, Minghao Liu, Jiayun Wang, Jinrui Huang, Ankit Shah, Wei Wei

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन कभी-कभी अति-आत्मविश्वासी छात्र से एक कठिन गणितीय समस्या हल करने के लिए कह रहे हैं। आप उससे कहते हैं कि वह अपने दिमाग में इस समस्या को 500 बार हल करे और हर प्रयास के लिए अपनी सोच के हर चरण को लिखे। फिर, आपको उन 500 प्रयासों में से सबसे बेहतर उत्तर चुनना है।

पारंपरिक रूप से, आप केवल "बहुमत मत" (majority vote) का उपयोग करेंगे। यदि 200 छात्र कहते हैं कि उत्तर "42" है और 199 छात्र कहते हैं कि "43" है, तो आप "42" चुनते हैं, यह मानते हुए कि भीड़ आमतौर पर सही होती है। लेकिन क्या होगा यदि वे 199 छात्र, जिन्होंने "43" कहा था, काम पूरा करते समय बहुत अधिक आश्वस्त थे, जबकि वे 200 छात्र जिन्होंने "42" कहा था, शुरुआत में आत्मविश्वासी थे लेकिन आगे बढ़ते हुए भ्रमित और अनिश्चित हो गए?

यह शोध पत्र एक नया तरीका पेश करता है जिससे विजेता चुना जाता है, जिसे कॉन्फिडेंस डायनेमिक गेन (Confidence Dynamic Gain - CDG) कहा जाता है। यह कैसे काम करता है, इसे सरल उपमाओं का उपयोग करके यहाँ समझाया गया है:

1. समस्या: "स्थिर" स्कोरकार्ड (The "Static" Scorecard)

वर्तमान तरीके आत्मविश्वास को एक एकल स्नैपशॉट की तरह देखते हैं। वे पूछ सकते हैं, "औसतन, आप कितने आश्वस्त थे?" या "अंत में आप कितने आश्वस्त थे?"

  • दोष: यह यात्रा को अनदेखा करता है। एक छात्र बहुत आत्मविश्वासी हो सकता है, बीच में अपनी गलती का एहसास कर सकता है, और अंत में बहुत अनिश्चित हो सकता है। दूसरा छात्र अनिश्चित शुरू कर सकता है, तर्क के माध्यम से काम कर सकता है, और अंत में बहुत आश्वस्त हो सकता है। पारंपरिक तरीके अक्सर इस अंतर को नहीं देख पाते।

2. खोज: "कॉन्फिडेंस कर्व" (The "Confidence Curve")

शोधकर्ताओं ने कई अलग-अलग AI मॉडल पर एक ही समस्या के लिए 500 अलग-अलग सोच पथों (traces) का अवलोकन किया। उन्होंने एक आश्चर्यजनक पैटर्न देखा:

  • सही पथ (The Correct Path): जब AI उत्तर सही देता है, तो उसका आत्मविश्वास पहले चरण से अंतिम चरण तक आमतौर पर बढ़ता है। वह एक "शायद" के साथ शुरू होता है और एक "निश्चित रूप से" के साथ समाप्त होता है।
  • गलत पथ (The Wrong Path): जब AI गलत उत्तर देता है, तो उसका आत्मविश्वास अक्सर घटता है या स्थिर रहता है। वह आत्मविश्वासी शुरू हो सकता है, लेकिन जैसे-जैसे वह आगे तर्क करता है, वह "संदेहपूर्ण" या भ्रमित हो जाता है, भले ही वह अभी भी गलत उत्तर ही दे रहा हो।

उपमा: एक हाइकर (पर्वतारोही) की तरह सोचें जो पहाड़ चढ़ रहा है।

  • सही हाइकर: आधार (base) से शुरू करता है (कम आत्मविश्वास), सही रास्ता खोज लेता है, और जैसे-जैसे वह ऊपर चढ़ता है, दृश्य स्पष्ट होता जाता है, और वह अपने रास्ते के प्रति अधिक आश्वस्त हो जाता है।
  • गलत हाइकर: आधार से शुरू करता है, गलत मोड़ ले लेता है, और जैसे-जैसे वह ऊपर चढ़ता है, रास्ता धुंधला और भ्रमित करने वाला हो जाता है। उसे एहसास होता है कि वह भटक गया है, लेकिन वह फिर भी चलता रहता है, और अंत में कम आत्मविश्वास के साथ गलत शिखर पर पहुँच जाता है।

3. समाधान: "डायनेमिक गेन" स्कोर (The "Dynamic Gain" Score)

प्रस्तावित शोध पत्र एक नई मतदान प्रणाली का प्रस्ताव करता है जो केवल वोटों को नहीं गिनती है; यह आत्मविश्वास के परिवर्तन को देखती है।

  • यह कैसे काम करता है: प्रत्येक उत्तर के लिए, सिस्टम "कॉन्फिडेंस डायनेमिक गेन" की गणना करता है। यह सरल है: (अंत में आत्मविश्वास) घटा (शुरुआत में आत्मविश्वास)।
  • नियम: यदि किसी उत्तर का आत्मविश्वास सोचने की प्रक्रिया के दौरान काफी बढ़ा है, तो उसे बोनस स्कोर मिलता है। यदि आत्मविश्वास घटा है, तो उसे दंडित किया जाता है।

4. परिणाम: एक बेहतर विजेता

जब शोधकर्ताओं ने कठिन गणित प्रतियोगिताओं (जैसे AIME और HMMT) पर इस नए तरीके का परीक्षण किया, तो इस पद्धति ने "बहुमत मत" या अन्य आत्मविश्वास-जांच विधियों की तुलना में सही उत्तर को अधिक बार चुना।

  • इसने सफलतापूर्वक "हलुसिनेशन" (भ्रम/hallucinations - जो आत्मविश्वासी लग सकते हैं लेकिन गलत होते हैं) को फ़िल्टर कर दिया क्योंकि ऐसे गलत उत्तर जटिल तर्क के दौरान आत्मविश्वास में गिरावट दिखाते थे।
  • इसने सही उत्तरों को बढ़ावा दिया क्योंकि वे निश्चितता के निरंतर उदय को प्रदर्शित करते थे।

यह क्यों होता है? (सिद्धांत)

लेखक सुझाव देते हैं कि यह इस कारण से होता है कि इन AI मॉडलों को कैसे प्रशिक्षित किया जाता है।

  • "समूह" प्रभाव (The "Group" Effect): जब मॉडल को प्रशिक्षित किया जाता है, तो वह सीखता है कि केवल एक ही सही उत्तर होता है (ग्राउंड ट्रुथ)। इसलिए, सभी "सही" सोच पथ अंततः उसी एक सही उत्तर पर केंद्रित हो जाते हैं, जिससे मॉडल अंत में बहुत आत्मविश्वासी हो जाता है।
  • "अव्यवस्थित" गलत पथ (The "Messy" Wrong Paths): गलत उत्तर देने के अनंत तरीके हैं। "गलत" सोच पथ बिखरे हुए और विविध होते हैं। क्योंकि वे सभी एक ही गलत स्थान की ओर नहीं ले जाते, मॉडल को अंत में एक मजबूत, एकीकृत संकेत (signal) कभी नहीं मिलता। वह भ्रमित या अनिश्चित ही रहता है।

सारांश

संक्षेप में, यह शोध पत्र हमें सिखाता है कि AI का आत्मविश्वास समय के साथ कैसे बदलता है, यह केवल उसके अंत के आत्मविश्वास की तुलना में सत्य का एक बेहतर संकेत है। उन उत्तरों को पुरस्कृत करके जो अपनी निश्चितता में "विकसित" होते हैं और उन्हें दंडित करके जो अपना "रास्ता भटक" जाते हैं, हम मॉडल को पुन: प्रशिक्षित किए बिना AI तर्क से कहीं बेहतर परिणाम प्राप्त कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →