← नवीनतम पेपर
🤖 machine learning

Probability-Entropy Calibration: An Elastic Indicator for Adaptive Fine-tuning

यह शोधपत्र RankTuner को प्रस्तुत करता है, जो एक फाइन-ट्यूनिंग फ्रेमवर्क है जो 'रिलेटिव रैंक इंडिकेटर' नामक एक नवीन 'प्रोबेबिलिटी-एन्ट्रॉपी कैलिब्रेशन' सिग्नल का उपयोग करता है, जो टोकन को गतिशील रूप से पुन: भारित (reweight) करने के लिए नियोजित किया जाता है, जिससे अंतर्निहित अनिश्चितता को ध्यान में रखते हुए वास्तव में कम सीखे गए टोकन पर ध्यान केंद्रित करके गणितीय तर्क, कोड जनरेशन और आउट-ऑफ-डिस्ट्रीब्यूशन ट्रांसफर में सुधार किया जाता है।

मूल लेखक: Wenhao Yu, Shaohang Wei, Jiahong Liu, Yifan Li, Minda Hu, Aiwei Liu, Hao Zhang, Irwin King

प्रकाशित 2026-05-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenhao Yu, Shaohang Wei, Jiahong Liu, Yifan Li, Minda Hu, Aiwei Liu, Hao Zhang, Irwin King

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शिक्षक हैं जो किसी छात्र के होमवर्क को ग्रेड दे रहे हैं। छात्र ने सैकड़ों शब्दों वाला एक लंबा निबंध लिखा है। आपका लक्ष्य उसे अगली बार सुधार करने में मदद करना है।

पुराना तरीका: "एक ही आकार सबके लिए" (One-Size-Fits--All) ग्रेडिंग
पारंपरिक रूप से, जब AI मॉडल (जैसे वे जो कोड लिखते हैं या गणित की समस्याओं को हल करते हैं) को प्रशिक्षित किया जाता है, तो कंप्यूटर छात्र के उत्तर के प्रत्येक शब्द को समान रूप से महत्वपूर्ण मानता है। यह कहता है, "यदि आपने यह शब्द गलत लिखा, तो मैं आपको बड़ा लाल निशान दूँगा। यदि आपने यह वाला सही लिखा, तो मैं आपको एक गोल्ड स्टार दूँगा।"

लेकिन यह अक्षम है।

  • "शोर" (Noise) की समस्या: कभी-कभी छात्र एक फिलर शब्द जैसे "um" या "basically" लिख देता है। ये शब्द बदले जा सकते हैं। यदि छात्र ने "essentially" के बजाय "basically" लिखा है, तो इससे कोई खास फर्क नहीं पड़ता। लेकिन पुराने तरीके भ्रमित हो सकते हैं क्योंकि AI निश्चित नहीं था कि उसे इनमें से कौन सा चुनना चाहिए, इसलिए वह इस छोटे, महत्वहीन अंतर को "ठीक" करने में समय बर्बाद करता है।
  • "महत्वपूर्ण त्रुटि" (Critical Error) की समस्या: कभी-कभी छात्र गणित की समस्या के अंतिम अंक में एक बड़ी गलती करता है। यह एक गंभीर विफलता है। पुराना तरीका इस त्रुटि को व्याकरण की मामूली चूक के समान ही भार दे सकता है, या इससे भी बुरा, यह "शोर" वाले शब्दों से विचलित हो सकता है और बड़ी गलती को मिस कर सकता है।

नया तरीका: रैंकट्यूनर (RankTuner - "स्मार्ट ग्रेडर")
यह पेपर RankTuner नामक एक नई विधि पेश करता है। केवल यह देखने के बजाय कि AI को सही शब्द के लिए कितनी संभावना (likelihood) लगी, या वह कितना भ्रमित था, RankTuner प्रत्येक शब्द पर कितना ध्यान देना है, यह तय करने के लिए दो चीजों को एक साथ देखता है:

इसे ग्रेडिंग के लिए एक दो-आयामी मानचित्र (two-dimensional map) की तरह सोचें:

  1. अक्ष 1: आत्मविश्वास (संभावना/Probability)
    • प्रश्न: "AI इस बात को लेकर कितना आश्वस्त था कि यह शब्द सही था?"
    • उपमा: यदि AI 99% सुनिश्चित था कि उत्तर "5" है, लेकिन उसने "6" लिखा, तो यह एक स्पष्ट, आत्मविश्वासी गलती है।
  2. अक्ष 2: भ्रम (एन्ट्रॉपी/Entropy)
    • प्रश्न: "AI अन्य कितने विकल्पों पर विचार कर रहा था?"
    • उपमा: यदि AI "5", "6", "7", और "8" के बीच फंसा हुआ था, तो वह बहुत भ्रमित (उच्च एन्ट्रॉपी) था। यदि वह "essentially" और "basically" के बीच फंसा था, तो वह भी भ्रमित था, लेकिन यह एक "सॉफ्ट" भ्रम था क्योंकि दोनों शब्दों का अर्थ समान है।

जादुई तत्व: "सापेक्ष रैंक" (Relative Rank)
RankTuner इन दोनों अक्षों को सापेक्ष रैंक संकेतक (Relative Rank Indicator) नामक एक एकल स्कोर में जोड़ता है।

कल्पना कीजिए कि AI एक अनुमान लगाने वाला खेल खेल रहा है। उसके पास संभावित शब्दों की एक सूची है, जो "सबसे संभावित" से "सबसे कम संभावित" के क्रम में रैंक की गई है।

  • वास्तविक उत्तर: इस सूची में सही शब्द वास्तव में कहाँ पहुँचा? (जैसे: क्या वह #1 था? #5 था? #100 था?)
  • अपेक्षित अनुमान: यदि AI को अपने भ्रम के आधार पर अंधे होकर अनुमान लगाना पड़ता, तो सही शब्द खोजने में आमतौर पर कितने अनुमान लेने पड़ते?

RankTuner इन दोनों संख्याओं की तुलना करता है।

  • परिदृश्य A ("शोर" ज़ोन): AI भ्रमित है (उच्च एन्ट्रॉपी) क्योंकि वह "basically" और "essentially" जैसे समानार्थी शब्दों के बीच चयन कर रहा है। सही शब्द सूची में #5 पर है, लेकिन AI ने उम्मीद की थी कि वह #5 के आसपास ही होगा।
    • RankTuner का निर्णय: "यह कोई बड़ी बात नहीं है। AI बस लचीला (flexible) हो रहा था। इस पर दोबारा प्रशिक्षण (retraining) में समय बर्बाद न करें।" (यह इस शब्द को कम भार देता है)।
  • परि сцена B ("महत्वपूर्ण" ज़ोन): AI को गणित की समस्या हल करनी है। वह बहुत आत्मविश्वासी (कम एन्ट्रॉपी) है कि उत्तर "5" है, लेकिन उसने "6" लिखा। सही शब्द "5" सूची में #1 पर है, लेकिन AI ने गलत शब्द लिखा।
    • RankTuner का निर्णय: "यह एक वास्तविक विफलता है! AI जानता था लेकिन उसने गलत लिखा। अपनी सारी ऊर्जा यहाँ लगाएँ!" (यह इस शब्द को उच्च भार देता है)।

यह क्यों मायने रखता है
इस पेपर ने गणित की समस्याओं और कोड जनरेशन पर इसका परीक्षण किया। उन्होंने यह पाया:

  • बेहत्तर गणित स्कोर: RankTuner के साथ प्रशिक्षित मॉडलों ने पुराने तरीकों के मुकाबले अधिक कठिन गणितीय समस्याओं को सही ढंग से हल किया।
  • कम "ओवर-करेक्शन": मॉडल हानिरहित, बदले जाने योग्य शब्दों को ठीक करने की कोशिश में भ्रमित नहीं हुए। उन्होंने वास्तविक त्रुटियों पर ध्यान केंद्रित किया।
  • सामान्यीकरण (Generalization): भले ही मॉडलों को ऐसी नई प्रकार की समस्याओं का सामना करना पड़ा जिन्हें उन्होंने पहले नहीं देखा था (जैसे शुद्ध गणित के बजाय तर्क पहेलियाँ), वे बेहतर प्रदर्शन करते रहे क्योंकि उन्होंने केवल विशिष्ट शब्दों को याद नहीं किया, बल्कि 'कैसे सीखना है' यह सीखा।

संक्षेप में
RankTuner एक ऐसे शिक्षक की तरह है जो यह अंतर जानता है कि एक छात्र लापरवाह है (एक ऐसी गलती करना जब उसे उत्तर पता था) और एक छात्र अनिश्चित है (एक कठिन अवधारणा के साथ संघर्ष करना या समान शब्दों के बीच चयन करना)। यह अनिश्चितता पर समय बर्बाद करने के बजाय अपनी ऊर्जा लापरवाही को ठीक करने पर केंद्रित करता है, जिससे अधिक स्मार्ट और अधिक सक्षम AI बनता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →