← नवीनतम पेपर
💬 NLP

HE-SNR: Uncovering Latent Logic via Entropy for Guiding Mid-Training on SWE-bench

यह शोध पत्र एक डेटा फ़िल्टरिंग रणनीति और HE-SNR मीट्रिक को पेश करके SWE-bench के लिए प्रभावी मिड-ट्रेनिंग मीट्रिक्स की कमी को संबोधित करता है, जो जटिल सॉफ्टवेयर इंजीनियरिंग कार्यों के लिए लार्ज लैंग्वेज मॉडल अनुकूलन को बेहतर ढंग से निर्देशित करने के लिए एंट्रॉपी कम्प्रेशन हाइपोथीसिसिस (Entropy Compression Hypothesis) पर आधारित है।

मूल लेखक: Yueyang Wang, Jiawei Fu, Baolong Bi, Xili Wang, Xiaoqing Liu

प्रकाशित 2026-05-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yueyang Wang, Jiawei Fu, Baolong Bi, Xili Wang, Xiaoqing Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन अराजक प्रशिक्षु (apprentice) को एक मास्टर सॉफ्टवेयर इंजीनियर बनने के लिए प्रशिक्षित कर रहे हैं। आपके पास कोड की एक विशाल लाइब्रेरी (प्रशिक्षण डेटा) है, और आप यह जानना चाहते हैं कि क्या प्रशिक्षु वास्तव में जटिल समस्याओं को हल करना सीख रहा है या केवल उत्तरों के स्वरूप को रट रहा है।

यह शोध पत्र एक नया तरीका पेश करता है जिससे आप प्रशिक्षु की प्रगति की जांच कर सकें, जबकि वह अभी भी सीख रहा है, इससे पहले कि आप उसे अंतिम, महंगे "अंतिम परीक्षण" (जिसमें बहुत अधिक मानव-समान निर्देश ट्यूनिंग शामिल है) से गुजारें।

यहाँ उनकी खोज का विवरण दिया गया है, सरल उपमाओं का उपयोग करते हुए:

1. समस्या: "नकली आत्मविश्वास" का जाल (The "Fake Confidence" Trap)

आमतौर पर, जब हम जाँचते हैं कि कंप्यूटर सीख रहा है या नहीं, तो हम एक मीट्रिक का उपयोग करते हैं जिसे परप्लेक्सिटी (Perplexity - PPL) कहा जाता है। PPL को एक "आश्चर्य मीटर" (surprise meter) के रूप में समझें। यदि कंप्यूटर वाक्य में अगले शब्द से कम आश्चर्यचकित होता है, तो वह सोचता है कि वह अच्छा कर रहा है।

हालाँकि, लेखकों ने इस मीटर के साथ दो बड़ी समस्याएँ पाई हैं:

  • "लॉन्ग-कॉन्टेक्स्ट टैक्स" (The "Long-Context Tax"): जब आप कंप्यूटर को एक बहुत लंबा दस्तावेज़ (जैसे एक पूरे पृष्ठ के बजाय पूरी किताब) पढ़ने के लिए कहते हैं, तो "आश्चर्य मीटर" अनियंत्रित हो जाता है। यह ऊपर की ओर उछलता है, जिससे ऐसा लगता है कि कंप्यूटर खराब हो रहा है, भले ही वह वास्तव में स्मार्ट हो रहा हो। यह एक धावक के लिए वैसा ही है जैसे मैराथन की शुरुआत में अपने जूतों के फीते में उलझकर गिर जाना; लड़खड़ाने का मतलब यह नहीं है कि वह दौड़ नहीं सकता, लेकिन स्टॉपवॉच खराब दिखती है।
  • "रटकर याद करने वाला" बनाम "विचार करने वाला" ("Rote Memorizer" vs. "Thinker"): पुराना मीटर मुख्य रूप से उन कंप्यूटरों को पुरस्कृत करता है जो सटीक अगले शब्द का अनुमान लगाने में अच्छे हैं (जैसे किसी वाक्यांश को दोहराने वाला तोता)। लेकिन वास्तविक सॉफ़्टवेयर बग्स को हल करना सटीक अगले शब्द का अनुमान लगाने के बारे में नहीं है; यह कुछ अच्छे विकल्पों को ध्यान में रखने और उनमें से सही को चुनने के बारे में है। पुराना मीटर इस "सोचने की प्रक्रिया" को अनदेखा करता है।

2. नया विचार: "तर्कसंगत हिचकिचाहट" को मापना (Measuring "Reasonable Hesitation")

लेखक एक नया सिद्धांत प्रस्तावित करते हैं: सच्ची बुद्धिमत्ता शून्य अनिश्चितता के बारे में नहीं है; यह व्यवस्थित अनिश्चितता के बारे में है।

एक जासूस की कल्पना करें जो अपराध को सुलझा रहा है:

  • एक बुरा जासूस या तो इस बात पर 100% निश्चित होता है कि हत्यारा कौन है (कम अनिश्चितता) या 1,000 संदिग्धों के बीच पूरी तरह से खोया हुआ और बेतरतीब ढंग से अनुमान लगा रहा होता है (उच्च, अराजक अनिश्चितता)।
  • एक स्मार्ट जासूस मामले को केवल 3 संभावित संदिग्धों तक सीमित कर देता है। वे इन तीन के बीच "हिचकिचा" रहे हैं, लेकिन वे जानते हैं कि इनमें से ही कोई एक है। इसे "एन्ट्रॉपी-कंप्रेस्ड स्टेट" (Entropy-Compressed State) कहा जाता है। कंप्यूटर 100 चीजों के बारे में भ्रमित होने के बजाय, केवल 2 या 3 चीजों के बारे में आत्मविश्वास के साथ भ्रमित होता है।

3. खोज: "ln 3" की ओर बदलाव (The "Shift to ln 3")

लेखकों ने प्रशिक्षण के दौरान कंप्यूटर के मस्तिष्क का अवलोकन किया और उन्हें एक जादुई संख्या मिली: ln 3 (जो लगभग 1.1 है)।

  • प्रारंभिक प्रशिक्षण: कंप्यूटर कई विकल्पों के बारे में भ्रमित है (एन्ट्रॉपी उच्च और अस्त-व्यस्त है)।
  • स्मार्ट प्रशिक्षण: जैसे-जैसे कंप्यूटर तर्क में बेहतर होता है, उसका भ्रम "संकुचित" (compress) होता जाता है। भले ही वह तुरंत सटीक सही उत्तर नहीं जानता, फिर भी वह अपने विकल्पों को लगभग 3 विकल्पों के एक छोटे समूह तक सीमित कर देता है।
  • बदलाव: शोध पत्र ने देखा कि सबसे अच्छे मॉडल लगातार इस संख्या (ln 3) के आसपास अपने भ्रम के स्तरों में एक "पीक" (peak) दिखाते हैं। यह कंप्यूटर के कहने जैसा है, "मैं 100% निश्चित नहीं हूँ, लेकिन मैं 99% निश्चित हूँ कि यह इन तीन में से एक है।"

4. नया उपकरण: HE-SNR (द "सिग्नल-टू-नॉइज़" दिशा-सूचक)

पुराने "आश्चर्य मीटर" को ठीक करने के लिए, लेखकों ने HE-SNR नामक एक नया उपकरण बनाया।

  • यह कैसे काम करता है: यह पूछने के बजाय कि, "कंप्यूटर सटीक सही उत्तर से कितना आश्चर्यचकित है?" (जो कि पुराना तरीका है), HE-SNR पूछता है: "जब कंप्यूटर वास्तव में अटका हुआ होता है और गहराई से सोच रहा होता है, तो वह अपने विकल्पों को कितनी अच्छी तरह से सीमित करता है?"
  • शोर को फ़िल्टर करना (Filtering the Noise): उन्होंने महसूस किया कि कंप्यूटर अक्सर "शैली" (जैसे फैंसी शब्दों या फॉर्मेटिंग का उपयोग करना) से विचलित हो जाते हैं बजाय "तर्क" (वास्तविक कोड) के। इसलिए, उन्होंने शैली को अनदेखा करने और केवल कोड के कठिन, तार्किक हिस्सों को देखने के लिए एक फ़िल्टर बनाया।
  • परिणाम: यह नया दिशा-सूचक "लॉन्ग-कॉन्टेक्स्ट टैक्स" (जूतों के फीते की उलझन) और "पैरट ट्रिक्स" (रटने की कला) को अनदेखा करता है। यह केवल "तर्कसंगत हिचकिचाहट" को मापता है।

5. बड़ी आश्चर्यजनक खोज: "अलाइनमेंट टैक्स" (The "Alignment Tax")

शोध पत्र में अंतिम "निर्देश ट्यूनिंग" चरण (जहाँ मनुष्य कंप्यूटर को आदेशों का पालन करना सिखाते हैं) के बारे में कुछ आश्चर्यजनक भी पाया गया।

  • ट्रेड-ऑफ (Trade-off): जब उन्होंने कंप्यूटर को निर्देशों का पूरी तरह से पालन करने के लिए सिखाया, तो कंप्यूटर सटीक सही उत्तर का अनुमान लगाने में बेहतर हो गया (Top-1 सटीकता बढ़ गई)।
  • लागत: हालाँकि, इस प्रशिक्षण ने वास्तव में "तर्कसंगत हिचकिचाहट" को बदतर बना दिया। कंप्यूटर अन्य 2 या 3 अच्छे विकल्पों पर विचार करना बंद कर देता है और बस एक को अंधाधुंध चुन लेता है।
  • निष्कर्ष: लेखकों का सुझाव है कि कंप्यूटर को बहुत जल्दी बहुत अधिक आत्मविश्वासी बनाने के लिए मजबूर करके, हम अनजाने में उसकी जटिल समस्याओं के बारे में गहराई से सोचने की क्षमता को कुचल रहे हैं। कंप्यूटर एक बेहतर "हाँ में हाँ मिलाने वाला" (yes-man) बन जाता है लेकिन एक खराब "जासूस" बन जाता है।

सारांश

यह शोध पत्र तर्क देता है कि वास्तविक स्मार्ट सॉफ्टवेयर इंजीनियर बनाने के लिए, हमें केवल यह नहीं मापना चाहिए कि कंप्यूटर अगले शब्द का कितनी अच्छी तरह से अनुमान लगाता है। इसके बजाय, हमें यह मापना चाहिए कि वह अपने भ्रम को विकल्पों के एक छोटे, प्रबंधनीय समूह तक कितनी अच्छी तरह से सीमित करता है।

उनका नया उपकरण, HE-SNR, एक स्पॉटलाइट की तरह काम करता है जो कंप्यूटर की "शैली" और "जूतों के फीते की उलझन" को अनदेखा करता है, और केवल उसके तार्किक रूप से सोचने और अनिश्चितता को संभालने की क्षमता पर ध्यान केंद्रित करता है। यह डेवलपर्स को बेहतर मॉडल तेजी से प्रशिक्षित करने और उन मॉडलों को बनाने के जाल से बचने में मदद करता है जो आत्मविश्वासी तो हैं लेकिन वास्तव में स्मार्ट नहीं हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →