← नवीनतम पेपर
💬 NLP

Learning Evidence Highlighting for Frozen LLMs

HighLight एक ऐसा फ्रेमवर्क है जो एक हल्के "एम्फैसिस एक्टर" (Emphasis Actor) को सुदृढीकरण शिक्षण (reinforcement learning) के माध्यम से लंबे, शोर वाले संदर्भों के भीतर मुख्य साक्ष्यों के चारों ओर न्यूनतम हाइलाइट टैग डालने के लिए प्रशिक्षित करके फ्रोजन LLMs की तर्क क्षमता में सुधार करता है, जिसमें साक्ष्य लेबल की आवश्यकता नहीं होती और न ही अंतर्निहित सॉल्वर में कोई संशोधन किया जाता है।

मूल लेखक: Shaoang Li, Yanhang Shi, Yufei Li, Mingfu Liang, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Frank Shyu, Luke Simon, Sandeep Pandey, Xi Liu, Jian Li

प्रकाशित 2026-04-27
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Shaoang Li, Yanhang Shi, Yufei Li, Mingfu Liang, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Frank Shyu, Luke Simon, Sandeep Pandey, Xi Liu, Jian Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे एक जासूस हैं। आपको दस्तावेज़ों का एक विशाल, 500 पन्नों का बिखरा हुआ ढेर थमाया गया है: पुराने रसीदें, बेतरतीब डायरी के अंश, समाचार पत्रों की कतरनें और किराने की सूची। उस कागजों के पहाड़ में कहीं एक अकेला वाक्य छिपा है जो बताता है कि चोर कौन है।

भले ही आप एक बेहद बुद्धिमान जासूस (एक "लार्ज लैंग्वेज मॉडल") हों, आप भी घबरा सकते हैं। आपका ध्यान पेज 42 पर मौजूद किसी मज़ेदार रेसिपी या पेज 200 पर दी गई उबाऊ मौसम की रिपोर्ट से भटक सकता है। यह "लॉस्ट इन द मिडिल" (Lost in the Middle) की समस्या है: जब बहुत अधिक शोर (noise) होता है, तो सबसे स्मार्ट दिमाग भी मुख्य संकेत (signal) को चूक जाता है।

HiLight उस जासूस को पढ़ने शुरू करने से पहले एक हाइलाइटर पेन और एक स्मार्ट असिस्टेंट देने जैसा है।

इस कहानी के दो पात्र

यह समझने के लिए कि HiLight कैसे काम करता है, दो अलग-अलग लोगों के बारे में सोचें जो मिलकर काम कर रहे हैं:

  1. द एक्टर (स्मार्ट असिस्टेंट): यह व्यक्ति रहस्य नहीं सुलझाता। इसका एकमात्र काम 500 पन्नों को बहुत तेज़ी से सरसरी तौर पर देखना है और कहना है, "हे बॉस! पेज 12, पेज 88 और पेज 402 की ये तीन लाइनें बहुत महत्वपूर्ण लग रही हैं। मैंने इनके ऊपर नियॉन स्टिकी नोट्स लगा दिए हैं।"
  2. द सॉल्वर (प्रतिभाशाली जासूस): यह असली खिलाड़ी है। यह अविश्वसनीय रूप से बुद्धिमान है, लेकिन इसे अव्यवस्था पसंद नहीं है। यह कागजों का ढेर लेता है, केवल उन्हीं हिस्सों को देखता है जहाँ नियॉन स्टिकी नोट्स लगे हैं, और उन सुरागों का उपयोग करके केस को पूरी तरह से सुलझा लेता है।

यह अन्य तरीकों से कैसे अलग है?

HiLight से पहले, लोग जासूस की मदद करने के लिए दो अन्य तरीकों का उपयोग करते थे, लेकिन दोनों में कमियां थीं:

  • द श्रेडर (प्रूनिंग/काट-छाँट): यह तरीका समय बचाने के लिए सभी "महत्वपूर्ण नहीं" लगने वाले पन्नों को फेंक देता है। समस्या यह है कि कभी-कभी, एक पन्ना जो उबाऊ लगता है, उसमें वास्तव में एक छोटा सा सुराग हो सकता है जो दो बड़े विचारों को जोड़ता है। यदि आप उसे श्रेडर में डाल देते हैं, तो जासूस रहस्य नहीं सुलझा पाएगा।
  • द समराइज़र (कंप्रेशन/संक्षेपण): यह तरीका 500 पन्नों को 5 पन्नों के सारांश में बदलने की कोशिश करता है। समस्या यह है कि सारांश बनाने की प्रक्रिया में, आप अनजाने में अर्थ बदल सकते हैं या कोई महत्वपूर्ण विवरण छोड़ सकते हैं (जैसे "वह आदमी दोषी नहीं था" को "वह आदमी दोषी था" में बदल देना)।

HiLight ऐसा नहीं करता। यह मूल टेक्स्ट को बिल्कुल वैसा ही छोड़ देता है जैसा वह है। यह बस छोटे, अदृश्य "टैग्स" (डिजिटल हाइलाइटर मार्क की तरह) जोड़ता है ताकि जासूस को पता चल सके कि कहाँ देखना है।

"असिस्टेंट" कैसे सीखता है?

सबसे चतुर बात यह है कि असिस्टेंट (एक्टर) हाइलाइट करना कैसे सीखता है। हम असिस्टेंट को यह नहीं बताते कि, "यह महत्वपूर्ण वाक्य है।" हमारे पास उन्हें ग्रेड करने के लिए कोई शिक्षक नहीं है।

इसके बजाय, हम ट्रायल एंड एरर (रीइन्फोर्समेंट लर्निंग) का उपयोग करते हैं।

हम असिस्टेंट को कुछ हिस्से हाइलाइट करने देते हैं, फिर दस्तावेज़ जासूस को देते हैं, और देखते हैं कि क्या जासूस केस सुलझा पाता है।

  • यदि जासूस सही हल निकालता है, तो हम असिस्टेंट को कहते हैं: "बहुत बढ़िया! जो कुछ भी तुमने हाइलाइट किया था, वैसा ही और करो!"
  • यदि जासूस गलत हल निकालता है, तो हम असिस्टेंट को कहते हैं: "यह बेकार था। अगली बार कुछ और हाइलाइट करने की कोशिश करना।"

समय के साथ, असिस्टेंट सबूतों की "गंध" पहचानने में माहिर हो जाता है, भले ही उसने कभी भी कोई "सही" उत्तर कुंजी (answer key) न देखी हो।

यह क्यों मायने रखता है?

  1. यह सार्वभौमिक (Universal) है: क्योंकि असिस्टेंट केवल टेक्स्ट में निशान जोड़ रहा है, आप इसे एक प्रकार के AI पर प्रशिक्षित कर सकते हैं और फिर इसका उपयोग किसी पूरी तरह से अलग, बहुत अधिक शक्तिशाली AI की मदद करने के लिए कर सकते हैं (यहाँ तक कि GPT-4 जैसे मॉडल भी जिन्हें आप "छू" या संशोधित नहीं कर सकते)।
  2. यह तेज़ और सस्ता है: असिस्टेंट एक "लाइटवेट" मॉडल है। यह भारी-भरकम जासूस की तुलना में चलाने में बहुत तेज़ और सस्ता है।
  3. यह पारदर्शी है: यदि जासूस कोई गलती करता है, तो आप हाइलाइट्स को देख सकते हैं और समझ सकते हैं कि वे किस चीज़ को देख रहे थे। यह कोई "ब्लैक बॉक्स" नहीं है; आप उनके तर्क को देख सकते हैं।

संक्षेप में: HiLight जासूस को स्मार्ट बनाने की कोशिश नहीं करता; यह बस डेस्क को साफ कर देता है ताकि जासूस उन सुरागों पर ध्यान केंद्रित कर सके जो वास्तव में मायने रखते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →