← नवीनतम पेपर
🤖 machine learning

LaRA: Layer-wise Representation Analysis for Detecting Data Contamination in RL Post-Training

यह शोध पत्र LaRA को प्रस्तुत करता है, जो एक लेयर-वाइज रिप्रेजेंटेशन विश्लेषण ढांचा है जो प्रवर्धित गड़बड़ी संवेदनशीलता (amplified perturbation sensitivity), दिशात्मक पतन (directional collapse) और स्थानीय कठोरता (local rigidity) जैसे ज्यामितीय विचलन की पहचान करके RL पोस्ट-ट्रेन्ड लार्ज लैंग्वेज मॉडल्स में डेटा संदूषण का पता लगाता है, जिससे यह मौजूदा आउटपुट-लेवल डिटेक्शन विधियों से बेहतर प्रदर्शन करता है।

मूल लेखक: Minju Gwak, Minseo Kwak, Dongseok Lee, Guijin Son, Alan Ritter, Jaehyung Kim

प्रकाशित 2026-05-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Minju Gwak, Minseo Kwak, Dongseok Lee, Guijin Son, Alan Ritter, Jaehyung Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "LaRA: Layer-wise Representation Analysis for Detecting Data Contamination in RL Post-Training" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी समस्या: परीक्षा में "चीट शीट" (Cheat Sheet)

कल्पना कीजिए कि आप एक प्रतिभाशाली छात्र (एक Large Language Model) को कठिन गणित के सवाल हल करने के लिए प्रशिक्षित कर रहे हैं। आप उन्हें अध्ययन करने के लिए अभ्यास पुस्तकों की एक विशाल लाइब्रेरी देते हैं। हालाँकि, उन पुस्तकों में से कुछ "अभ्यास" प्रश्न वास्तव में वही प्रश्न हैं जो उनकी अंतिम परीक्षा में आने वाले हैं।

इसे डेटा कंटैमिनेशन (Data Contamination) कहा जाता है। यदि छात्र अध्ययन करते समय परीक्षा के प्रश्नों के उत्तर रट लेता है, तो वह परीक्षा में तो बहुत अच्छे अंक प्राप्त करेगा, लेकिन उसने वास्तव में सोचना या तर्क करना नहीं सीखा है। उसने बस चीट शीट रट ली है।

लंबे समय तक, वैज्ञानिकों ने छात्र के अंतिम उत्तरों को देखकर इस चोरी को पकड़ने की कोशिश की। उन्होंने पूछा: "क्या छात्र बहुत अधिक आत्मविश्वासी लग रहा है? क्या वे बहुत जल्दी उत्तर दे रहे हैं?" (इन्हें आउटपुट-लेवल सिग्नल्स कहा जाता है)।

समस्या: "रिनफोर्समेंट लर्निंग" (RL) के नए युग में, छात्र समाधान के कई अलग-अलग रास्तों को आजमाकर सीखता है, न कि केवल शब्दों को रटकर। इस कारण, अंतिम उत्तर को देखना परीक्षा में नकल करने वाले को पकड़ने के लिए केवल उसके अंतिम ग्रेड को देखने जैसा है—यह अक्सर बहुत देर हो चुकी होती है, और नकलची आसानी से अच्छा ग्रेड दिखा सकता है।

समाधान: LaRA ("एक्स-रे" विजन)

लेखक LaRA नामक एक नई विधि प्रस्तावित करते हैं। अंतिम उत्तर देखने के बजाय, LaRA यह देखता है कि छात्र सोचने के दौरान उसके मस्तिष्क के अंदर क्या चल रहा है।

सोचिए कि छात्र का मस्तिष्क कई मंजिलों वाली एक बहुमंजिला इमारत है (लेयर्स)। जैसे-जैसे एक प्रश्न इमारत में ऊपर जाता है, प्रत्येक मंजिल पर छात्र की समझ बदलती है।

  • सामान्य सीखना: जब छात्र के सामने कोई नया प्रश्न आता है, तो उसका मस्तिष्क लचीला होता है। यदि आप प्रश्न की शब्दावली में थोड़ा सा बदलाव करते हैं (एक "परटर्बेशन"), तो उनके आंतरिक विचार स्वाभाविक रूप से बदलते और अनुकूलित होते हैं।
  • रटना (कंटैमिनेशन): जब छात्र ने उत्तर रट लिया होता है, तो उनका मस्तिष्क कठोर हो जाता है। यह एक रोबोट की तरह है जिसके पास एक प्री-रिकॉर्डेड स्क्रिप्ट है। यदि आप प्रश्न को थोड़ा सा बदलते हैं, तो रोबोट की आंतरिक स्क्रिप्ट को पता नहीं चलता कि कैसे तालमेल बिठाया जाए, या वह घबरा जाता है या अजीब तरीके से बदल जाता है।

LaRA कैसे काम करता है: तीन "परीक्षण"

LaRA एक जासूस की तरह कार्य करता है जो छात्र से एक ही प्रश्न तीन थोड़े अलग तरीकों से पूछता है और देखता है कि उनके आंतरिक मस्तिष्क तरंगों (representations) की प्रतिक्रिया कैसी होती है। वे तीन विशिष्ट चीजों को मापते हैं:

  1. "शॉक टेस्ट" (Representation Shift Magnitude):

    • उपमा: कल्पना कीजिए कि आप गणित के सवाल से जानकारी का एक मुख्य हिस्सा निकाल लेते हैं (जैसे संख्या "5" को हटाकर उसकी जगह खाली छोड़ देना)।
    • सामान्य छात्र: उनका मस्तिष्क पूरे सवाल की पुनर्गणना करता है। उनका आंतरिक "विचार पैटर्न" काफी बदल जाता है क्योंकि गणित बदल गया है।
    • नकलची: क्योंकि उन्होंने उत्तर रट लिया है, संख्या को हटाना उन्हें भ्रमित करता है या उनके मस्तिष्क में एक बहुत बड़ा, अस्वाभाविक उछाल पैदा करता है। वे उस गायब हिस्से के प्रति बहुत संवेदनशील होते हैं क्योंकि वे इस बात पर निर्भर थे कि वह वहां मौजूद रहे।
  2. "क्राउड टेस्ट" (Directional Collapse):

    • उपमा: कल्पना कीजिए कि आप 10 अलग-अलग लोगों से एक समस्या हल करने के लिए कहते हैं। उनके मस्तिष्क आमतौर पर अलग-अलग दिशाओं में चलते हैं क्योंकि हर कोई थोड़ा अलग तरह से सोचता है।
    • सामान्य छात्र: उनका मस्तिष्क एक अद्वितीय, विविध दिशा में चलता है।
    • नकलची: उनका मस्तिष्क एक एकल, कठोर दिशा में सिमट (collapse) जाता है। यह एक भीड़ की तरह है जो अचानक एक ही लय में मार्च करने लगती है। यह "कोलैप्स" इसलिए होता है क्योंकि वे केवल एक रटे हुए रास्ते को दोहरा रहे हैं बजाय नए विचारों की खोज करने के।
  3. "पैराफ्रेस टेस्ट" (Representation Stability):

    • उपमा: छात्र से वही प्रश्न पूछें लेकिन उसे पूरी तरह से अलग शब्दों में कहें (जैसे, "कितने सेब हैं?" बनाम "फलों की संख्या क्या है?")।
    • सामान्य छात्र: उनका मस्तिष्क स्थिर और सुसंगत रहता है। वे जानते हैं कि यह वही समस्या है।
    • नकलची: उनका मस्तिष्क कठोर और अपरिवर्तनीय हो जाता है। वे विशिष्ट रटी हुई शब्दावली में इतने बंधे होते हैं कि थोड़ा सा भी बदलाव उनके आंतरिक स्तर को सामान्य प्रश्नों की तुलना में "कठोर" और अस्वाभाविक बना देता है।

परिणाम: नकलचियों को पकड़ना

शोधकर्ताओं ने इसका परीक्षण कई AI मॉडलों पर किया जिन्हें रिनफोर्समेंट लर्निंग के साथ प्रशिक्षित किया गया था।

  • पुराने तरीके: पुराने "आउटपुट-लेवल" डिटेक्टर (आत्मविश्वास या संभावना की जांच करने वाले) अक्सर धोखा खा जाते थे। वे एक स्मार्ट छात्र और एक रटने वाले नकलची के बीच अंतर नहीं कर पाते थे।
  • LaRA: मस्तिष्क की आंतरिक ज्यामिति के "एक्स-रे" को देखकर, LaRA सफलतापूर्वक रटे हुए प्रश्नों को पकड़ने में सफल रहा। इसने पाया कि कंटैमिनेटेड सैंपल (नकलचरियों) के मस्तिष्क तरंगों में विशिष्ट "निशान" थे: वे गायब जानकारी के प्रति बहुत संवेदनशील थे, अपनी दिशा में बहुत कठोर थे, और पुनर्गठन (rewording) के दौरान बहुत सख्त थे।

यह क्यों महत्वपूर्ण है

यह पेपर दावा करता है कि यह जानने के लिए कि क्या एक AI वास्तव में "सीख" रहा है या केवल "रट" रहा है, हम केवल यह सुनकर नहीं जान सकते कि वह क्या कहता है। हमें यह देखना होगा कि वह कैसे सोचता है। LaRA AI की आंतरिक मस्तिष्क संरचना का ऑडिट करने का एक तरीका प्रदान करता है ताकि यह सुनिश्चित हो सके कि वह वास्तव में तर्क कर रहा है और केवल एक चीट शीट को दोहरा नहीं रहा है।

संक्षेप में: LaRA एक नया उपकरण है जो AI मॉडलों को उनकी परीक्षा में नकल करने से पकड़ता है, यह देखकर कि जब आप प्रश्नों को छेड़ते हैं, उकसाते हैं और फिर से लिखते हैं तो उनके मस्तिष्क कैसे प्रतिक्रिया करते हैं, न कि केवल उनके अंतिम उत्तरों को ग्रेड देकर।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →