← नवीनतम पेपर
🤖 AI

SimReg: Achieving Higher Performance in the Pretraining via Embedding Similarity Regularization

यह शोध पत्र SimReg का प्रस्ताव करता है, जो बड़े भाषा मॉडल (large language model) के प्रीट्रेनिंग के लिए एक एम्बेडिंग समानता नियमितीकरण (embedding similarity regularization) विधि है, जो अभिसरण (convergence) को 30% से अधिक तेजी से करने और डाउनस्ट्रीम ज़ीरो-शॉट प्रदर्शन को 1% से अधिक सुधारने के लिए इंट्रा-क्लास वेरिएंस (intra-class variance) और इंटर-क्लास समानता (inter-class similarity) को कम करता है।

मूल लेखक: Yan Sun, Guoxia Wang, Jinle Zeng, JiaBin Yang, Shuai Li, Li Shen, Dacheng Tao, DianHai Yu, Haifeng Wang

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yan Sun, Guoxia Wang, Jinle Zeng, JiaBin Yang, Shuai Li, Li Shen, Dacheng Tao, DianHai Yu, Haifeng Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य चित्र: एक रोबोट को पढ़ना सिखाना

कल्पना कीजिए कि आप एक बहुत ही स्मार्ट रोबोट (एक लार्ज लैंग्वेज मॉडल) को वाक्य में अगला शब्द अनुमान लगाने के लिए प्रशिक्षित कर रहे हैं। आप उसे लाखों वाक्य दिखाते हैं, और वह अगले शब्द का अनुमान लगाकर सीखता है। यदि वह सही अनुमान लगाता है, तो उसे एक गोल्ड स्टार मिलता है। यदि वह गलत होता है, तो उसे प्यार से "फिर से कोशिश करें" कहा जाता है।

इन मॉडल्स को आमतौर पर इसी तरह प्रशिक्षित किया जाता है: वे बस उत्तर सही करने की कोशिश करते हैं। लेकिन इस पेपर के लेखकों ने इस "गोल्ड स्टार" पद्धति के साथ एक समस्या देखी।

समस्या: "भीड़भाड़ वाले कमरे" का भ्रम

रोबोट के मस्तिष्क को एक विशाल कमरे के रूप में सोचें जहाँ उसके द्वारा जाने जाने वाले हर शब्द एक व्यक्ति के रूप में रहते हैं।

  • लक्ष्य: जो लोग दोस्त हैं (शब्द जिनका अर्थ समान है या जो एक ही श्रेणी के हैं) उन्हें पास-पास खड़ा होना चाहिए। जो अजनबी या दुश्मन हैं (अलग अर्थ वाले शब्द) उन्हें दूर-दूर खड़ा होना चाहिए।
  • वर्तमान विधि (क्रॉस-एन्ट्रॉपी): रोबोट को बताया जाता है, "सुनिश्चित करें कि आप इस विशिष्ट क्षण के लिए सही व्यक्ति को चुनें।"
  • खामी: क्योंकि भाषा बहुत लचीली है, रोबोट भ्रमित हो जाता है। वाक्य "The cat jumps over walls" (बिल्ली दीवारों के ऊपर से कूदती है) में "walls" शब्द और "A child paints near walls" (एक बच्चा दीवारों के पास पेंट करता है) में "walls" शब्द एक ही शब्द हैं, लेकिन वे पूरी तरह से अलग संदर्भों से आते हैं।
    • पुरानी विधि के तहत, रोबोट इन दोनों "walls" को कमरे के अलग-अलग कोनों में खड़े दो अलग व्यक्तियों के रूप में मानता है।
    • इस बीच, रोबोट गलती से "walls" और "ceiling" (जो अलग शब्द हैं) को एक-दूसरे के बिल्कुल बगल में खड़ा कर सकता है क्योंकि वे समान संदर्भों में दिखाई दिए थे।
    • परिणाम: कमरा एक अस्त-व्यस्त भीड़ बन जाता है। हर कोई एक-दूसरे के बहुत करीब खड़ा है, जिससे बाद में रोबोट के लिए उन्हें पहचानना मुश्किल हो जाता है।

समाधान: SIMREG (द "ग्रुप हग" रूल)

लेखकों ने SIMREG (सिमिलरिटी रेगुलराइजेशन) नामक एक नया नियम प्रस्तावित किया है। इसे प्रशिक्षण सत्र में अतिरिक्त निर्देश देने वाले एक दूसरे शिक्षक के रूप में समझें।

जबकि पहला शिक्षक कहता है, "सही उत्तर प्राप्त करें," दूसरा शिक्षक (SIMREG) कहता है:

  1. "ग्रुप हग" (समूह आलिंगन): यदि एक ही वाक्य में दो टोकन (शब्दों) का "सत्य लेबल" (मतलब वे एक ही प्रकार की चीज़ हैं) समान है, तो आपको एक-दूसरे के करीब खड़ा होना चाहिए!
  2. "सोशल डिस्टेंसिंग" (सामाजिक दूरी): यदि दो टोकन के लेबल अलग हैं, तो आपको एक-दूसरे से दूर खड़ा होना चाहिए!

यह रोबोट को अपने मानसिक कमरे को व्यवस्थित करने के लिए मजबूर करता है। केवल एक विशिष्ट वाक्य के लिए उत्तर याद करने के बजाय, यह सीखता है कि "सभी walls 'wall' पड़ोस के अंतर्गत आते हैं," चाहे वे किसी भी वाक्य में हों।

व्यवहार में यह कैसे काम करता है

उन्होंने विभिन्न आकारों के कई रोबोट ब्रेंस (LLaMA और Mixtral जैसे मॉडल्स) पर इसका परीक्षण किया।

  • तेज़ सीखना: क्योंकि रोबोट का मानसिक कमरा अब व्यवस्थित है, वह बहुत तेज़ी से सीखता है। पेपर का दावा है कि यह प्रशिक्षण की गति को 30% से अधिक बढ़ा देता है। यह एक अव्यवस्थित ढेर में किताब खोजने और एक सुव्यवस्थित लाइब्रेरी में किताब खोजने के बीच के अंतर जैसा है।
  • बेहतर प्रदर्शन: जब रोबोट का नए कार्यों (जैसे प्रश्न पूछना या तर्क पहेलियाँ हल करना) पर परीक्षण किया जाता है, तो वह बेहतर प्रदर्शन करता है। पेपर ने पाया कि मानक परीक्षणों पर औसतन 1% से अधिक का सुधार हुआ है।
  • स्थिरता: रोबोट प्रशिक्षण के दौरान भ्रमित या "क्रैश" नहीं होता है। नया नियम संगठन को स्थिर रखता है, भले ही रोबोट बड़ा और अधिक स्मार्ट होता जाए।

"चंक" (टुकड़ा) तकनीक

यह गणना करना कि कौन किसके करीब खड़ा है, कठिन है यदि आपके पास कमरे में लाखों लोग हैं। इसमें बहुत अधिक कंप्यूटर शक्ति लगती है।

  • नवाचार: लेखकों ने महसूस किया कि उन्हें एक साथ एक साथ लाखों लोगों की जांच करने की आवश्यकता नहीं है। वे कमरे को छोटे "चंक्स" (समूहों) में विभाजित कर सकते हैं।
  • परिणाम: वे समूहों को स्वतंत्र रूप से व्यवस्थित कर सकते हैं और फिर परिणामों को एक साथ जोड़ सकते हैं। यह बिना लाभ खोए मेमोरी और समय की भारी बचत करता है। यह एक कॉन्सर्ट को व्यवस्थित करने जैसा है जहाँ प्रत्येक सेक्शन (ब्रास, स्ट्रिंग्स, परकशन) अपनी पंक्तियों को खुद व्यवस्थित करता है, बजाय इसके कि 10,000 लोगों को एक विशाल लाइन में बैठाने की कोशिश की जाए।

निचोड़

यह पेपर तर्क देता है कि केवल भाषा मॉडल को "सही उत्तर प्राप्त करें" कहना पर्याप्त नहीं है। आपको उसे अपने ज्ञान को व्यवस्थित करने का तरीका भी सिखाना होगा।

एक सरल नियम जोड़कर जो समान शब्दों को एक साथ रहने और अलग शब्दों को दूर रहने के लिए मजबूर करता है, मॉडल तेज़ी से सीखता है, अधिक सटीक बनता है, और अपने "मस्तिष्क" को अधिक कुशलता से व्यवस्थित करता है। यह प्रशिक्षण रेसिपी में एक छोटा सा बदलाव है जो प्रदर्शन में बड़ा उछाल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →