← नवीनतम पेपर
⚡ electrical engineering

Every Sample Counts: Supervised Fine-Tuning of Language Models with Pointwise Constraints

यह शोध पत्र एक नवीन सुपरवाइज्ड फाइन-ट्यूनिंग फ्रेमवर्क प्रस्तावित करता है जो एक सीखे हुए, नमूना-निर्भर रिलैक्सेशन और एक ऑगमेंटेड लैग्रेंजियन ऑप्टिमाइज़ेशन दृष्टिकोण के माध्यम से प्रति-नमूना बाधाओं को लागू करता है, जो समग्र मॉडल प्रदर्शन को बनाए रखते हुए सुरक्षा, प्राथमिकता और लंबाई नियंत्रण जैसे विविध कार्यों में टेल कंस्ट्रेंट उल्लंघनों को प्रभावी ढंग से कम करता है।

मूल लेखक: Ignacio Hounie, Ignacio Boero, Alejandro Ribeiro

प्रकाशित 2026-07-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ignacio Hounie, Ignacio Boero, Alejandro Ribeiro

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट शेफ को एक बेहतरीन सैंडविच बनाना सिखा रहे हैं। आपका लक्ष्य दोहरा है: इसे स्वादिष्ट बनाना (मुख्य उद्देश्य) और यह सुनिश्चित करना कि वह कभी भी ज़हर का उपयोग न करे (प्रतिबंध)।

लंबे समय तक, इस रोबोट को सिखाने का मानक तरीका यह देखना था कि उसके द्वारा बनाए गए सभी सैंडविच का औसत (average) क्या है। यदि रोबोट ने 99 सुरक्षित सैंडविच बनाए और 1 ज़हरीला सैंडविच बनाया, तो "औसत" अभी भी इतना सुरक्षित दिख सकता है कि वह परीक्षण में पास हो जाए। समस्या यह है कि वह एक ज़हरीला सैंडविच किसी विशिष्ट ग्राहक को मिल सकता है, और यह एक आपदा है।

यह शोध पत्र, जिसका शीर्षक है "Every Sample Counts" (हर नमूना मायने रखता है), तर्क देता है कि हमें औसत देखने के बजाय हर एक सैंडविच (प्रत्येक इनपुट) की जांच करनी चाहिए ताकि यह सुनिश्चित हो सके कि उनमें से कोई भी ज़हरीला न हो।

"औसत" सुरक्षा के साथ समस्या

लेखक बताते हैं कि वर्तमान तरीके ऐसे हैं जैसे कोई शिक्षक केवल कक्षा के अंतिम औसत ग्रेड की जांच करता है। यदि कक्षा का औसत 'A' है, तो शिक्षक खुश होता है, भले ही एक छात्र परीक्षा में पूरी तरह फेल हो गया हो। एआई (AI) की दुनिया में, इसका अर्थ है कि मॉडल "औसत पर सुरक्षित" हो सकते हैं लेकिन कठिन या दुर्लभ अनुरोधों (डेटा की "पूंछ" या "tail") पर बुरी तरह विफल हो सकते हैं।

यह पत्र स्पष्ट रूप से औसत-आधारित प्रतिबंधों या सरल निश्चित दंडों (जैसे कि "एक ही आकार का" जुर्माना) पर भरोसा करने के खिलाफ तर्क देता है। उन्होंने पाया कि भले ही आप औसत नियम को अधिक सख्त बना दें, रोबोट फिर भी कठिन कार्यों पर कभी-कभी बड़ी गलतियाँ करता है। यह पूरे हाईवे के लिए स्पीड लिमिट को सख्त करने जैसा है; तेज़ चलने वाली कारें थोड़ी धीमी हो सकती हैं, लेकिन बैक रोड्स पर चलने वाले लापरवाह ड्राइवर अभी भी तेज़ गति से गाड़ी चलाएंगे।

नया समाधान: एक व्यक्तिगत कोच

लेखक एक नया ढांचा प्रस्तावित करते हैं जिसे पॉइंटवाइज कंस्ट्रेंड फाइन-ट्यूनिंग (Pointwise Constrained Fine-Tuning) कहा जाता है। इसे रोबोट शेफ को एक व्यक्तिगत कोच देने के रूप में सोचें जो हर एक सैंडविच को बनते हुए देखता है।

  1. "हर नमूना" नियम: केवल औसत की जांच करने के बजाय, कोच यह सुनिश्चित करता है कि प्रत्येक सैंडविच सुरक्षा सीमा को पूरा करता है। यदि रोबोट एक भी सैंडविच में ज़हर इस्तेमाल करने की कोशिश करता है, तो कोच उसे तुरंत रोक देता है।
  2. ऑगमेंटेड लैग्रेंजियन (स्मार्ट दंड): यह गणित को रोबोट के दिमाग को खराब किए बिना कैसे काम करता है, इसके लिए वे "ऑगमेंटेड लैग्रेंजियन" नामक एक चतुर तकनीक का उपयोग करते हैं। कल्पना करें कि कोच केवल "नहीं!" कहकर चिल्लाता नहीं है, बल्कि गतिशील रूप से प्रशिक्षण की कठिनाई को समायोजित करता है। यदि सैंडविच को सुरक्षित बनाना आसान है, तो कोच नियमों में ढील देता है। यदि सैंडविच कठिन है, तो वह उस विशिष्ट क्षण के लिए नियमों को सख्त कर देता है। यह सुनिश्चित करता है कि रोबोट कठिन मामलों को संभालना सीखे बिना आसान वाले काम भूल न जाए।
  3. "रिलैक्सेशन" सुरक्षा वाल्व: कभी-कभी, कोई अनुरोध इतना अजीब या असंभव होता है कि नियम का पूरी तरह पालन करने से सैंडविच पूरी तरह से खराब हो सकता है (जैसे हवा से सैंडविच बनाने के लिए कहना)। लेखक एक "लर्नड रिलैक्सेशन" (सीखा हुआ ढील देना) पेश करते हैं। यह एक स्मार्ट सुरक्षा वाल्व की तरह है: कोच केवल तभी एक छोटी, गणना की गई छूट देता है जब यह बिल्कुल आवश्यक हो, लेकिन इसके लिए एक "लागत" वसूलता है। इस तरह, रोबोट क्रैश नहीं होता, लेकिन फिर भी वह नियमों का पालन करने की पूरी कोशिश करता है।

उन्होंने क्या पाया (प्रमाण)

टीम ने इस विचार का परीक्षण तीन अलग-अलग "रसोईयों" (कार्यों) पर किया:

  • टूल कॉलिंग (Tool Calling): रोबोट को यह सिखाना कि कब टूल का उपयोग करना है और कब कहना है कि "मैं यह नहीं कर सकता।"
  • सुरक्षा (Safety): यह सुनिश्चित करना कि रोबोट हानिकारक अनुरोधों को अस्वीकार करे बिना हानिरहित अनुरोधों को अस्वीकार न करे।
  • री-रैंकिंग (Re-ranking): खोज परिणामों को गुणवत्ता खोए बिना छोटा और तेज़ बनाना।

उनके प्रयोगों में, जिनमें 7 बिलियन से कम पैरामीटर्स वाले मॉडल शामिल थे (जो एक शक्तिशाली ग्राफिक्स कार्ड पर चलने के लिए पर्याप्त छोटे हैं), उन्होंने परिणामों को सावधानीपूर्वक मापा।

  • "पूंछ" (Tail) की समस्या हल हुई: जब उन्होंने गलतियों के वितरण को देखा, तो उनके तरीके (पॉइंटवाइज दृष्टिकोण) में लगभग शून्य बड़ी उल्लंघन घटनाएँ थीं। इसके विपरीत, पुराने "औसत" तरीकों में अभी भी बड़ी गलतियों की एक "लंबी पूंछ" थी। उदाहरण के लिए, सुरक्षा परीक्षणों में, उनके तरीके ने हानिकारक प्रॉम्प्ट पर 100% इनकार दर हासिल की, जबकि केवल उपयोगिता (helpfulness) स्कोर में लगभग 5% की कमी आई। पुराने तरीकों को समान सुरक्षा प्राप्त करने के लिए उपयोगिता में 9% की कमी करनी पड़ी।
  • बेहतर ट्रेड-ऑफ: उन्होंने दिखाया कि उनका तरीका एक बेहतर संतुलन (एक "पारेटो फ्रंटियर") बनाता है। यह एक तेज़ कार पाने जैसा है जो कम ईंधन भी खर्च करती है, जबकि पुराने तरीके आपको गति और ईंधन दक्षता के बीच चुनने के लिए मजबूर करते थे।
  • कोई जादू नहीं, सिर्फ गणित: लेखक सावधानीपूर्वक नोट करते हैं कि यह सब कुछ हल करने वाला कोई जादुई डंडा नहीं है। उन्होंने इन परिणामों को विशिष्ट डेटासेट (जैसे 4.5k उदाहरणों वाला "When2call" डेटासेट और 50k प्रशिक्षण इंस्टेंस वाला "MS MARCO" डेटासेट) पर मापा। उन्होंने पाया कि हालांकि यह तरीका इन विशिष्ट कार्यों के लिए बहुत अच्छा काम करता है, लेकिन सभी संभावित परिदृश्यों के लिए सैद्धांतिक गारंटी अभी भी विकसित की जा रही है क्योंकि न्यूरल नेटवर्क जटिल होते हैं और पूरी तरह से अनुमानित नहीं होते हैं।

मुख्य निष्कर्ष

यह शोध पत्र सुझाव देता है कि यदि आप वास्तव में विश्वसनीय एआई चाहते हैं, तो आप केवल औसत को नहीं देख सकते। आपको प्रत्येक एकल नमूने पर नियमों को लागू करना होगा। प्रत्येक विशिष्ट इनपुट के लिए दंड को समायोजित करने वाले एक स्मार्ट, गतिशील सिस्टम का उपयोग करके, आप "दुर्लभ लेकिन खतरनाक" विफलताओं को रोक सकते हैं बिना एआई को उसके मुख्य कार्य में खराब किए। यह "औसत पर अच्छा पर्याप्त" से "हर बार सुरक्षित" की ओर एक बदलाव है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →